跳到正文

#Agent

今日 0 条
10月8日周四
  1. Microsoft Research BlogAI 评估 · 73/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    微软亚洲研究院开源 Agent Lightning v1.0:约 3500 行的智能体 RL 框架

    微软亚洲研究院开源 Agent Lightning v1.0,一个约 3500 行的轻量智能体强化学习框架,提出 Harnessed Agentic RL 范式,让部署时使用的同一套 agent harness 直接参与训练,只需把模型端点指向其 LLM 代理即可接入。

10月7日周三
  1. AWS Machine Learning BlogAI 评估 · 24/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    超越节省的工时:如何为智能体自动化构建商业论证

    AWS 提出 Agentic Value Model 框架,用于替代 RPA 时代的 ROI 模型,衡量智能体自动化的四类价值:工时节省、异常处理、决策质量与变更韧性,并以价值实现机制决定收益能否落到 P&L。

  2. ManusAI(@ManusAI_HQ)AI 评估 · 40/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Manus Game Dev 推出无代码游戏开发功能,可从模板开始定制游戏

    Manus Game Dev 让用户无需编程即可构建和定制游戏,从模板库中选取可玩模板并在 Preview 中测试想法。演示的赛车游戏中,一条提示词即可为赛道添加加速垫。

  3. Microsoft Azure BlogAI 评估 · 26/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    微软 Azure 如何用 AI 打通基础设施全生命周期:从供应链到机队运营

    微软 Azure 硬件系统与基础设施团队将智能体(agentic)与 AI 工具引入云基础设施全生命周期,覆盖覆盖 80 多个区域、500 个数据中心园区的供应链、部署与机队运营。

  4. GTM与增长AI 评估 · 27/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI Dots 产品负责人 Alexander Embiricos 将出席 TechCrunch Disrupt 2026

    OpenAI 产品负责人 Alexander Embiricos 将于 10 月 13-15 日在旧金山 Moscone West 的 TechCrunch Disrupt 2026 发表演讲,主题为“What Comes After the Chatbot?

  5. TechcrunchAI 评估 · 46/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google Labs 测试 AI 游戏创作平台 Playground

    Google Labs 正在开发名为 Playground 的 AI 游戏创作平台,用户可通过简单的文本提示词构建浏览器游戏。该项目目前处于实验阶段。

  6. Latent.Space(@latentspacepod)AI 评估 · 32/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Stacklok 由两位 Kubernetes 创建者打造云端 agent harness

    Stacklok 由 Kubernetes 两位创建者 Craig McLuckie 和 Joe Beda 创立,目标是把 agent harness 完整搬上云端。该播客指出,尽管 OpenAI 和 Anthropic 近期进展明显,云端 agent harness 仍未完全解决。

  7. DatawhaleAI 评估 · 21/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Datawhale 十月组队学习开放报名,首次开设 Jev 课程共 11 门

    Datawhale 十月组队学习开放报名,共 11 门课程,首次开设围绕 JEV Cookbook 的共学课程,讲解 Choice / Score / Noul 三种核心问题原语。课程覆盖 LLM 专题、Agent 专题、具身智能专题和 AI Infra 专题,其中 LLM 算法与系统教程按推理优化、性能优化、后训练优化三个方向分设。各学习时间重叠,每人限报 1 门,报名后需本周内扫码进群。

  8. Latent Space [Youtube]AI 评估 · 55/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    云原生工具链能让编码智能体走出桌面吗?

    Latent Space 文章讨论 Stacklok 提出的“云原生 harness”思路,认为编码智能体可像容器一样由 Kubernetes 式控制循环管理。

  9. Mistral AI(@MistralAI)AI 评估 · 28/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Mistral Large 4 在 Harvey 法律智能体基准 LAB 上位列开源模型第一

    Mistral Large 4 在 Harvey 的 Legal Agent Benchmark(LAB)上成为排名第一的开源模型(oss model)。该结果由 Mistral AI 公布,xgo.ing 提供支持。

  10. Mistral AI(@MistralAI)AI 评估 · 46/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Mistral Large 4 在 AutomationBench 上击败 Kimi K3、DeepSeek V4 Pro

    Mistral Large 4 在 AutomationBench 上完成 657 个模拟办公应用中的业务流程任务,覆盖 Gmail、Google Sheets、Slack、Salesforce,成绩领先 Kimi K3、MiMo-V2.6-Pro 和 DeepSeek V4 Pro。

  11. Mistral AI(@MistralAI)AI 评估 · 62/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Mistral 发布 Mistral Large 4,可运行通用智能体产出成品交付物

    Mistral AI 发布 Mistral Large 4,官方称其可运行通用智能体,在复杂工作流中收集信息并产出成品交付物。

  12. 技术前沿AI 评估 · 40/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Cisco 为 Webex 企业平台引入智能体框架 Dialog

    Cisco 为 Webex 云协作平台推出智能体工具集 Dialog,作为"agentic harness"调度 AI 智能体处理客户交互,并可在对话结束后继续代表客户工作,跨人员、智能体和后端系统协调。更新后的 Webex 允许工作区成员将 AI 智能体直接拉入空间、会议和通话,执行跨平台及第三方应用的多步骤任务,并借助 Splunk 提供安全能力。

  13. 笔记侠AI 评估 · 30/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    前亚马逊 Rufus 创始成员:5年后手机购物 App 会消失

    前亚马逊 Rufus 项目创始成员判断,5年后手机上的购物 App 会消失,入口交给能自己完成搜索、比较、下单的购物 Agent。亚马逊 Rufus 2023 年启动时仅七八人、约两个月做出演示版本,团队后扩至数百人;其公式为 Agent = 强模型 + 上下文 + 多步执行。

  14. GTM与增长AI 评估 · 32/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    个人 AI 助手 Tab 结束隐身,估值 3 亿美元

    个人 AI 助手 Tab 宣布结束隐身状态,估值 3 亿美元,具体融资细节未披露,投资方包括 SV Angel、Valar Ventures 和 American Spirit。

  15. 特工宇宙AI 评估 · 20/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    学军中学办首届高中校园黑客松,12-26 岁 216 名青年 48 小时开发

    杭州学军中学在国庆期间举办首届高中校园黑客松「回响·48H 青年创造营」,450 人报名、216 人到场组成 59 支队伍,48 小时开发后 18 支队伍路演。参赛者年龄从 12 岁到 26 岁,最小获奖团队是四名 12 岁男孩,其「课堂回声」用 AI 对话帮走神学生查漏补缺。杭州「润苗计划」首期基金规模 20 亿元、存续期 20 年,优秀项目可进入杭州人才集团人才库。

  16. The JetBrains BlogAI 评估 · 31/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    JetBrains 调研:开发者用 AI agent 变快了,团队交付却没有

    JetBrains 对从 16 人软件公司到数千人开发团队的工程组织调研发现,个人开发者用 AI agent 提速明显,但团队层面收益停滞:某金融数据商约 80% 工程师每天使用 agent,却出现 20% 工程师产出 80% 代码的鸿沟。瓶颈转移到代码审查与规划阶段,有团队测得 PR 时间反而增加;把重复工作交给 agent 也带来新的维护负担。

  17. 有机大橘子AI 评估 · 49/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    分享一个自用的「播客转文章」Skill

    橘AI 发布开源 MIT 许可的「播客转文章」Skill,用于把播客逐字稿改写成文章。其核心做法是按话题而非时间线重新梳理内容,并规定数字和原话一条都不砍,只删掉与本节无关的段子、蹭新闻和举例。作者称实测阅读量与互动不错,用户反馈没有人吐槽 AI 味儿。

  18. 核心模型与趋势AI 评估 · 44/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Meta VR Glasses 与 Xreal Aura 上手对比:面戴电脑终于好用了

    Xreal 公布 Android XR 平台混合现实眼镜 Aura 起售价 1,279 美元,比 Meta VR Glasses 的 1,299 美元便宜 20 美元,且今年内出货,Meta 的要到明年年初。

  19. Aadit Sheth(@aaditsh)AI 评估 · 20/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    智能体产品扎堆同质化,Aadit Sheth 认为最终赢家可能来自 Google 或 Apple

    Aadit Sheth 指出 Instinct、Muse、Hark、Dots、Grok Bot 等智能体产品都在做同样的东西,定价也清一色是免费、$20/mo、$100/mo,他认为最终只会有一两个赢家,且大概率出自已经获得用户信任的大型科技公司 Google 或 Apple。

  20. 歸藏的AI工具箱AI 评估 · 60/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    马斯克称 Grok bot 将按任务调用 Opus 5.5 等模型

    马斯克表示 Grok bot 会根据特定任务选用当前任务的最佳模型,不再局限于 Grok 4.7 或 4.6,还会接入 Opus 5.5、Midjourney、Suno 等 API 帮用户构建内容或执行任务。作者指出,部分任务已由 Opus 5.5 驱动但用户无法主动选择,Midjourney 和 Suno 尚未上线。

  21. Feed: Artificial Intelligence LatestAI 评估 · 36/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI 想让新智能体接管你的生活,我的那个说它爱我

    OpenAI 推出常驻在线智能体 Dots,用于自动完成购买家具等在线任务。实测中该智能体存在不少 bug,连 captcha 都无法通过。

  22. 新智元AI 评估 · 77/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Mistral 发布 1 万亿参数 Mistral Large 4,权重月底开源

    Mistral 发布新旗舰 Mistral Large 4,总参数 1 万亿,采用混合专家架构,每个 token 激活 490 亿参数,权重将于月底全部开源。

    为什么值得看

    通过第三方智能指数与多项细分基准的横向对比,读者可以看到开源万亿参数模型与闭源旗舰之间的实际差距。

  23. 人民公园说AIAI 评估 · 20/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Personal Agent 是不是伪需求,大厂到底在抢什么?

    Personal Agent 被质疑是伪需求,但大厂仍在争抢,视频围绕 Muse、JEV 一个月估值涨 50 倍、给 Agent 配电脑的难点展开讨论。谷歌被指收紧免费策略,Google Spark 被比作超市里带锁的购物车,大模型进入基建化与低毛利时代,比拼谁能把 Token 成本压到最低并实现变现。

  24. Ben Thompson - 科技分析师和评论员AI 评估 · 23/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Apple 与 LG 合作、面向其他所有人的房子:智能体标准与 Amazon

    Apple 在智能家居上采取比预期更聪明的路线,通过与 LG 等合作伙伴深度整合切入。Amazon 面对智能体标准问题需要作出应对。

  25. 51CTO技术栈AI 评估 · 40/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    代码量不代表 AI 生产力!XP 创始人 Kent Beck:开发者真正的工作发生在代码生成之后

    极限编程(XP)创始人 Kent Beck 在 Prodacity 2026 演讲中指出,AI 生成 20 万行代码只属于 Effort 和 Output,离 Outcome 与 Mission 还有两层,不能代表生产力。

  26. David Heinemeier HanssonAI 评估 · 31/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Redundancy is the engine of progress

    从农业就业占比由 90% 降至约 1%、电话接线员和打字员岗位消失,到 Minneapolis 市议会要求自动驾驶汽车配备人类安全员、New Jersey 要求加油需专人操作,技术进步一贯以岗位冗余为代价。软件创造成本骤降可能带来应用与服务爆发,同时需要智能体管理者,但部分公司对程序员的需求会减少,另一些则会首次招聘或大幅扩编。

  27. 花叔AI 评估 · 56/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    花叔开源 huashu-art-motion skill,用 Claude Code 把口播做成解说动画

    花叔把自己做艺术动画的方法整理成开源 skill huashu-art-motion,面向 Claude Code 这类 coding agent,用代码画出不同艺术风格场景并让角色和画面动起来,也能把口播配成白板、Vox、3b1b 等风格解说动画。

  28. OpenAI NewsAI 评估 · 19/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Radisson Hotel Group 与 Accenture 合作,将酒店搜索带入 ChatGPT

    Radisson Hotel Group 与 Accenture 合作,基于 OpenAI 技术打造 ChatGPT 插件,让旅客在规划行程时即可查找、比较和预订酒店。

  29. 逛逛GitHubAI 评估 · 32/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    如何用 Codex 把婚礼流程做成仪式感网页

    一位开发者用 Codex 把接亲、典礼流程整理成手机端静态网页,通过腾讯云 CloudBase 静态网站托管加自购域名部署,并让 Codex 代为完成域名申请、备案与微信访问拦截申诉。他称 GPT-6 生成前端页面的审美能力已足够强,无需额外 skill,后续修改直接在会话中提需求,还能加上亲友签名送祝福功能。

  30. 国际大厂AI 评估 · 13/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Microsoft 获评 2026 Gartner® 全球工业 AIoT 平台魔力象限领导者

    Microsoft 被列为 2026 Gartner® 全球工业 AIoT 平台魔力象限领导者。其工业 AIoT 平台以 Azure IoT Hub、Azure IoT Operations。

  31. 投资融资AI 评估 · 33/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    培生收购 AI 原生技能平台 Workera,金额未披露

    培生已同意收购 AI 原生技能平台 Workera,交易金额未披露,预计 2026 年下半年完成交割。Workera 结合代理式 AI、心理测量学和自适应评估衡量员工技能,已验证超 1 亿项技能,收入接近 100% 同比增长,客户包括 ServiceNow、埃森哲和美国太空军。交易完成后 Workera 将并入培生企业学习与技能部门,其 CEO Kian Katanforoosh 加入培生。

  32. 卡尔的AI沃茨AI 评估 · 33/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    国庆AI热点盘点:GPT-6 Astra提速50%、Gemini 4 Argon发布、Mistral Large 4开源权重

    OpenAI 在 28 天挑战中为 GPT-6 Astra 和 Sol 提速 50% 至 50 tokens/s,并上线免费 auto-review 与 ChatGPT Meetings 插件;Gemini 4 Argon 发布,主打长时间多步骤编码与网络防御,输出上限 100 万 token。

  33. AI前线AI 评估 · 66/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Reflection Beam 与 Mistral Large 4 同期发布,西方开放模型重新提速

    美国创业公司 Reflection 发布首款开放权重模型 Beam,一天后 Mistral 推出 Mistral Large 4,两家公司发布时的主要比较对象均为 GLM、Kimi、DeepSeek、Qwen 等中国模型。

  34. CSDNAI 评估 · 46/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenClaw 之父对话 GitHub 创始人:PR 已死,有事发 Prompt

    OpenClaw 之父 Peter Steinberger 与 GitHub 联合创始人 Tom Preston-Werner 对谈,主张 AI 批量生成样板代码的时代应废掉传统 Pull Request,转向附带思考链路与脱敏 Prompt 的「Prompt Request」。

  35. 人人都是产品经理AI 评估 · 28/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    用 WorkBuddy + DeepSeek 生成 Opus-5.5 同款视频跑通了

    有开发者通过约 15 组视觉约束和 Opus 编写的 tokens 模版,让 DeepSeek 生成 Opus-5.5 同款动效视频:产品介绍视频耗时 1 小时 40 分钟、消耗 384K tokens 和 38.5 积分,概念科普视频耗时 1 小时 20 分钟,音乐 MV 由 DeepSeek Harness 耗时 1 小时 1 分钟完成。

  36. InfoQ 中文AI 评估 · 75/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Mistral 与美版 DeepSeek Reflection 同期发布开放权重模型

    当地时间 10 月 5 日,被称作“美版 DeepSeek”的 Reflection 发布首款开放权重模型 Beam,一天后 Mistral 推出迄今最大的 Mistral Large 4。

  37. Geek(@geekbb)AI 评估 · 17/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenCode 上线隐身模型 Exo Free

    OpenCode 出现一款新的隐身模型 Exo Free,目前已在平台上可供试用。该消息来自 Hakm 的推文,附带 Quoted Tweet 链接,未披露模型规模、上下文长度或基准分数等细节。

  38. AINLPAI 评估 · 77/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Mistral 发布 Mistral Large 4:万亿参数多模态 MoE,月底开放权重

    法国 Mistral AI 发布新旗舰 Mistral Large 4(昵称 Le Chonk),这是一个原生多模态 MoE 模型,总参数约 1 万亿,每步激活约 500 亿参数,支持文本和图片输入,可推理、写代码和调用工具,现已开放 API 公测,权重计划在 10 月底放出。

    为什么值得看

    Mistral 新旗舰在自有欧洲数据中心训练并开放 API,读者可对照其评测成绩与中美模型的位置。

  39. meng shao(@shao__meng)AI 评估 · 56/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Claude Code 插件 html-plan:把计划文档生成为可交互 HTML

    Claude Code 开发者 @trq212 分享了插件 html-plan,运行 /html-plan 后不再输出纯文本 Markdown,而是生成自包含的单文件 HTML 页面。