跳到正文

全部动态

今日 13 条
10月6日周二
  1. Google AI(@GoogleAI)AI 评估 · 0/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google AI 发布文章:Gemini 新进展

    Google AI 在 X 平台发布一篇新文章,附链接指向 x.com 的文章页面。该帖获得 62 条回复、218 次转发、1747 个点赞,浏览量达 115832。

  2. OpenRouter(@OpenRouterAI)AI 评估 · 25/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Space Bunny Alpha 结束隐身期,正式模型即将揭晓

    Space Bunny Alpha 的隐身测试期已结束,官方感谢所有参与测试并反馈的用户,称这些反馈帮助塑造了最终模型。官方表示,Space Bunny Alpha 背后的正式模型将很快揭晓,更多信息有待公布。

10月5日周一
  1. Fireworks AI(@FireworksAI_HQ)AI 评估 · 60/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Fireworks AI 上线 DeepSeek V4.1 Flash 训练支持

    Fireworks AI 宣布 DeepSeek V4.1 Flash 现可在 Dedicated Training API 和 Managed Training 两个入口上训练。官方称它是智能体编码、终端自动化和工具调用的强基础模型,且服务成本很低,并给出了微调文档链接 docs.fireworks.ai/fine-tuning/mo…。

  2. Recraft(@recraftai)AI 评估 · 19/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Recraft V4.1 发布:自然摄影、强构图与真实日常瞬间

    Recraft V4.1 发布,主打自然摄影、强构图与真实日常瞬间,可将简单提示词转化为自然、有意图且生动的图像。该版本由 Recraft 官方账号在社交平台公布,具体参数与上线范围未披露。

  3. 向阳乔木(@vista8)AI 评估 · 64/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Black Forest Labs 发布 FLUX 3 Image,支持精准局部编辑与 JSON 布局控制

    Black Forest Labs 发布 FLUX 3 Image,主打精准局部编辑:框选区域后用文字描述修改需求,画面其余部分几乎不变。官方说明称该模型还支持用 JSON 坐标指定各元素位置的布局控制,适合排版、海报等场景,并最多可合成 10 张参考图。在线体验地址为 flux-tools.bfl.ai/precise-editing。

10月4日周日
  1. 新智元AI 评估 · 57/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Fable 5.5 首测:纯代码生成3分钟人类史短片

    外网博主 @imjustnewatai 用 Fable 5.5 输入一句提示词,生成了一部 3 分钟人类数万年进化史短片,把人类发明史压缩成一天 24 小时,从 23:40 的洞穴壁画到 00:00:00 的 2026 年,再以指数速度想象 2031 年之后。

  2. DeepLearning.AI(@DeepLearningAI)AI 评估 · 56/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    GLM-5.3 在 ExploitBench 漏洞利用任务上与 Claude Mythos 接近

    据 Anthropic 数据,开源模型 GLM-5.3 解决了 ExploitBench 漏洞利用任务中的 12%,Claude Mythos 解决 14%。本周通讯中还提到,仅花 20.40 美元的 token 就找到了 Google Chrome 的一个近期安全漏洞;Andrew Ng 对担忧这些能力落入坏人之手的人持不同看法,他认为这是工程问题,防御方长期占优。

  3. cohere(@cohere)AI 评估 · 62/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Aleph Alpha 发布 78B 参数开源模型 Kolibri

    Aleph Alpha 发布 Kolibri,参数规模 78B、激活参数 3.46B,上下文最高支持 1M tokens,权重以 Apache 2.0 许可开放,可在自有硬件上运行。Cohere 转发该消息并称其表现不错,同时预告双方将合作推出新成果。

  4. cohere(@cohere)AI 评估 · 18/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Cohere 用 WMT26 基准测试 North Small Translate

    Cohere 使用 WMT26 基准测试其翻译模型 North Small Translate,该基准在模型创建之后才发布,因此模型无法针对其指标进行训练。

  5. cohere(@cohere)AI 评估 · 31/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Cohere 推出 North Small Translate 开源机器翻译模型,1T 参数以下全球最佳

    Cohere 推出开源机器翻译模型 North Small Translate,称其为 1T 参数以下全球最佳。该模型权重与流程均对外开放,并由 Cohere 本地化负责人 Tom Kocmi 出镜讲解。

10月3日周六
  1. Kling AI(@Kling_ai)AI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Kling 4.0 与 Kling 4.0 Flash:创作者的新想象与新故事

    Kling AI 展示了创作者使用 Kling 4.0 和 Kling 4.0 Flash 生成的作品,强调新的想象、新的故事与新的创作方式。两条模型版本号分别为 Kling 4.0 与 Kling 4.0 Flash,配以 #Kling4 与 #klingai 话题发布。原文未披露参数规模、benchmark 分数或开放方式等细节。

  2. 智东西AI 评估 · 58/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    实测 MiniMax M3.1-Flash 前端能力,效果硬刚 Opus 5.5

    智东西实测 MiniMax M3.1-Flash 在动效视频、鸡尾酒动画和像素巫师等前端任务上的表现,并与 Claude Opus 5.5 对比,部分细节处理甚至更丰富。M3.1-Flash 基于 M3 系列的 1M 上下文窗口和原生多模态训练路线,能主动补全设计细节并直接交付完整可用的交互成品。该模型国庆前夕上线并开启公测,目前仍处于公测阶段。

  3. 机器之心AI 评估 · 66/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    StartLux 开源 StartLux-Decision 决策模型,0.8B 至 27B 五档版本

    StartLux(原点星辉)开源决策模型 StartLux-Decision,一次推出 0.8B、2B、4B、9B 和 27B 五档版本,并提供支持本地部署的量化模型。

  4. meng shao(@shao__meng)AI 评估 · 19/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Ling-3.1-Flash 实测:蚂蚁百灵 1M 上下文模型一把过 TE 风格信息卡

    蚂蚁百灵新一代大模型 Ling-3.1-Flash 在「Teenage Engineering 风格信息卡」提示词测试中一把过,输出效果达标。该模型为 560B/A25B MoE 架构,支持 1M token 上下文,输出速度基本维持在 100+ tokens/s,整个推理生成与校验流程约 2-3 分钟完成。

  5. NVIDIA AI(@NVIDIAAI)AI 评估 · 42/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    NVIDIA Nemotron 3 Diarization 上线 HuggingFace 并登上热门

    NVIDIA 的 Nemotron 3 Diarization 模型在 HuggingFace 上线后登上热门榜。该模型用于说话人分离,即使多人声音重叠也能追踪谁在何时说话,最多支持 8 位说话人,参数量 100M。官方感谢下载者,并回应了部分提问。

  6. Claude(@claudeai)AI 评估 · 24/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    用 Opus 5.5 打造的交互式 3D 喷气发动机,可剖切、可拆解

    有人用 Opus 5.5 做出了一个可交互的 3D 喷气发动机,支持剖切和拆解查看内部结构。该内容在浏览器中运行,原帖为视频展示形式,已获得 1563 个点赞和 25 万余次浏览。

  7. Claude(@claudeai)AI 评估 · 12/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Claude Sonnet 5.5 生成纸上折叠的立体城市

    Claude Sonnet 5.5 展示了一项生成能力:在平面画布上绘制出每栋建筑都由纸张折叠而成的立体城市。演示由 Sonnet 5.5 完成,相关视频发布在 Twitter 上。

  8. Claude(@claudeai)AI 评估 · 15/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Claude Opus 5.5 制作浮雕卡片

    Claude Opus 5.5 被用于制作浮雕卡片,相关演示以视频形式发布。该内容在社交平台获得 1256 个点赞、42 次转发和 22 条回复,浏览量约 10.2 万次。

  9. Claude(@claudeai)AI 评估 · 27/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    用 Opus 5.5 打造的 3D 网站:从银河系外一路飞掠到木星卫星

    一个 3D 网站用 Opus 5.5 实现了从银河系外飞掠到木星卫星的连续镜头。该站点可在浏览器中播放这段太空飞行视频内容。

  10. lmarena.ai(@lmarena_ai)AI 评估 · 51/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    GPT-6.1 Sol (Max) 登榜 Agent Arena 第 5 名并改写帕累托前沿

    OpenAI 的 GPT-6.1 Sol (Max) 进入 Agent Arena 榜单第 5 名,成绩提升 11.23%,并改写了帕累托前沿。其单任务成本中位数为 $0.56,性能与 GPT-6 Sol 相差 2 个百分点以内,成本低 39%。

  11. cohere(@cohere)AI 评估 · 23/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Cohere Embed 5 采用 RCP-nDCG @10 新评测方法

    Cohere 的 Embed 5 成为首个使用 RCP-nDCG @10 评测的模型家族。这一最新评测方法改进了对真实检索质量的评估,因此 Embed 5 的基准分数看起来与以往不同。

  12. lmarena.ai(@lmarena_ai)AI 评估 · 55/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Claude Sonnet 5.5 在 Agent Arena 排名第 3,单任务成本 2.74 美元

    Claude Sonnet 5.5 在 Agent Arena 排名第 3,单任务中位成本 2.74 美元,净提升分数 +12.5%。Claude Opus 5.5 排名第 2,单任务成本 1.58 美元且得分更高,这一权衡使 Sonnet 5.5 未能进入 Agent Arena 的帕累托前沿。

  13. lmarena.ai(@lmarena_ai)AI 评估 · 62/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Claude Sonnet 5.5 在 Agent Arena 首次登榜第 3

    Arena.ai 公布 Claude Sonnet 5.5 (Max) 在 Agent Arena 首次登榜即排名第 3,净提升 +12.5%,比排名第 13 的 Claude Sonnet 5 (High)(+4.4%)高出 8.1 个百分点。

  14. lmarena.ai(@lmarena_ai)AI 评估 · 46/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    本周 Arena 榜:GPT-6.1 Sol、Sonnet 5.5、Gemini 4 Argon、MiMo-V2.6-Pro 四款发布重塑 Text、Code 与 Agent 竞技场帕累托前沿

    OpenAI DevDay 后 GPT-6.1 Sol (Max) 进入 Code Arena: WebDev 排第 3,以 $8/MToken 进入帕累托前沿;同日 Sonnet 5.5 上榜后 Sol 降至第 4 并跌出前沿,Sonnet 现以低 80% 成本落后第 2 名 GPT-6 Astra (Max) 2 分。

  15. Justine Moore(@venturetwins)AI 评估 · 75/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    FLUX 3 Image 发布,作者实测九轮编辑无图像退化

    Black Forest Labs 发布 FLUX 3 Image,支持多轮精确编辑且不改变其他像素,可用 bounding boxes 指定布局、最高 4K 生成、最多 10 个参考图组合,并为企业提供商用权重,开放权重版本将在未来几周推出。Justine Moore 用一张旧 Chloe 广告实测,连续九轮替换连衣裙、沙发、墙纸、妆容和 logo 后仍保持结构,未出现 artifacts。

10月2日周五
  1. Recraft(@recraftai)AI 评估 · 11/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Recraft V4.1 生成有气场、氛围与个性的角色图像

    Recraft V4.1 可生成兼具气场、氛围与个性的角色图像,涵盖不同面孔、视角、环境与情绪,从电影感特写到全身场景,每条提示词都能形成独立的视觉故事。

  2. 爱范儿AI 评估 · 64/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    和 Opus 5.5 同题交卷,MiniMax M3.1 让 Flash 开始超纲了

    作者在 MiniMax Code 里沿用 Claude Opus 5.5 公开案例的提示词,用 MiniMax M3.1 Flash Preview 同题生成动态设计作品集。

  3. 小互(@imxiaohu)AI 评估 · 41/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Ideogram 新模型上线平台、API 与首发合作伙伴,开放权重仍是预告

    Ideogram 新模型已在 Ideogram 平台、API 和首发合作伙伴上线。开放权重仍处于即将推出的预告阶段,尚未给出具体日期。更多案例与详细介绍见 best.xiaohu.ai。

  4. 小互(@imxiaohu)AI 评估 · 61/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Ideogram 4.5 发布:主打高精度局部编辑与多轮改图一致性

    Ideogram 4.5 是主打高精度局部编辑与超强一致性的图像编辑模型,连续多轮改图时可减少偏色、细节走样和异常纹理,保留上一轮已满意的结果,而不是重新生成全新的图。它支持换色调光、改图中文字、产品换场景、老照片修复等;大图可裁出局部编辑再拼回高清原图。文中举例先给烤面包机换色,再换旁边的水果,后一次修改仍会沿用前一次已确定的机身颜色、按钮与镀铬细节。

  5. 小互(@imxiaohu)AI 评估 · 15/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Fable 5.5 要来了,看起来更强大

    Fable 5.5 即将发布,演示显示其能在连续动画中保持不同艺术风格,被形容为"超人"。相关推文由 Chetaslua 发布,并称这标志着"超级智能时代"的到来。

  6. Browser Use(@browser_use)AI 评估 · 23/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    GPT-6.1 Sol 在浏览器任务上表现惊艳,Browser Use Bench 2.1 得分超 Astra

    GPT-6.1 Sol 在 Browser Use Bench 2.1 上跑出该基准测得的最高分,超过 Astra,估算成本低 7.8 倍。其便宜的原因是 95% 的提示词 token 被缓存,而缓存 token 单价是 Astra 的 1/10。Opus 5.5 与 Grok 4.7 得分更低且成本更高。

  7. Aravind Srinivas(@AravSrinivas)AI 评估 · 65/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Perplexity 开源多模态决策模型 pplx-decider-27b 并推出 Decisions API

    Perplexity 开源多模态决策模型 pplx-decider-27b,并推出由 pplx-decider-v1-27b 驱动的 Decisions API。该模型被训练为输出固定答案集合上的概率分布而非文本,定价为每百万输入 token 4 美分、输出 token 免费,跨基准测试得分 85.71%,官方称未来几天还会进一步降价。

  8. Replicate(@replicate)AI 评估 · 73/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Black Forest Labs 发布 FLUX 3 Image,支持原生 4K 与包围框控制

    Black Forest Labs 发布 FLUX 3 Image,可生成最高 4K 分辨率图像,支持用包围框精确定位布局、一次进行多处定向编辑并在编辑间保持一致,还可使用最多 10 张参考图合成图像。该模型面向大规模图像生成的企业提供商用权重,开放权重版本将在未来几周推出,上线首周半价。Replicate 已提供该模型。

  9. Aravind Srinivas(@AravSrinivas)AI 评估 · 66/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Perplexity 开源多模态 Decision 模型并提供 Decisions API

    Perplexity 开源其多模态 Decision 模型,并通过 Decisions API 对外提供。该 API 由 pplx-decider-v1-27b 驱动,模型被训练为对固定答案集输出概率分布而非文本,输入价格为每百万 token 0.04 美元,跨基准得分 85.71%。

  10. Harrison Chase(@hwchase17)AI 评估 · 40/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Cloudflare 开源决策模型 clef 与 clef-flash,已上线 Workers AI

    Cloudflare 开源了首批自研决策模型 clef 和 clef-flash,两者已在 Cloudflare Workers AI 上线。Harrison Chase 评论称,此前就有人预言决策模型领域会迎来更多入局者,如今连开放权重也出现了,并称 harness 应该能像替换主模型一样轻松替换决策模型。

  11. Julien Chaumond(@julien_c)AI 评估 · 42/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Cloudflare 开源 clef 决策模型,workers ai 托管并登顶质量与延迟基准

    Cloudflare 的 workers ai 团队发布首个自研模型系列 clef,包含两个快速、准确的决策模型,在质量与延迟基准上登顶。模型已开源,权重可在 Hugging Face 获取(Cloudflare/clef),也可直接使用 workers ai 的托管版本。

  12. Mustafa Suleyman(@mustafasuleyman)AI 评估 · 55/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Microsoft AI 发布 MAI-Transcribe-2-Streaming 实时转写模型

    Microsoft AI 发布流式语音转文字模型 MAI-Transcribe-2-Streaming,据 Artificial Analysis 的 AA-WER Streaming 评测,其最终转写准确率与首个部分转写准确率均列第一,最终转写词错率 2.5%、语音结束后 0.13 秒返回结果。

10月1日周四
  1. Sam Altman(@sama)AI 评估 · 19/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Sam Altman:6.1 Sol 是增长最快的模型,负载下偏慢的问题已改善

    Sam Altman 表示,6.1 Sol 是迄今增长最快的模型,此前在负载下略显缓慢,现已大幅改善。原文未披露该模型的具体参数、性能数据或可用性信息。

  2. 谷歌开发者AI 评估 · 79/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google 发布 Gemini 4 Argon 前沿模型

    Google DeepMind 推出前沿 AI 模型 Gemini 4 Argon,主打复杂长流程任务中的深度推理,目前通过 Fairwind 计划向网络安全专家开放试用。

    为什么值得看

    官方披露了 Gemini 4 Argon 在软件工程、安全防御等长流程任务中的能力和定价,可据此判断前沿模型在企业工作流中的落地进展。

  3. 赛博禅心AI 评估 · 60/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    MiniMax 首个 Flash 模型 M3.1-Flash-Preview 上线

    MiniMax 上线首个 Flash 模型 M3.1-Flash-Preview,目前为预览版,未正式发布也未公布 benchmark,规格为 100 万 token 上下文、原生多模态,深度思考分 low 到 max 五档,默认 max。