Luna 与 Astra 带动 Codex 使用量大增
OpenRouter 指出,Luna 与 Astra 正带动 Codex 使用量大幅增长。该帖互动数据为 11 条回复、1 次转发、129 个点赞、11089 次浏览,由 xgo.ing 提供支持。
OpenRouter 指出,Luna 与 Astra 正带动 Codex 使用量大幅增长。该帖互动数据为 11 条回复、1 次转发、129 个点赞、11089 次浏览,由 xgo.ing 提供支持。
Arize AI 的 Aparna Dhinakaran 将于 10 月 13 日登上 keynote 舞台,探讨当 AI 智能体承担构建工作后 AI Engineer 的角色定位,以及"好"由谁定义、如何衡量。Arize AI 是本次大会的 presenting sponsor,活动于 10 月 12 日至 14 日在纽约举行。
LangSmith Signals 上月数据显示,Claude Sonnet 5 在模型采用率上从第 9 升至第 2,使用它的组织数量增加 51%;gpt 5.6 luna 在调用足迹上从第 3 升至第 1,调用量增加 65%。两个开源权重模型进入采用率前 10,但调用量未进前列,更小更快的模型主导调用足迹。
AI模型评测平台Arena宣布完成2亿美元B轮融资,估值达31亿美元,本轮由Lightspeed Venture Partners和Khosla Ventures领投,Salesforce Ventures、a16z、Felicis等跟投。
Anthropic 的 Haiku 5.5 定价专门针对中国竞品,价格低于 DeepSeek-V4.1 flash 和智谱 GLM 5.3 flash;在 Terminal Bench 4.0 上,AA 测试比 GLM 5.3 flash 高一分,也与其他两个竞品持平或更高。歸藏批评此举“恶心”,并质疑外界因降价而淡忘 Anthropic 过往行为。
Every 已构建个人基准测试平台 Checks,帮助任何人衡量新模型在其实际工作中的表现,目前正招聘产品经理。该岗位面向理解这一方向重要性、并希望参与塑造人类借助 AI 完成工作方式的人。
LMArena 完成 2 亿美元 B 轮融资,Lightspeed 继种子轮后继续加注。Arena 年化收入已超 1 亿美元,另有数百万用户通过真实使用参与前沿模型评估。Arena 同时推出 Alignment Index,用于衡量 AI 行为在真实场景中与人类价值观的一致程度。
Arena 宣布完成 2 亿美元 B 轮融资,估值达 31 亿美元,同时推出 Arena AI Alignment Index,用于衡量 AI 智能体在真实世界中的行为表现。该公司起源于 UC Berkeley 的一个研究项目,Felicis 在其种子轮即参与投资并领投了 A 轮。
Salesforce Ventures 宣布投资 Arena 的 B 轮融资。Arena 让真实用户对匿名模型输出投票,覆盖文本、编程、视觉、图像生成和智能体任务,其排行榜被实验室用于决定训练和发布哪些模型,也被开发者用于选型。投资方强调,这套机制成立的前提是没有实验室拥有这块记分牌。
AI Engineer New York 将 10 月 12 日设为工作坊日,参会者需自带笔记本电脑,在讲师带领下动手实践智能体工作流与评估。工作坊为会议附加环节,需另行选择场次,参会者可现场提问。
Epoch AI 对比两轮 Ipsos 民调发现,报告过去 12 个月遭遇至少一次网络事件的美国成年人比例从 6 月的 46% 变为 9 月的 45%,总体无变化,也没有可统计检出的具体事件类型上升。
SemiAnalysis 对 Anthropic、OpenAI、Meta、MiniMax、月之暗面、智谱等厂商的订阅套餐做极限压力测试,结论是同等月费下 Anthropic 给用户的 Token 实际价值是 OpenAI 的 5 倍以上。
半导体和 AI 产业研究机构 SemiAnalysis 实测了 Anthropic、OpenAI 等九家的 AI 订阅套餐,在两家主推的日常主力模型上,Claude 订阅折算出的价值约为 OpenAI 的 5 倍。
Agent Arena 帕累托前沿的实时结果已可查看,访问 arena.ai/leaderboard/ag 即可查看该排行榜。
Halluminate 正在构建强化学习环境与基准,让 AI 模型掌握编程之外的知识工作,首个落地领域为金融。团队不足 10 人,已与 5 家美国头部闭源 AI 实验室中的 4 家合作,并完成 3000 万美元 A 轮融资。其路径从浏览器智能体测试延伸到金融建模等训练环境,并强调更好的验证机制比更多训练任务更关键,未来目标是构建 AI 智能体团队协作的模拟公司。
Logan Kilpatrick 表示,Google 现在在大规模模型测试上已有明显改进,多数新的 Gemini 版本在发布前会经过数千名软件工程师(SWE)为期数周的测试。他认为这有望以可观幅度缩小 benchmark 与真实表现之间的差距。
Nemotron Labs 讲述一支韩国小团队如何在开源模型上取得 AA II 得分前五。该内容以直播形式发布,正文未披露模型名称、参数规模或具体分数。
Normal 以 CAD Arena 加入 Fireworks AI 的专业智能指数(SII),把该指数扩展到工程设计领域。该基准测试 AI 智能体能否将工程图纸转成准确且可编辑的 CAD 零件,覆盖五个 CAD 平台。
FactoryAI 以 Legacy-Bench 加入 Fireworks AI 的 Specialized Intelligence Index(SII),该基准测试模型处理薪资、金融结算等遗留软件的能力。SII 持续扩容,专有基准的团队现可提交申请,通过 fireworks.ai 联系页面获取收录。
SemiAnalysis 发布 ClusterMAX 3.0,覆盖 77 家 neocloud 的详细评测,市场观察范围从 ClusterMAX 2.0 的 209 家扩大到 323 家,并访谈了 200 多名 neocloud 终端用户。
Elastic Security 在 AV-Comparatives 2026 年 Endpoint Prevention and Response(EPR)测试中获得唯一的 100% 防护得分,并在 14 家厂商中实现最低的建模运营占用与零误报。
淘天音视频技术团队自研的 H.266/VVC 编码器 S266 在第19届 MSU 世界视频编码器大赛(MSU 2025 FullHD 赛道)包揽 1 FPS、5 FPS、30 FPS 三个速度档位的 VMAF 冠军,S26X 则在 1 FPS 档位拿下 SSIM、PSNR 和主观评价三项第一,累计 6 项冠军及 1 项季军。
Latent.Space 发布 Frontier AEO 追踪器项目,用于分析 Astra 优先关注什么、使用哪些来源,以及从 Sol 到 Astra、从 Opus 到 Fable 发生了哪些变化。相关答案已收录在 latent.space/p/aeo。
SemiAnalysis 发布 TPUv7 Ironwood 在 InferenceX 预览版上的首批第三方推理结果,在与 B200/B300 的同等条件对比中,Ironwood 每美元性能最高提升 50%。
Google DeepMind 正在试点前沿 AI 的双盲评估,为行业首创。该方法构建安全环境,测试提示词与模型权重均不公开,使外部对模型的安全与性能评估保持私密、稳健且可信。
Weights & Biases 举办 LLM-Evaluator Hackathon,100 多人、15 支团队参赛,项目涵盖从文档构建与验证知识图谱、评估 LLM 的 MBTI 特质与创造力、优化评估提示词、评估多轮对话等。作者受邀担任评委并做开场分享,讨论 LLM 评估器的基线、打分方式、评估指标及评估器与 guardrail 的取舍。冠军团队每人获得一副 Meta Ray-Bans。