LMArena 周报:Nano Banana 2.1 三项图像榜进前六,Mistral Large 4 登 Agent Arena 第 43
Nano Banana 2.1 在 Image Arena 三个模式均进入前六:Multi-Image Edit 第 4(1431 分)、Text-to-Image 第 5(1328 分)、Image Edit 第 6(1428 分)。
Nano Banana 2.1 在 Image Arena 三个模式均进入前六:Multi-Image Edit 第 4(1431 分)、Text-to-Image 第 5(1328 分)、Image Edit 第 6(1428 分)。
Arena.ai 推出 Arena Alignment Index,基于 27 个模型、9 万多条真实智能体会话,从越权操作、错误归因、虚假完成三项信号衡量智能体安全与对齐。GPT-6.1-Sol 以 87.9 分居首,Claude-Opus-5.5(83.2)和 Grok-4.7(82.7)紧随其后,OpenAI 三项信号发生率最低。各实验室新一代模型均优于前代,且对话越长错位风险越高。
Cohere 将于下周在巴黎举办技术聚会,讨论其研究与工程方向。活动由 Cohere 训练整合总监分享,招聘人员也将在现场介绍在 Cohere 工作的体验,报名通道已开放。
Gamma 的 Grant Lee、Engine 的 Elia Wallen 和 Google Ventures 的 Crystal Huang 将在 TechCrunch Disrupt 2026 同台,分享初创公司如何获取前 1000 个客户。活动现已开放注册,报名最多可省 100 美元,第二张门票享受 5 折。
Kevin Roose 与研究员 Jasmine Sun 做客 ChinaTalk,讲述他新书《The AGI Chronicles》中 OpenAI、Anthropic、DeepMind 的历史,以及那群过度思考并担忧人工智能的人。Kevin 此前供职于《纽约时报》。
JetBrains Marketplace 现向插件作者开放归因于其插件的 UI 冻结报告,可在插件管理页的 Freezes 标签页查看,但需先在插件中注册 Marketplace 错误处理器(该处理器自 IntelliJ Platform 2023.3 起可用)。
Matthieu Lapeyre 透露,Microduck 换用新定制电路板后,在 2600 mAh 电池上自主行走、站立、坐下直至耗尽电量,续航超过 3 小时。平均电池电流从约 1.13 A 降至约 0.82 A,减少约 28%;峰值 CPU 温度从 114°C 降至 60°C,测试全程零热节流。此前 Radxa 原型板存在热管理问题,运行 20 分钟即降频并因过热关机。
有了 Grok bot 后,作者让它在 Notion 里搭建了一个自媒体看板,把做了很久自媒体却一直没监控的数据指标建了起来,前后只花了 15 分钟。
Dot.已为全新的 iPhone Duo 做好准备,可随设备横竖之间展开,带来更完整的显示效果。同时,Quote/0 摘录功能也增加了更多玩法。
Simon Willison 发布了一条示例提示词(example prompt),该帖获得 7 条回复、3 次转发、38 个点赞和 10790 次浏览。
一条短帖称"别说 AI 时代,也是省钱了",帖内仅有互动数据(评论 9、转发 0、点赞 6、阅读 5113),未给出具体的省钱对象、产品或价格信息。
Qwen 官方账号发布了一条「Pics」图文帖,帖内标注了互动数据:6 条回复、4 次转发、127 次点赞、24224 次浏览、19 次收藏。该帖由 xgo.ing 提供支持。 (说明:原文除互动数据与「Pics」外无实质技术信息,故摘要仅陈述可核验事实,未补充任何模型版本、参数或功能。)
阿里发布 Qwen-Image-2.1-Turbo,基于 Qwen-Image-2.1 的加速 checkpoint,沿用同一 7B 视觉生成架构,仅需 8 步去噪即可生成和编辑图像。
Qwen 发布了一条内容更新,未披露具体模型或产品信息。该帖获得 81 次点赞、2 条回复和 16916 次浏览。
正行创新发布面向零售场景的Physical AI解决方案,公开双足人形机器人H1和轮式双臂搬运理货机器人C1两款自研本体,以及世界动作模型SLM-0.5、强化学习体系STEAM和智能体Rpent组成的具身大脑。
Crunchbase 数据显示,今年截至 9 月 29 日风投系 AI 公司对 AI 创企的收购已达 195 起,比 2025 年全年高出 14%。OpenAI 是过去三年最活跃的收购方,共完成 20 笔 AI 相关收购,其中 10 笔发生在今年;Anthropic、法律 AI 创企 Legora 各完成 5 起。
移动电信领域可能正在酝酿一场新战役。另据消息,neocloud 公司 Firmus Grid 已撤回 IPO。
约翰斯·霍普金斯大学天体物理学家、Anthropic 研究员 Brice Ménard 使用 Claude Science 做出首张完整全天紫外地图,其中约三分之一天空从未被紫外望远镜观测过,由 Claude 预测补齐,并为每个像素标注实测或预测及误差估计。
Deno 官方宣布加入 Cloudflare,作者引述称 Deno Runtime 在维护一年后就会停止。作者还提到 Cloudflare 正把 Astro、VoidZero 等整条 JavaScript 链路收进自家平台,认为开源项目最好的出路是被收购。
Google 本周集中公布多项更新:SynthID.com 面向全球开放英文版,可检测图片、视频、音频是否由 Google 及行业伙伴的 AI 生成;Nano Banana 2.1 在视觉设计、主体一致性和精准局部编辑上提升,可只改细节而不动整图;EmbeddingGemma 2 是首个原生多模态开放模型,把文本、图像、视频、音频和代码统一到同一空间用于端侧嵌入。
Snyk 基于 LangChain 和 LangGraph 构建了 Snyk Assist,已处理 60k 次查询、服务 500+ 客户账户。85%+ 的会话无需提交支持工单即得到解决,另有 250+ 案例被自动检测并升级至对应团队。该系统的可观测性由 LangSmith 提供。
监控公司 Flock 正在裁员,该公司未透露 CEO Garrett Langley 是否会随裁员降薪。此次裁员发生之际,围绕其监控技术的隐私争议持续升温。
Walmart 撤销了此前对门店订单履行推车设定的高度限制。该限制曾影响门店员工拣货与打包作业,此次调整恢复了推车使用的原有标准。
Simon Willison 用 ChatGPT 桌面版 Codex 标签页的语音对话模式,在做饭的半小时里边聊边让 GPT-6 Astra High 为博客搭出 Newsletters 页面,包括新 Django 模型与迁移、四个导入脚本、/newsletters/ 归档页和站内搜索集成。
鲲为科技完成近4亿元新一轮融资,新增股东包括XVC、红杉中国,老股东夏尔巴、腾讯持续加仓。该公司用低频探头让声波穿过完整颅骨,再依靠GPU算力和模型完成空间重构,实现无创全脑实时成像;2024年拿到国内首张颅脑超声注册证,2025年拿到欧盟认证,第四季度启动商业化当季签下约数千万元订单。
10月9日,扩散智能DiffuSpace宣布已连续完成两轮融资,由经纬创投、顺为资本、君联资本联合领投,中科创星、华为哈勃、地平线等跟投,总金额达数亿元。DiffuSpace于2026年5月在深圳成立,团队研发的Dream 7B扩散语言模型部分能力可比肩DeepSeek V3(671B),目前正在训练新一代更大参数规模的模型并计划近期开源。
15 支 10 秒短片全部由 Claude Opus 5.5 写代码生成,每支一种风格,画面、动画、音乐和音效均出自代码。相关项目已发布在 GitHub(Vincentwei1021)。
Nubank 的 Aman 与 snowglobe_so 的 Shreya 展示了如何在真实上线实验前,用模拟环境测试银行客服智能体。该分享来自 World's Fair 2026 的录制内容,相关场次将于 10 月 12 日至 14 日在纽约举行。
Aether AI 发布 CRIS-0,把因果智能体与因果世界模型在统一因果状态表示下打通,通过统一工具接口调度机械臂完成家庭任务。在咖啡、微波炉、垃圾分拣等真机测试中,系统面对物体移位等扰动平均 2 秒内重置规划,10 次强干扰测试成功恢复 9 次,长程任务靠阶段验证制切断误差累积。公司称目前跑通技术四层金字塔的前两层,后续需补上消融实验数据与更复杂环境下的泛化验证。
Simon Willison 称自己一边做晚饭,一边全程用语音通过 Codex Desktop 为个人博客开发出一个新功能。他将这一过程记录在 simonwillison.net 的博文中。
这份指南覆盖 Claude Motion 与 Claude Dashboards 的上手流程,包含 Dashboards 实战与避坑要点、Motion 核心工作流,以及如何从一句话需求写出可交付的视频提示词。文中还拆解了官方单车案例的 81 秒演示业务闭环,并附新手交付前实操检查清单。
Claude 发布实时数据看板 Claude Dashboards 和代码驱动动态解说工具 Claude Motion。Dashboards 可直接接入企业数仓或 CRM,用自然语言提问生成联动的业务看板,并随底层数据变动自动刷新;Motion 把报告、图表或产品演示转成短动画并导出 MP4,由 Claude 用代码为文字、图表、形状和图片编排动画,可编辑具体文字、数字与节奏。
Nano Banana 2.1 已在 Lovart 上线,主打商业广告视觉质量提升,在图像质量、一致性与控制力上完成升级。新版本改进光线交互的准确性、人像皮肤纹理的真实感,并提升文字排版的准确度与层级清晰度。
Google AI Studio 推出新一代图像生成模型 NanoBanana 2.1,官方称其在各项指标上均优于此前模型,包括更好的视觉设计、基于蒙版的编辑、主体一致性以及更自然的画面。该模型已在 ai.studio 开放试用,另有创作者用 Lovart 基于该模型生成图像并评价效果自然。
一段猫咪换装转场视频由 NanoBanana2.1 与 Seedance2.5 组合生成。该内容由 LovartAI 在 X 上发布,附带的视频需在支持 video 标签的浏览器中观看,发布时获得 8 条回复、2 次转发和 37 个赞。
受 Product Hunt 产品 DeTV 启发,作者用 Grok bot 协作、豆包播客 API 开发出一档 AI 播客,由双人主播播报 Hacker News、GitHub Trending、卡兹克 AI Hot 热门新闻及 Product Hunt 热门产品。在线电台地址为 aitv.qiaomu.ai,代码已在 github.com/joeseesun/aitv 开源。
向阳乔木推出 aitv,提供在线体验地址 aitv.qiaomu.ai,并在 GitHub 开源,仓库地址为 github.com/joeseesun/aitv。
西湖大学特聘研究员李昊阳在《AI4S 实战派》第十五期直播中讲解如何用 AI 从 H&E 病理切片预测空间转录组分子信息,梳理了判别式建模、扩散模型与流匹配等生成式方法,以及 UNI、GigaPath、CONCH、OmniCLIP 等病理基础模型和对齐工作。
AutoTrust AI Lab 开源基于 Qwen3.8-27B 的多模态决策模型 JEV-27B-VL,融合 System 1 快速决策与 System 2 深度推理,可视为能“看见”的 JEV-27B。
资深贸易记者 Alan Beattie 与经济专栏作家 Soumaya Keynes 将于 10 月 15 日(周四)下午 1 点(BST)举行直播问答,回答读者关于欧盟与美国谁在与中国的贸易战中表现更好的提问。