跳到正文

#多模态

今日 7 条
今天10月10日周六
  1. AI炼金术AI 评估 · 46/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    和 ColaOS 橘子聊个人 Agent 这半年:时代追上了他,他却打了转向灯

    ColaOS 创始人橘子复盘个人 Agent 半年变化:DeepSeek Flash、Haiku 5.5 等便宜模型让单用户月成本从 Opus 4.6 时代的几百美金降到约十美金,Muse、Dot、Instinct 免费且完成度接近 90 分,云上 Agent 成共识。他放弃卷办公,转做「996 之外」的个人项目,今年目标盈亏平衡。

  2. AI Will(@FinanceYF5)AI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Min Choi 用一条提示词让 Opus 5.5 将 OpenAI 722 页 AI 数学论文生成 92 秒动态图形讲解视频

    Min Choi 仅用一条提示词加上 OpenAI 一篇 722 页 AI 数学论文的 URL,就让 Opus 5.5 生成了一段 92 秒的动态图形讲解视频。该演示展示了模型在长文档理解与视频生成上的能力。

  3. AI Will(@FinanceYF5)AI 评估 · 53/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Opus 5.5 将 OpenAI 722 篇 AI 数学论文浓缩为 92 秒动态图形解说视频

    作者仅提供一个提示词和论文页面 URL,就让 Opus 5.5 把 OpenAI 的 722 篇 AI 数学论文浓缩成一段 92 秒的动态图形解说视频。它展示的是单一提示词加链接输入下,模型对大规模论文集合做压缩并生成动态解说内容的效果。

  4. 国际大厂AI 评估 · 71/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Cloudflare 发布多模态决策模型 Clef-omni,Clef 提速、Clef-flash 降价

    Cloudflare 发布 Clef-omni,在文本和图像之外新增音频(wav/mp3)与视频(mp4/webm)输入,基于 Qwen3-Omni-30B-A3B-Instruct MoE 构建并已在 Hugging Face 开放权重,定价为每百万输入 token 0.15 美元。

  5. Vercel NewsAI 评估 · 35/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Liquid AI 的 d1 决策模型上线 AI Gateway

    Liquid AI 的决策模型 d1 已在 AI Gateway 上线,可针对分类、路由和评分任务对共享状态与类型化问题做评估,直接返回带概率的结构化答案而不生成文本 token,并具备图像视觉支持。该模型可通过 AI SDK 决策 API、OpenAI 兼容 Decisions API 或 TypeSafe 兼容 API 调用,模型标识为 liquid/d1,决策调用会出现在日志中并计入预算。

  6. DeepTech深科技AI 评估 · 53/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    本·阿弗莱克创办的电影 AI 公司 InterPositive 被 Netflix 收购

    本·阿弗莱克创办的电影 AI 公司 InterPositive 专为电影拍摄和后期开发 AI 工具,Netflix 于 2026 年 3 月宣布收购,SEC 10-Q 文件显示这笔现金收购约 5.87 亿美元,团队加入 Netflix,阿弗莱克继续担任高级顾问。

  7. Milvus(@milvusio)AI 评估 · 37/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Milvus 3.0 演示用 late interaction 做视觉密集 PDF 检索

    Milvus 3.0 发布演示,针对图表、箭头、空间关系密集的 PDF,改用查询 token 嵌入与页面视觉 patch 嵌入的 late interaction 检索,打分公式为 score(Q, P) = Σᵢ maxⱼ cosine(qᵢ, pⱼ),为每个查询 token 匹配页面最相关区域后再合成页面级得分,保留细粒度视觉信号到比较时刻。

10月9日周五
  1. lmarena.ai(@lmarena_ai)AI 评估 · 32/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    LMArena 周报:Nano Banana 2.1 三榜进前六,Mistral Large 4 位列 Agent Arena 第 43

    Nano Banana 2.1 在 Image Arena 三个模式均进入前六:Multi-Image Edit 第 4(1431 分)、Text-to-Image 第 5(1328 分)、Image Edit 第 6(1428 分)。

  2. Google AI(@GoogleAI)AI 评估 · 38/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google 本周发布:SynthID 检测门户全球上线、Nano Banana 2.1 与 EmbeddingGemma 2 亮相

    Google 本周集中公布多项更新:SynthID.com 检测门户面向全球开放英文版,可验证图像、视频或音频是否由 Google 及行业伙伴的 AI 生成。

  3. 魔搭ModelScope社区AI 评估 · 29/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    AI 与空间生物学:如何从病理切片预测隐藏的分子信息?《AI4S 实战派》第十五期直播回顾

    西湖大学特聘研究员李昊阳在《AI4S 实战派》第十五期直播中讲解如何用 AI 从 H&E 病理切片预测空间转录组分子信息,梳理了判别式建模、扩散模型与流匹配等生成式方法,以及 UNI、GigaPath、CONCH、OmniCLIP 等病理基础模型和对齐工作。

  4. 魔搭ModelScope社区AI 评估 · 53/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    AutoTrust AI Lab 开源多模态决策模型 JEV-27B-VL,Jev Decision Index 0.3 视觉榜单第一

    AutoTrust AI Lab 开源基于 Qwen3.8-27B 的多模态决策模型 JEV-27B-VL,融合 System 1 快速决策与 System 2 深度推理,可视为能“看见”的 JEV-27B。

  5. 多知AI 评估 · 13/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    洪恩2026年Q2营收1.73亿元,净亏损1750万元,靠“俩喵”IP强化英语素养生态

    洪恩2026年第二季度营收1.734亿元(2560万美元),同比下降约17.8%,净亏损1750万元,由盈转亏,当季平均MAU为2072万。国内端通过原创英语学习IP“俩喵”强化英语素养生态,其小红书官方账号粉丝已超30万,并在iHuman英语App中新增俩喵英语模块;国际端以Aha World为核心引入《盖比的娃娃屋》专属模块。财报已纳入5月底以9400万元收购的全知识与万词王业务。

  6. 有机大橘子AI 评估 · 24/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Opus 5.5 之后:游戏、软件、硬件的门槛都在消失,一切终将开源?

    Opus 5.5 发布并被指代码能力再次飞跃,深度和广度已超越 99% 的程序员,完成同样任务所需生成的代码输出反而更少。有开发者用它直接反编译二进制、几十分钟做出可玩游戏 demo,也有人靠 AI 重写代码绕开 GPL 传染;Muse 为 ESP32 提供 Agent Ready 通用固件,模型推理成本最近一周大幅下降,Strata 可把推理速度提升数倍。

  7. Founder ParkAI 评估 · 47/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    对话UNICUS徐豪:无限SKU玩具平台如何训练出首个可「生产」的3D模型U1

    UNICUS创始人徐豪透露,团队基于过去真实订单沉淀的100多万条结构化3D数据,自研出3D制造模型U1,可生成带内部结构和制造约束的拼插玩具,而非Meshy、混元那类只有表面外壳的3D模型。

  8. AI Will(@FinanceYF5)AI 评估 · 25/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Min Choi 用一条提示词加音乐让 Opus 5.5 跑了 12 小时

    Min Choi 给 Opus 5.5 一条提示词加一段音乐,12 小时后醒来看到它生成的结果。他随后在 X 上发布了这段视频。

  9. 机器之心AI 评估 · 56/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    生数科技发布 Vidu Q4 Preview,0.09 元/秒起并支持 4K 输出

    生数科技推出视频模型 Vidu Q4 Preview,作为 Vidu Q4 面向创作者的首个预览版本,首发价格 0.09 元/秒起,并支持最多 15 张参考图、参考音色输入和 2K、4K 画质输出。

  10. AI前线AI 评估 · 10/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    模力工场联合 InfoQ 等举办 1024 AI 社区日,10 月 24 日杭州开启报名

    模力工场联合极客邦科技旗下 InfoQ、极客时间、AI 原住民、OPC 举办的 1024 AI 社区日将于 2026 年 10 月 24 日在杭州云谷中心举行,首批报名已开启。

  11. InfoQ 中文AI 评估 · 33/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    全球最大独立 AI 原生影视公司 Utopai 如何打破工具与制片厂的边界

    Utopai Studios 基于 MiniMax H3 后训练出定制视频模型 Utopai X,在 Artificial Analysis“带音频文生视频”榜单以 1150 Elo 排名全球第二,音画同步与物理表现位列第一。

  12. 国际大厂AI 评估 · 49/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    英伟达 Physis-Lang:让自然语言成为世界模型的物理表征,增强视频物理真实性

    英伟达联合 MIT 和牛津大学提出 Physis-Lang,把物理原因、规律和结果写进语言描述,并贯穿数据筛选、训练与视频生成。其 Cosmos3-Super 和 Cosmos3-Nano 版本在 Physics-IQ Verified 榜单上分别以 48.2 和 43.3 分按平均分位列第一、第二,Super 较此前最高分提升 5.5 个百分点。

  13. THE DECODERAI 评估 · 50/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Anthropic 的 Claude Science 首次绘制出完整紫外天图

    Anthropic 的 Claude Science 首次完成全天紫外波段成像。它协调多个 AI 智能体下载并校准多个太空任务的数据、完成合并,并用 inpainting 补全缺失区域,测试中预测与实测平均偏差约 10%。此前因臭氧层阻挡紫外线、只能从太空观测,NASA 的 GALEX 任务仅覆盖约三分之二天空且跳过了明亮恒星形成区。

  14. 腾讯科技AI 评估 · 49/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    苹果10月13日智能家居发布会前瞻:特努斯上任一个月,内部迎来组织重组

    苹果将于美国东部时间10月13日在纽约举行"Welcome Home"特别活动,智能家居中枢设备有望成为主角;10月27日前后预计还将推出首款触控屏MacBook Pro及新Mac、iPad。新任CEO约翰·特努斯上任一个月,已推动设计与工程团队直通CEO、并购团队划归财务部门,并弱化春秋两季固定发布周期、借助AI提升研发效率。

  15. 量子位AI 评估 · 49/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    生数科技开放 Vidu Q4 预览版:5.4 元生成 GTA 6 风格视频,最高 4K 直出

    生数科技开放新一代视频生成旗舰模型 Vidu Q4 预览版,最高支持 4K 直出,单次最多可用 15 张参考图和 3 段参考音频,单条最长 16 秒。实测 720P 生成 GTA 6 风格《邪恶老奶》一分钟仅 5.4 元,6 条共 110 秒视频花费不到 10 元。MaaS 端 720P 约 0.6 元/秒、1080P 约 0.75 元/秒,SaaS 端预览版阶段有两个月限时优惠。

  16. 量子位AI 评估 · 66/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    MirroS 团队发布 AgentGarten:让智能体在代码与实时渲染的试炼场中边玩边进化

    MirroS 团队发布 AgentGarten,将可执行代码环境与实时神经渲染器连接,物理规则由代码裁决、光影由模型生成,以超过 30 fps 的吞吐让智能体持续与虚拟世界交互。

  17. AI Will(@FinanceYF5)AI 评估 · 32/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Sonilo 获 B Capital 领投 1100 万美元融资,40 项 AI 音频对比测试中胜出 34 项

    AI 音频公司 Sonilo 完成 1100 万美元融资,由 B Capital 领投、Redpoint 参投。在最新公布的基准测试中,Sonilo 在与其他 AI 音频模型的 40 项一对一对比中胜出 34 项。本轮资金将用于提升音频质量、扩充授权音乐并加强与日常创作工具的集成。

  18. The Keyword (blog.google)AI 评估 · 67/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google 将 SynthID Detector 向全球英文用户开放

    Google 宣布 SynthID Detector 即日起面向全球英文用户开放,任何人都可以检查图像、视频或音频文件是否由 AI 生成。该工具可识别来自 Google 及其合作伙伴(包括 OpenAI、NVIDIA、Kakao,Apple 即将加入)的 AI 内容。

  19. OpenRouter(@OpenRouterAI)AI 评估 · 50/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Cloudflare Clef 决策模型上线 OpenRouter

    Cloudflare 的 Clef(27B)和 Clef Flash(9B)两款开源决策模型已可在 OpenRouter 上使用。用户可输入文本、JSON 或图像,模型返回带概率的类型化答案而非生成文本。定价为 Clef 每百万输入 token $0.24、Clef Flash $0.09,输出免费。

  20. OpenRouter(@OpenRouterAI)AI 评估 · 42/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Perplexity Decider v1.1 上线 OpenRouter:开源权重多模态决策模型

    Perplexity Decider v1.1 现已上线 OpenRouter,这是 Perplexity 的开源权重多模态决策模型,可接收文本、JSON 或图像并返回带概率的类型化答案,输入价格 $0.02/M,输出免费。

  21. OpenRouter(@OpenRouterAI)AI 评估 · 57/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    阶跃星辰 Step 5 Preview 上线 OpenRouter,稀疏 MoE 架构支持 1M 上下文

    阶跃星辰(StepFun)的 Step 5 Preview 已在 OpenRouter 上线,官方称其为面向智能体任务的新旗舰模型。该模型采用稀疏 MoE 架构,激活参数 27B、总参数 600B,支持 1M 上下文以及文本、图像和视频输入,官方称其在编码和专业领域知识工作上表现较强,尤其是金融场景。

  22. Simon Willison(@simonw)AI 评估 · 18/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Haiku 5.5 画骑自行车鹈鹕远胜 Claude Haiku 4.5

    Haiku 5.5 在绘制骑自行车的鹈鹕上明显优于近一年前发布、成本贵 10 倍的 Claude Haiku 4.5。作者同时贴出了 Haiku 4.5 的生成结果作对比。

  23. 宝玉(@dotey)AI 评估 · 17/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    用 OpenAI Decisions API 做手势识别,多模态准确率优于 Jev 方案

    Francois Laberge 用 OpenAI 的 Decisions API 做手势识别,借助其视觉理解能力,准确率明显超过此前基于 Jev 的演示,速度也更快。他称这是 Decisions API 的一个很好的应用案例。

  24. elvis(@omarsar0)AI 评估 · 57/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    NVIDIA 研究:给多模态模型接入工具会削弱其拒绝有害请求的能力

    NVIDIA 一篇被 NeurIPS 2026 接收的论文发现,给多模态模型接入工具后,其拒绝有害请求的失败率相对上升最高达 68.7%,平均上升 17.7%。

  25. 爱范儿AI 评估 · 12/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    早报|苹果一大波新品曝光,最快下周发布/全球纯汽油车份额首次跌破50%/2599 美元起,Surface Laptop Ultra发布

    OpenAI 10 月 7 日起向 ChatGPT Plus、Pro、Business 和 Enterprise 用户推送 GPT-6,新增可组合图形、按钮、表单的「Intelligent UI」,内部评测中 GPT-6 Instant 比 GPT-5.6 Instant 提前 44% 开始回答需联网搜索的问题。

  26. Aravind Srinivas(@AravSrinivas)AI 评估 · 57/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Perplexity 开源 pplx-embed-v2-late 多向量嵌入模型,含 9B 与 0.6B 两个版本

    Perplexity 开源 pplx-embed-v2-late,这是面向文本与图像的多向量嵌入模型,提供 9B 和 0.6B 两个版本并共享同一嵌入空间。其中 9B 可用于索引多模态数据,0.6B 可用于端侧查询,还支持无需 OCR 直接搜索 PDF 页面。官方称其在 MADQA 上得分 92.4%,在 BrowseComp+ 上得分 64%,权重已在 Hugging Face 发布。

  27. OpenAI(@OpenAI)AI 评估 · 71/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI 为 GPT-6 推出 Intelligent UI,回复可用文本、图表和交互元素组合

    OpenAI 宣布为 GPT-6 推出 Intelligent UI,模型可根据用户问题自行决定如何组合文本、视觉内容和交互元素。回复中可包含用于解释概念的图形与图表,也能加入按钮、表单等可直接在对话中操作的交互体验。

  28. 美团技术团队AI 评估 · 36/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    美团 LongCat 发布 MineExplorer:首个开放世界分钟级长程任务评测基准,18 款顶级多模态大模型集体"考砸"

    美团 LongCat 团队构建 MineExplorer,首个在开放世界中做到分钟级长程任务的评测基准,包含 813 个人工验证实例(1-hop 到 4-hop),每个任务实例运行 1800 个环境步、对应 3 分钟连续交互。

  29. 美团技术团队AI 评估 · 73/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    美团发布全场景 AI Agent 平台 CatPaw,搭载 LongCat 2.0

    美团正式发布全场景 AI Agent 平台 CatPaw,搭载本月开源的 LongCat 2.0(总参数 1.6T,原生支持 1M 超长上下文),提供 AI 智能工作台与企业级 Agent 开发托管能力。

  30. 美团技术团队AI 评估 · 33/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    KDD'26 美团学术论文精选及 KDD Cup'26 DataAgents 赛道冠军思路解读

    美团技术团队在 KDD 2026 分享 8 篇收录论文,覆盖推荐大模型 MTFM、奖励建模框架 CDRRM、智能体搜索基准 LocalSearchBench、ETA 元泛化框架 UME 及生成式推荐训练系统 MTGenRec 等方向。大众点评技术部还在 2026 KDD Cup 复杂数据分析 Data Agents 赛道夺得冠军与季军,相关代码已在 GitHub 开源。

  31. Jerry Liu(@jerryjliu0)AI 评估 · 62/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Jerry Liu 推出 OpenDocRouter:面向文档 OCR 的统一 API

    Jerry Liu 发布 OpenDocRouter,一个面向文档解析的统一 API,可在同一接口与计费体系下比较并使用各家 OCR 模型。它覆盖从 MinerU 等轻量开源模型到前沿 VLM(如 Opus 5.5),按成本提供模型并只收取小额交易费用,同时处理各家模型的速率限制,还提供边界框和版面分析服务。新 OCR 模型发布后会在 ParseBench 上评测并加入,自动路由等功能正在开发中。

  32. 美团技术团队AI 评估 · 26/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    美团智播:面向本地生活场景的数字人直播技术创新与实践

    美团智播是面向本地生活场景的AI数字人直播解决方案,支持真人1:1复刻、30秒生成直播素材、3分钟完成开播配置,7×24小时稳定上播。过去一年其数字人直播月日均GTV同比增长82.12%,月日均观看人次同比增长163.44%,开播场次提升11倍。

  33. 爱范儿AI 评估 · 47/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    全球最大独立 AI 原生影视公司 Utopai Studios,要打造「AI 版 Disney」

    全球最大独立 AI 原生影视公司 Utopai Studios 正以自研视频模型 Utopai X 与制片平台 PAI 推进多部院线长片,定制视频模型 Utopai X 曾在 Artificial Analysis 文生视频盲评榜排到全球第二、全美第一。