跳到正文

全部动态

今日 0 条
10月9日周五
  1. lmarena.ai(@lmarena_ai)AI 评估 · 27/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Salesforce Ventures 投资 Arena 的 B 轮融资

    Salesforce Ventures 宣布投资 Arena 的 B 轮融资,Arena 通过真实用户对匿名模型输出投票,覆盖文本、编程、视觉、图像生成和智能体任务。各实验室借助 Arena 排行榜决定训练和发布哪些模型,开发者则据此决定采购对象,其评分板的中立性被认为是其在 AI 生态中占据关键角色的原因。

  2. Anthropic(@AnthropicAI)AI 评估 · 62/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Anthropic 发布 Claude Haiku 5.5,称运行成本比 Haiku 4.5 低约 75%

    Anthropic 发布 Claude Haiku 5.5,称其是迄今最便宜、最快、能力最强的小模型。官方表示,它的平均运行成本比 Claude Haiku 4.5 低约 75%。

  3. cohere(@cohere)AI 评估 · 20/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Cohere Compass Cloud 开启私有测试,面向企业团队招募早期访问

    Cohere 宣布将搜索与检索平台 Compass 推向云端,Compass Cloud 目前处于私有测试阶段,主打以更低开销获得优质检索效果。该版本面向希望提前访问的企业团队开放申请。

  4. cohere(@cohere)AI 评估 · 8/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Cohere 开放 Compass 项目申请

    Cohere 开放 Compass 项目申请通道,申请入口为 cohere.com/compass。原文未披露该项目的具体内容、参与条件与时间安排。

  5. Satya Nadella(@satyanadella)AI 评估 · 4/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Satya Nadella 分享 Windows 体验相关公告

    Satya Nadella 在 X 上发帖,引导读者通过 blogs.windows.com/windowsexperie… 了解更多公告内容。该帖获得 193 个点赞、26 次转发和 12 条回复,浏览量约 50850 次。原文未披露公告的具体内容。

  6. Satya Nadella(@satyanadella)AI 评估 · 78/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    微软为 Windows 引入 MAI-Code-1.1 Flash 与端侧智能体能力

    微软宣布为 Windows 带来无限量的智能能力,让每台 PC 成为智能体可安全代劳的工作环境。其中 MAI-Code-1.1 Flash 是 137B 参数编码模型,具备 256K 上下文窗口,并针对在 PC 上运行做了优化。

    为什么值得看

    微软把编程模型放到本地 PC 上运行并交给 Copilot 调用,读者可以据此判断端侧智能体开发方式的走向。

  7. AWS Machine Learning BlogAI 评估 · 19/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    AWS 发布六周 Playbook:让非工程背景员工用 Amazon Bedrock 构建 AI 智能体

    AWS 推出一个为期六周的 AI 构建能力培养项目,参与者每周投入约 4 小时,用 Amazon Bedrock 与 Amazon Bedrock AgentCore、Strands Agents SDK 等生产级工具搭建可运行的 AI 原型。

  8. AWS Machine Learning BlogAI 评估 · 27/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Qlik 如何用 Amazon Bedrock 构建可溯源的企业级 AI

    Qlik 基于 Amazon Bedrock 打造 Qlik Answers,让员工用自然语言提问并获得带来源的可信回答。其 Discovery Agent 上线以来为客户发现超过 100,000 条异常与离群点,Lintech International 索引了 17,000 多份技术文档,响应速度提升 75%,业务经理每周节省最多 7 小时。

  9. LangChain(@LangChainAI)AI 评估 · 5/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Tavily 赞助 Interrupt London,展示 AI 智能体联网方案

    Tavily 赞助 Interrupt London,并在活动期间设立展位,展示如何将 AI 智能体连接到网络。活动由 LangChain 发布消息,互动数据为 13 个点赞、5 条回复、2 次转发。

  10. LangChain(@LangChainAI)AI 评估 · 2/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    LangChain 公布 Interrupt 智能体大会并开放 RSVP 报名

    LangChain 公布其智能体大会 Interrupt,并开放 RSVP 报名,报名与详情页面为 interrupt.langchain.com/london。该推文同时 @ 了 Tavily,呼吁其了解会议信息。

  11. LangChain(@LangChainAI)AI 评估 · 8/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    LangChain 的 Harrison Chase 将于 10 月 13 日发表 Interrupt London 主题演讲

    LangChain 的 Harrison Chase(@hwchase17)将于 10 月 13 日发表 Interrupt London 主题演讲。活动页面已开放 RSVP,报名地址为 interrupt.langchain.com/london/ldn-liv。

  12. LangChain(@LangChainAI)AI 评估 · 20/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    LangSmith Engine v2 新功能:红队测试智能体、检测更多问题类型、自动验证修复方案

    LangSmith Engine v2 新增三项能力:对 AI 智能体进行红队测试、检测更多问题类型,以及自动测试提出的修复方案。@bentannyhill 在 Interrupt NYC 场次中讲解了这些更新及 LangChain 改进智能体的思路,完整视频已在 YouTube 发布。

  13. LangChain(@LangChainAI)AI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    什么是 agent skill?LangChain 两分钟讲清如何保护智能体上下文窗口

    LangChain Academy 发布了一个两分钟讲解视频,解释什么是 agent skill,以及它如何保护智能体的上下文窗口。该内容出自 LangChain 的 Deep Agents 课程,课程地址为 academy.langchain.com/courses/founda…。

  14. LangChain(@LangChainAI)AI 评估 · 49/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    LangChain 发布 Managed Deep Agents v0.9,新增 Schedules SDK 与按运行配置

    LangChain 发布 Managed Deep Agents v0.9,新增 Schedules SDK,让智能体可在对话中自行创建提醒、跟进和周期性任务。该版本支持按每次运行选择模型、技能、MCP 服务器和沙箱,使单次部署即可服务不同团队或代码仓库;智能体在启动运行时会通过 Slack Reactions 回应消息。

  15. LangChain(@LangChainAI)AI 评估 · 30/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    LangChain 重构 Deep Agents 的 skills,将其确立为智能体领域知识标准

    LangChain 对 Deep Agents 的 skills 进行重构,以应对各方团队日益将 skills 视为向智能体提供领域知识标准的需求增长。官方称此次改版针对不断上升的实际使用需求。

  16. Jerry Liu(@jerryjliu0)AI 评估 · 57/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    LlamaIndex 推出 OpenDocRouter 文档解析统一 API

    Jerry Liu 发布 OpenDocRouter,一个面向文档解析的统一 API,接入最新的前沿模型和开放权重模型,将文档转写为 markdown。它按成本价提供各模型并收取小额交易抽成,同时处理各家模型的速率限制、提供边界框与版面分析服务,新 OCR 候选模型会在 ParseBench 上评测后加入。该产品已上线 opendocrouter.ai,自动路由等改进正在开发中。

  17. Jerry Liu(@jerryjliu0)AI 评估 · 1/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Jerry Liu 谈高能动性:毫无辣度耐受仍挑战 Hot Ones 连吃 9 只鸡翅

    Jerry Liu 用亲身经历解释什么叫高能动性:在完全没有辣度耐受的情况下挑战 Hot Ones,硬扛下 10 只辣鸡翅中的 9 只。该帖获 4 条回复、1 次转发、11 个赞,浏览量 2765。 (说明:原文为一条社交媒体短帖,未涉及模型、产品或技术细节,摘要因此保持简短并只陈述原文明确写出的事实。)

  18. Jerry Liu(@jerryjliu0)AI 评估 · 18/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    SpaceX 将按任务选用最佳后端模型,包括 Claude Opus 5.5、MidJourney、Suno

    Elon Musk 表示 SpaceX 今后会为每项任务选用最合适的后端模型,包括 Claude Opus 5.5、MidJourney、Suno 等领先 API,以尽可能获得最佳结果。

  19. Jerry Liu(@jerryjliu0)AI 评估 · 58/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    LlamaIndex 推出 OpenDocRouter,统一 OCR 模型 API

    LlamaIndex 的 Jerry Liu 发布 OpenDocRouter,把文档解析统一到一个 API,可比较并使用各类 OCR 模型,涵盖 MinerU 等轻量开源模型到 Opus 5.5 等前沿 VLM,按成本价计费并收取少量交易分成。

  20. Jerry Liu(@jerryjliu0)AI 评估 · 49/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Jerry Liu:定义 eval 并爬山,正在取代显式工作流

    Jerry Liu 认为,如今多数任务可以通过定义一个 eval 并在其上做爬山优化来解决,而不必直接编写确定性的智能体工作流。数据提供方公司的全部工作就是为所有经济活动定义 eval,让前沿模型有能力完成任何任务;使用者的工作则变成给前沿智能指明方向——定义要解决什么、如何衡量结果好坏。

  21. 量子位AI 评估 · 57/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google 与 BIDMC 研究登《柳叶刀》:AMIE 预诊获初步验证

    Google 与贝斯以色列女执事医疗中心(BIDMC)研究人员主导的一项研究发表于《柳叶刀》主刊,这是 Google 研究成果首次登上该刊。

  22. 源码资本AI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    微玖光电完成数亿元Pre-A轮融资,重点投向量产线建设

    微玖光电宣布完成Pre-A轮数亿元融资,近一年内连续完成三轮大额融资,资金将全部投向量产线建设、核心工艺迭代及海内外重点客户批量交付。本轮由北京市新材料产业投资基金、长江证券创新投联合领投,光洋股份、佛山南芯基金、武汉光谷科创投、源创多盈跟投,源码资本为其天使轮投资方。公司自研外延全链条技术,瞄准Micro LED微显示在AI眼镜、智能车载终端的产业化机遇。

  23. 国际大厂AI 评估 · 17/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Meshy 创始人胡渊鸣的 48 条创业反思:团队、管理与 AI 时代的"登味"

    Meshy 创始人胡渊鸣在创业反思中提出,管理几十人靠一号位对业务细节的深入理解,管理几百人则需真正践行的原则与价值观和高密度人才梯队,并主张用"人力投资"取代"人力成本"、给员工市场最高位薪资。他认为 low performer 会逼走 high performer,招聘应宁缺毋滥、每个人都必须比现有的人更强。他还以任天堂、吉卜力和 Ray Dalio 为例,指出停止快速学习就会被"登味"腐蚀。

  24. 国际大厂AI 评估 · 52/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    谷歌云发布 Gemini Agent,Anthropic 推出 Claude Dashboards 与 Motion

    谷歌云在 Gemini at Work 2026 发布会上推出面向企业客户的 Gemini 智能体(Gemini Agent),定位通用工作智能体,可回答问题、处理知识型工作、创建媒体内容与编写程序,支持 Gemini Enterprise、Workspace 及第三方服务,目前兼容 Gemini 和 Claude 模型,并会提供 API 供开发者集成。

  25. 国际大厂AI 评估 · 69/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI 开除三名安全研究员,三人联名公开信曝光内幕

    OpenAI 以「违规处理敏感信息」为由开除安全团队三名研究员 Jasmine Wang、Tomek Korbak 和 Mikita Balesni,三人将写给董事会的联名公开信《OpenAI不能独自让AI变得安全》全文发到网上。

  26. 国际大厂AI 评估 · 60/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    马斯克推出 Grok Bot:免费用 Opus 5.5 并集成 X 全部功能

    马斯克推出 Grok Bot,可通过 Cursor 账号登录 PC 端应用使用,后台集成 Opus 5.5、Midjourney、Suno 等模型并按需自动路由调用。

  27. 国际大厂AI 评估 · 36/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Novix 如何用协同进化式 RSI 跑通规模化闭环

    华人团队 Novix 将自我改进机制嵌入真实前沿算法与工程任务,提出 Co-Evolutionary RSI(协同进化式 RSI),成立半年已服务 20 万名专家、覆盖 40 多个国家和地区。

  28. 国际大厂AI 评估 · 19/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    iFlac:从 Linux 把 FLAC 文件同步到 iPhone

    开源项目 iFlac 能让 Linux 用户把 FLAC 文件同步到 iPhone,无需启动 Windows 或使用 iTunes、Apple Music 桌面端。它基于 libimobiledevice、参考 ByeTunes 的思路,先与手机配对,再向 Apple Music 的 sqlite 数据库注入记录,作者在 iPhone 12 上测试可用,并提醒别用蓝牙以免压缩无损音频。

  29. 国际大厂AI 评估 · 23/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Alexandr Wang:别指望 Meta 的 Muse 能神奇地帮你赚到 1 万美元

    Meta 首席 AI 官 Alexandr Wang 表示,不要指望 Muse 能神奇地帮用户赚到 1 万美元,公司希望继续改进 Muse 的记忆能力。

  30. 国际大厂AI 评估 · 15/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Satya Nadella 在白宫经历尴尬的一天

    微软 CEO Satya Nadella 在白宫与 Donald Trump 同场露面,现场氛围被形容为尴尬,报道配图显示两人互动时的表情被拿来放大解读。

  31. 国际大厂AI 评估 · 0/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Best cat toys:猫咪玩具选购指南

    Business Insider 发布猫咪玩具选购指南,由撰稿人 Janelle Leeson 撰写,并经兽医 Julie Liu(DVM)医学审核。指南强调最好的猫玩具应能激发猫的多种自然捕猎本能,内容基于作者养猫经验、专家咨询与自测方法。

  32. 国际大厂AI 评估 · 49/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    三名被解雇 OpenAI 研究员发公开信,称解雇将对公司文化产生“寒蝉”效应

    三名被 OpenAI 解雇的研究员发布公开信,称此次解雇将对其公司文化产生"寒蝉"效应。OpenAI 上周以内部调查认定三人不当处理敏感信息为由将他们开除。

  33. 国际大厂AI 评估 · 61/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    TouchScale 发布 500 小时人类视觉-触觉数据集,机器人真机成功率翻番

    德州农工大学、Google DeepMind、CMU 等 15 家机构联合发布 TouchScale,一个在统一传感器与采集流程下构建的 500 小时人类双手视觉-触觉数据集。

  34. 国际大厂AI 评估 · 21/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Alexa Tablet 12 Pro 对比 iPad Pro:亚马逊如何追赶苹果

    亚马逊推出 Alexa Tablet 12 Pro,配 12 英寸 2800×1840 分辨率、120Hz 刷新率 LCD 屏,支持键盘与手写笔,起售价 500 美元(磨砂屏 550 美元),接入 Play Store 与 AI 助手 Alexa+。

  35. myFT followingAI 评估 · 12/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    欧盟对华贸易争端:Bernd Lange 谈欧洲该如何权衡

    欧洲议会议员 Bernd Lange 在访谈中讨论欧盟与中国之间错综复杂的贸易关系,核心问题是:欧盟与北京打一场贸易战是否明智。

  36. 美团技术团队AI 评估 · 26/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    美团搜索3.0:LLM 语义表征在排序模型的三期探索与应用

    美团搜索团队披露 LLM 语义表征在服务零售排序场景的三期实践,累计完成 3 个 Launch Review 并全量上线,一期将 Query 与 POI 的语义向量 cosine 相似度分桶注入精排,带来大盘搜索支付订单 +0.20%、服务零售订单 +0.27%、长尾 NDCG@5 +2.21pp。

  37. 美团技术团队AI 评估 · 29/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    美团 GeoRA:为 RLVR 设计的 LoRA,获 ACL 2026 杰出论文

    美团履约技术团队与北京大学提出 GeoRA,一种为 RLVR 显式对齐更新几何的低秩适配方法,已被 ACL 2026 接收为杰出论文(全球 18 篇入选)。

  38. 美团技术团队AI 评估 · 26/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    美团智播:面向本地生活场景的数字人直播技术创新与实践

    美团智播是面向本地生活场景的AI数字人直播解决方案,支持真人1:1复刻、30秒生成直播素材、3分钟完成开播配置,7×24小时稳定上播。过去一年其数字人直播月日均GTV同比增长82.12%,月日均观看人次同比增长163.44%,开播场次提升11倍。

  39. 美团技术团队AI 评估 · 35/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    《Agent 评测白皮书》系列01:Agent 评测全览

    美团技术团队发布《Agent 评测白皮书》系列第一篇《评测全览》,提出完备评测体系可概括为四个模块、三种能力、两条 Loop、一套资产。两条 Loop 分别为评测体系迭代 Loop 与 Agent 迭代 Loop,二者共享线上真实样本,通过 Case 挖掘与归因咬合。评测集是核心资产,分端到端与过程两类,前者答"事有没有办成",后者答"中间哪一步出了问题"。

  40. 美团技术团队AI 评估 · 27/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    美团 MTFM:统一推荐基座大模型在外卖多业务场景的落地实践

    美团在 MTGR 基础上提出统一推荐基座大模型 MTFM,首次实现外卖多个主要业务的统一精排模型,相关成果已被 KDD 2026 收录。MTFM 以异构 Tokenizer 与动态掩码实现多场景特征免对齐,通过混合注意力与 Target Scale-Up 提升 Scaling 能力,单样本计算量达 192 GFLOPs。美团外卖多业务订单量提升 2.06%~6.68%,在线推理成本降低 24%。