跳到正文

#部署/工程

今日 68 条
10月9日周五
  1. GitHub(@github)AI 评估 · 26/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    GitHub Copilot 将推出本地模型智能路由,可节省 AI credits

    GitHub Copilot 即将支持智能本地模型路由,能在最合适时自动把任务分派给本地模型,帮助用户节省 AI credits。该功能是 Project HydraFusion 愿景的下一步。

  2. Geek(@geekbb)AI 评估 · 10/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    ChromeBox3 CN65 升级 PVE9.0 后反复重启,五元 HDMI 诱骗器解决

    ChromeBox3 CN65 升级到 PVE9.0 后开机一分钟内不断重启,排除电源、固件和直通 USB 网口等因素后,AI 联网搜索判断这是 ChromeBox 作无头服务器时的通病。在 PDD 花五元买了个 HDMI 诱骗器后,问题随之解决。

  3. Stack Overflow BlogAI 评估 · 16/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    用 Python 实现模块化 Master-Agent 遥测诊断框架:Prime-Sentinel Command(PSC)

    Prime-Sentinel Command(PSC)是一个用 Python 面向对象实现的 master-agent 架构,由中央编排器 PrimeProgram 协调多个自主边缘诊断节点 SentinelProgram,后者采集 CPU 负载、内存占用与网络状态并返回结构化遥测数据。

  4. Stack Overflow BlogAI 评估 · 61/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    为编码智能体搭建一套操作系统:纪律化构建的六个部件

    Varun Jindal 提出在模型之外为编码智能体搭建一套 harness,包含宪法、自主边界、分层上下文、持久记忆、多视角评审面板和编辑后钩子六个部件。

  5. Stack Overflow BlogAI 评估 · 67/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    让 AI 智能体变得无聊:生产系统的确定性层设计

    Stack Overflow 博客发布六层 LLM 生产系统成熟度模型的第一层「确定性层」,主张智能体应是从上下文到提案的纯函数,无权直接改变业务状态,由经过充分测试的 substrate 在审批后执行提案。

  6. Stack Overflow BlogAI 评估 · 64/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    生产级 LLM 与智能体实战指南:从演示到生产的六级成熟度模型

    Stack Overflow 博客发布了一份生产级 LLM 与智能体实战指南,提出从 Notebook 演示到生产级构建的六级成熟度模型,涵盖确定性、评测、置信度、安全治理与运维等层次。文中给出可勾选的自检清单,例如智能体只能提出建议而非直接改动业务状态、提示词或模型变更导致质量回退时应使 CI 失败、敏感数据在边界处脱敏并采用只追加审计账本。作者建议团队先找到自己最弱的一层,再按顺序逐级补齐。

  7. Stack Overflow BlogAI 评估 · 13/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Datadog 如何观测 AI 智能体内部运行

    Datadog 是面向云应用的可观测性与安全平台,可对基础设施、分布式系统以及 AI 智能体行为进行实时监控。该平台此次聚焦如何查看 AI 智能体的内部运行状态。

  8. 歸藏(guizang.ai)(@op7418)AI 评估 · 34/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    在 Agent 云电脑里装 Pi 或 DeepSeek Harness,让 Grok Bot 调用闲置 Code plan 额度

    一种新玩法是在 Agent 的云电脑里安装 Pi 或 DeepSeek Harness 这类编程 Agent,再把其他 Code plan 用不完的额度接入其中。之后由 Grok Bot 调用这些 token 去写代码、渲染视频,让闲置额度不再浪费。

  9. 歸藏(guizang.ai)(@op7418)AI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    邪修玩法:在 Agent 云电脑里装编程 Agent 调用闲置 Code plan 额度

    一种省钱玩法是在 Agent 的云电脑里安装 Pi 或 DeepSeek Harness 这类编程 Agent,然后把其他 Code plan 用不完的额度配置进去。再让 Grok Bot 调用这些 token 写代码、渲染视频,避免闲置额度浪费。

  10. Simon Willison(@simonw)AI 评估 · 66/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    微软开源跨平台沙箱库 MxC,支持 Windows、macOS 和 Linux

    微软开源了一个跨平台沙箱库 MxC,覆盖 Windows、macOS 和 Linux,底层使用 processcontainer、bubblewrap 和 seatbelt(地址 github.com/microsoft/mxc)。

  11. Claude(@claudeai)AI 评估 · 31/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Anthropic 将 Claude Sonnet 5.5 缓存读取价格减半至 $0.10/百万 token

    Anthropic 将 Claude Sonnet 5.5 的缓存读取价格减半,降至 $0.10 每百万 token。这使得 Sonnet 5.5 在大多数长时间运行的任务上成本降低约 20%。

  12. meng shao(@shao__meng)AI 评估 · 72/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    微软将 Windows 定位为 hybrid intelligence 之家,发布四层 AI Agent 架构

    微软正式将 Windows 的战略定位从个人计算平台升级为 the home for hybrid intelligence,作为 AI Agent 在本地与云端的承载、安全隔离和企业管理主阵地,并发布四层架构。

  13. meng shao(@shao__meng)AI 评估 · 45/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    LangChain 为 Deep Agents 的 Skills 做了三项工程升级:工具绑定、固定与中途重载

    LangChain 为 Deep Agents 框架的 Skills 带来三项工程升级:工具绑定 Skills 通过 SKILL.md 的 metadata.include_tools 声明工具。

  14. meng shao(@shao__meng)AI 评估 · 64/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    T3 Stack 作者 theo 开源 Rust 版 TypeScript 编译器 tsc-rs

    T3 Stack 作者 theo 开源了 TypeScript 编译器、类型检查器与 LSP 的 Rust 完整移植 tsc-rs,它并非从零设计,而是对微软 TypeScript 7(typescript-go)的逐行为移植,锁定上游提交 typescript-go @673a5f17,采用 MIT 协议并保留上游 Apache-2.0 / BSD-3 声明。

  15. 宝玉(@dotey)AI 评估 · 80/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Anthropic 发布 Claude Haiku 5.5,价格降至上一代的十分之一

    Anthropic 发布 Claude Haiku 5.5,10 万 Token 以内请求每百万 Token 输入 0.1 美元、输出 0.5 美元,比 Haiku 4.5 便宜 90%,长请求为 0.5 和 2.5 美元,便宜一半。

    为什么值得看

    Haiku 5.5 的降价与跑分变化并列给出,可据此判断小模型在批量任务和子智能体场景中的成本位置。

  16. 宝玉(@dotey)AI 评估 · 31/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Theo 质疑 Cursor 工程师 1000 万美元 Token 成本说法:实际 API 成本约每月 10 万-50 万美元

    Theo(t3.gg)反驳 Cursor 工程师 Lauren 每年 1.32 亿美元 Token 成本的估算,称真实 API 成本约为每月 10 万-50 万美元,按当前价格更接近每年 300 万美元。

  17. elvis(@omarsar0)AI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Viktor:用 AI 员工自动排查 agent 评测结果,$100 免费额度

    Dair.ai 创始人 Elvis 用 AI 员工 Viktor 自动排查 agent harness 的夜间评测结果:23 个昨天通过、今天失败的任务会被逐一检查日志、追溯到引发失败的改动并建议回滚。Viktor 在 Slack 中运行,还会主动标记问题,目前可免费试用并赠送 $100 额度、无需信用卡。

  18. 爱范儿AI 评估 · 64/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    DLSS 5 正式版体验:在《NBA 2K27》上实测画质与性能

    爱范儿作者在 RTX 5080 上实测 DLSS 5 正式版,在《NBA 2K27》中开启后球员皮肤、球衣织物、地板木纹与整体光影更接近真实比赛质感。

  19. 爱范儿AI 评估 · 71/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    微软与英伟达发布 RTX Spark 和 Surface Laptop Ultra,提出为「无限智能」重构 PC

    微软在 Windows 与 Surface 特别活动上联合英伟达推出 ARM 架构 SoC RTX Spark,把 CPU、GPU 和最高 128GB 统一内存集成在一起,FP4 AI 算力最高 1 PFLOP,可在本地运行 1250 亿参数的 Qwen 3.8 Flash Next 等模型。

  20. 爱范儿AI 评估 · 79/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    微软发布 Surface Laptop Ultra 与 Windows 混合智能更新

    微软在特别发布会上推出 Surface Laptop Ultra,搭载 NVIDIA RTX Spark Superchip,最高 128GB 统一内存,可在本地运行超 1200 亿参数模型,起售价 2599 美元,10 月 7 日开放预订、10 月 16 日供货。

    为什么值得看

    梳理微软从硬件到 MXC 容器、混合智能调度的整条设备链路,可对照两年前 Copilot+ PC 的定位变化。

  21. 向阳乔木(@vista8)AI 评估 · 42/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    乔木剪藏怎么用 Agent 一键安装插件与助手

    乔木剪藏发布一段可直接复制的 prompt,让 Agent 自动完成插件与助手安装升级。prompt 要求 Agent 先读 README.md 和 native/README.md。

  22. Qdrant(@qdrant_engine)AI 评估 · 18/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Qdrant 与 DeepLearning.AI 推出免费课程,教机器人用 Qdrant Edge 实现本地记忆

    Qdrant 与 DeepLearning.AI 合作推出免费课程,由 Dylan Couzon 讲授如何用 Qdrant Edge 让机器人在无网络连接、无远程服务器的情况下拥有真正的本地记忆。课程已在 DeepLearning.AI 平台开放免费报名。

  23. InfoQAI 评估 · 46/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Cloudflare 用 AI 测试框架探测并加固其 WAF

    Cloudflare 将前沿 AI 模型放入受控测试框架中探测其 WAF,以已拦截的攻击载荷为起点让模型生成并迭代新变体,在 45 个场景中产生 1,107 次尝试,经人工筛查后留下 49 项发现。

  24. InfoQAI 评估 · 25/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    如何在 Go 中构建会话有序的 Kafka 管道

    在 Go 中为实时对话 AI 平台构建 Kafka 消息层,用一致性哈希把同一会话的消息路由到固定 worker,再以每会话一个 goroutine 串行处理,从而在数千并发会话下保证会话内严格有序。系统已在生产处理超 4000 万条消息、未观察到乱序,测试中发送侧吞吐突破 100,000 条/秒。重试在会话 goroutine 内原地进行并配合指数退避,避免消息被后发消息超越。

  25. InfoQAI 评估 · 13/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    InfoQ 网络研讨会:AI 进入生产环境,什么会崩、什么可行、谁来把关?

    InfoQ 将于 10 月 14 日举办免费 60 分钟线上研讨会"AI in Production: What Breaks, What Works, and Who Approves It?

  26. lmarena.ai(@lmarena_ai)AI 评估 · 40/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Agent Arena 评测 Jev Router:成本高 38%、延迟 1.7 倍,但可控性接近 Claude Opus 5.5

    Agent Arena 用超 4700 个真实智能体会话评测 typesafeai 的 Jev Router,结果显示它未能推进当前帕累托前沿:达到与 DeepSeek V4.1 Flash(Max)相近性能时成本高 38%,模型请求延迟中位数高 1.7 倍。

  27. lmarena.ai(@lmarena_ai)AI 评估 · 26/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    LMArena 评测:Jev Router 模型路由尚未跑赢直连 DeepSeek V4.1 Flash

    Jev Router 最常用的 5 个模型中 4 个位于帕累托前沿,可操控性表现突出,但整体权衡不及直接调用 DeepSeek V4.1 Flash——后者以更低成本和延迟取得相近表现。该评测显示,同时平衡任务成功率、可操控性、成本与延迟仍是模型路由的未解难题。

  28. lmarena.ai(@lmarena_ai)AI 评估 · 26/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Jev Router 与 DeepSeek V4.1 Flash 端到端延迟对比:中位数 6.18 秒对 3.64 秒

    Jev Router 的端到端请求延迟高于同类 Pareto 最优模型,中位数为 6.18 秒,DeepSeek V4.1 Flash(Max)为 3.64 秒。在 P90(最慢 10% 请求)上差距扩大,Jev Router 耗时 30.59 秒,DeepSeek 为 14.26 秒。

  29. cohere(@cohere)AI 评估 · 17/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Cohere Compass Cloud 开启私有测试,招募企业团队试用

    Cohere 的搜索与检索平台 Compass 即将上云,Compass Cloud 目前已进入私有测试阶段,主打以更低开销获得优质检索效果。企业团队可申请早期访问名额参与测试。

  30. AWS Machine Learning BlogAI 评估 · 19/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    AWS 发布六周 Playbook:让非工程背景员工用 Amazon Bedrock 构建 AI 智能体

    AWS 推出一个为期六周的 AI 构建能力培养项目,参与者每周投入约 4 小时,用 Amazon Bedrock 与 Amazon Bedrock AgentCore、Strands Agents SDK 等生产级工具搭建可运行的 AI 原型。

  31. AWS Machine Learning BlogAI 评估 · 27/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Qlik 如何用 Amazon Bedrock 构建可溯源的企业级 AI

    Qlik 基于 Amazon Bedrock 打造 Qlik Answers,让员工用自然语言提问并获得带来源的可信回答。其 Discovery Agent 上线以来为客户发现超过 100,000 条异常与离群点,Lintech International 索引了 17,000 多份技术文档,响应速度提升 75%,业务经理每周节省最多 7 小时。

  32. LangChain(@LangChainAI)AI 评估 · 49/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    LangChain 发布 Managed Deep Agents v0.9,新增 Schedules SDK 与按运行配置

    LangChain 发布 Managed Deep Agents v0.9,新增 Schedules SDK,让智能体可在对话中自行创建提醒、跟进和周期性任务。该版本支持按每次运行选择模型、技能、MCP 服务器和沙箱,使单次部署即可服务不同团队或代码仓库;智能体在启动运行时会通过 Slack Reactions 回应消息。

  33. Jerry Liu(@jerryjliu0)AI 评估 · 49/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Jerry Liu 推出 OpenDocRouter:统一文档解析 API,按成本价调用前沿与开源 OCR 模型

    OpenDocRouter 是一个统一文档解析 API,可将文档转写为 markdown,按成本价提供前沿与开源权重模型,仅收取少量交易抽成,并统一处理各模型的速率限制。它提供 bounding boxes 与 layout 作为服务,可为任意模型补充 grounding,解析候选新模型将先在 ParseBench 上评测再上线,自动化路由等新功能也在开发中。

  34. Jerry Liu(@jerryjliu0)AI 评估 · 51/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    LlamaIndex 推出 OpenDocRouter 文档 OCR 统一 API

    Jerry Liu 发布 OpenDocRouter,一个面向文档解析的统一 API,可在一个接口和计费体系下比较并使用 MinerU 等轻量开源 OCR 模型到 Opus 5.5 等前沿 VLM。

  35. 美团技术团队AI 评估 · 26/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    美团搜索3.0:LLM 语义表征在排序模型的三期探索与应用

    美团搜索团队披露 LLM 语义表征在服务零售排序场景的三期实践,累计完成 3 个 Launch Review 并全量上线,一期将 Query 与 POI 的语义向量 cosine 相似度分桶注入精排,带来大盘搜索支付订单 +0.20%、服务零售订单 +0.27%、长尾 NDCG@5 +2.21pp。

  36. 美团技术团队AI 评估 · 29/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    美团 GeoRA:为 RLVR 设计的 LoRA,获 ACL 2026 杰出论文

    美团履约技术团队与北京大学提出 GeoRA,一种为 RLVR 显式对齐更新几何的低秩适配方法,已被 ACL 2026 接收为杰出论文(全球 18 篇入选)。

  37. 美团技术团队AI 评估 · 26/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    美团智播:面向本地生活场景的数字人直播技术创新与实践

    美团智播是面向本地生活场景的AI数字人直播解决方案,支持真人1:1复刻、30秒生成直播素材、3分钟完成开播配置,7×24小时稳定上播。过去一年其数字人直播月日均GTV同比增长82.12%,月日均观看人次同比增长163.44%,开播场次提升11倍。

  38. 美团技术团队AI 评估 · 27/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    美团 MTFM:统一推荐基座大模型在外卖多业务场景的落地实践

    美团在 MTGR 基础上提出统一推荐基座大模型 MTFM,首次实现外卖多个主要业务的统一精排模型,相关成果已被 KDD 2026 收录。MTFM 以异构 Tokenizer 与动态掩码实现多场景特征免对齐,通过混合注意力与 Target Scale-Up 提升 Scaling 能力,单样本计算量达 192 GFLOPs。美团外卖多业务订单量提升 2.06%~6.68%,在线推理成本降低 24%。

  39. lmarena.ai(@lmarena_ai)AI 评估 · 60/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Mistral Large 4 进入 Agent Arena 前 15 实验室榜

    Mistral AI 的 Mistral Large 4 在 Agent Arena 超过 5000 场真实智能体会话中录得 -6.6% 净提升分,比上一版 Mistral Medium 3.5 的 -12.60% 高出 11 个名次,综合排名第 43。

  40. Qwen(@Alibaba_Qwen)AI 评估 · 23/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    GMI Cloud 上 Qwen3.8-Max、Qwen3.8-Flash 与 Wan3.0 免费开放延长一周

    GMI Cloud 将 Qwen3.8-Max、Qwen3.8-Flash 与 Wan3.0 的免费访问再延长 7 天,并提高了三款模型的速率限制。用户可用 Qwen 或 Wan 构建作品参赛,按最有创意、最具挑战和投入最多评选 3 名获奖者,各得 200 美元现金加 200 美元 GMI 额度。