腾讯 OK 平台:AI 端到端研发如何跑通需求到部署
腾讯技术工程发文介绍 OK 平台这一 AI 驱动的端到端研发平台,用户只提交需求描述,AI Agent 自动完成需求评审、仓库匹配、技术方案、编码、Code Review 和部署。
腾讯技术工程发文介绍 OK 平台这一 AI 驱动的端到端研发平台,用户只提交需求描述,AI Agent 自动完成需求评审、仓库匹配、技术方案、编码、Code Review 和部署。
State of AI 第九份年度报告正式发布,涵盖 AI 构建更好的 AI、世界模型、物理 AI、地缘政治、网络防御以及 12 个月预测等议题。报告可在 stateof.ai 阅读,作者 Nathan Benaich 另提供了主编剪辑版视频。
第 9 份年度《State of AI》报告发布,涵盖 AI 如何构建更强的 AI、世界模型、Physical AI、地缘政治、网络防御,以及对未来 12 个月的预测。发布方为 AI Will(@FinanceYF5),具体发现以报告正文为准。
面对大型企业几十万份文档入库的需求,AIS 团队认为难点不在导入,而在知识源分散、版本冲突、权限与持续更新。其客户中文档最多的已突破 550 万份,AIS 通过 Connector 自动同步、检索前权限过滤,以及解析—清洗—结构化—切片—抽取—分类—打标签—校验的知识工程流程,并区分 MCP 的 readonly、write、admin 权限等级来管理知识供应链。
谷歌联合 20 多家研究机构、32 位作者发布 154 页综述,系统梳理大模型的分词(Token)机制,指出模型数不清 strawberry 里有几个 r、多位数算术出错,病根在文本进入模型前的分词环节。
微软开源 Agent Lightning v1.0,一套面向 AI Agent 的强化学习框架,让开发者保留现有工具调用、上下文管理和任务执行流程,用实际任务反馈训练底层模型。
墨尔本大学与新南威尔士大学联合团队提出多会话语音记忆基准VoxMem,用「声学证据×记忆操作」二维分类覆盖15种考察组合,包含799道题、3,196个评测实例、34,743个语音会话(约177小时),每道题在8K到64K token历史长度下保持不变。
Pyromind 押注 RSI 产业化的早期形态出现在企业 Agent 上线后的持续学习,用 AutoRL 和 Reward Data Flywheel 把真实任务反馈转化为可训练、可评估的模型能力。
腾讯正考虑发行最高50亿美元(约335亿元)离岸债券,最快本月启动,此前6月已发债筹资近47亿美元。其二季度资本开支达528亿元、同比增长176%,自由现金流为负138亿元,AI预付款主要用于混元、WorkBuddy、CodeBuddy、微信AI及腾讯云的算力采购。
Valkey 创始开发者 Madelyn Olson 与 Viktor Söderqvist 在 OSS EU 上介绍了项目进展:8.x 的异步 I/O 线程将单进程吞吐从约 20 万-25 万请求/秒提升到约 100 万,并加入键嵌入与双通道复制;9 版带来原子槽迁移、编号数据库和哈希字段过期。
淘宝直播提出 Harness-Aware Training(HAT),把动态执行环境 Harness 状态显式纳入训练分布,通过 HSA-SFT、General OPD、HSA-RL 三阶段训练,让模型读懂当前 Harness 而非背下某一版配置。
Amazon 表示其意外走红的「About You」用户画像页面并未使用外部数据,仅基于用户在本平台的购物与浏览行为生成。这些页面因对顾客的调侃式描述而病毒式传播,Amazon 同时给出了用户自行编辑或关闭该画像的方法。
英伟达联合 MIT 和牛津大学提出 Physis-Lang,把物理原因、规律和结果写进语言描述,并贯穿数据筛选、训练与视频生成。其 Cosmos3-Super 和 Cosmos3-Nano 版本在 Physics-IQ Verified 榜单上分别以 48.2 和 43.3 分按平均分位列第一、第二,Super 较此前最高分提升 5.5 个百分点。
扩散语言模型公司 DiffuSpace 完成数亿人民币融资,由港大 NLP 实验室联合主管孔令鹏及其博士生龚珊三、叶佳成联合创立,2026 年 5 月落地深圳。其 Dream 7B 模型在数学、代码、规划任务上全面超越同规模自回归模型,部分指标超过 671B 的 DeepSeek V3,Hugging Face 下载量超 250 万。团队正推进新一代更大参数规模模型训练。
Deedy 称有三人分别确信"最快达成 10 亿美元年化收入"的是三家不同公司,很可能不止一家数据公司近期触及该门槛,其中不少在 Pavlov's List 上。他还预计未来 6 个月内会有更多公司达到这一水平,数据总支出已超 150 亿美元。
三位不同的人分别告诉 Deedy,他们 100% 确定"最快达到 10 亿美元年化收入"的纪录属于三家不同的 AI 数据公司,很可能已有多家近期突破这一门槛,其中不少出现在 Pavlov's List 上。Deedy 预计未来 6 个月还会有更多公司加入,该市场总支出已超过 150 亿美元。
深圳鲲为科技完成 4 亿元新一轮融资,新增股东 XVC、红杉中国,老股东夏尔巴、腾讯加仓。鲲为通过将深度神经网络引入低频超声回波信号处理,实现穿透颅骨后毫秒级实时捕捉脑组织结构与血流动态。公司已实现数千万订单,并推出基础软件平台 kOS,目标客户为脑机接口 Lab 与 NeuroAI 模型公司。
有人基于 Levels.fyi 的提交数据,统计了大型科技公司中每位工程经理大约对应的工程师数量,AI 实验室则单独发布报告。该统计只是代理指标,更适合观察方向,不能视为精确的组织数据。
德州已冻结新建数据中心许可,其并网排队量18个月内从63 GW升至474 GW,超过历史峰值需求的5倍。其中仅9.5 GW获批、约4.3 GW实际运行,其余多为重复申请、投机性申请和从未接入过GPU的开发商提交。a16z的@rmcentush分析了电网为何无法按这么多"可能"来建设。
a16z 宣布投资 Preference Model,该团队专注为头部实验室构建 AI 研究与 ML 工程方向的 RL 环境。本周他们开源了生产环境框架 Karotte,经超一百万次评估运行和红队测试打磨。团队重点在于让环境随模型变强而更难被攻破:定位模型弱点的工具、针对缺口生成新任务,并让智能体主动攻击测试环境。
Yann LeCun 回忆 1986 年 6 月首次在美国参会并首次到访 MIT,展示了一张关于多层网络的海报。他在 Thinking Machines Inc 主办的招待会上首次见到 Marvin Minsky,对方惊讶于神经网络可被训练来计算两个二进制数的乘积。
NVIDIA 发布论文 VERA,把基准轨迹转成 9000 多个可重启沙箱并附带 rubric 评分,只保留能运行且可依据可观察证据评分的环境。系统同时更新模型权重和 harness,harness 改动需通过自测并在开发集上至少提升 5 分才保留,模型 checkpoint 若得分下降超过 20% 则被拒绝。
Voice Arena 发布 Monsoon ASR 语料库七天内,已有 80 多家机构申请授权。在孟加拉语 FLEURS 上,用 Monsoon 微调 Whisper Medium 将词错率从 85.27% 降至 7.65%。Monsoon 覆盖 50 种语言共 10 万小时,多为长尾语言,计划 2 月扩展到 100 种语言、2027 年底达到 1000 种,并开放模型 API 供实验室自测。
Claude 发布实时数据看板 Claude Dashboards 和代码驱动动态解说工具 Claude Motion。Dashboards 直接接入企业数仓或 CRM,用自然语言提问即可生成联动业务看板,并随底层数据变动自动刷新;Motion 能把报告、图表或产品演示转成短动画并导出 MP4,由 Claude 用代码为文字、图表、形状和图片编排动画,可编辑具体文字、数字与节奏。
美团 LongCat 团队开源 LoHoSearch,一个基于覆盖 762 万维基百科实体知识图谱自动生成题目的搜索智能体评测基准,含 544 道经人工核验题目、覆盖 11 个领域。
华人团队 Novix 将自我改进机制嵌入真实前沿算法与工程任务,提出 Co-Evolutionary RSI(协同进化式 RSI),成立半年已服务 20 万名专家、覆盖 40 多个国家和地区。
德州农工大学、Google DeepMind、CMU 等 15 家机构联合发布 TouchScale,一个在统一传感器与采集流程下构建的 500 小时人类双手视觉-触觉数据集。
美团搜索团队披露 LLM 语义表征在服务零售排序场景的三期实践,累计完成 3 个 Launch Review 并全量上线,一期将 Query 与 POI 的语义向量 cosine 相似度分桶注入精排,带来大盘搜索支付订单 +0.20%、服务零售订单 +0.27%、长尾 NDCG@5 +2.21pp。
美团履约技术团队与北京大学提出 GeoRA,一种为 RLVR 显式对齐更新几何的低秩适配方法,已被 ACL 2026 接收为杰出论文(全球 18 篇入选)。
美团在 MTGR 基础上提出统一推荐基座大模型 MTFM,首次实现外卖多个主要业务的统一精排模型,相关成果已被 KDD 2026 收录。MTFM 以异构 Tokenizer 与动态掩码实现多场景特征免对齐,通过混合注意力与 Target Scale-Up 提升 Scaling 能力,单样本计算量达 192 GFLOPs。美团外卖多业务订单量提升 2.06%~6.68%,在线推理成本降低 24%。
特朗普 10 月 8 日在白宫颁发两项美国国家奖章:Google 联合创始人 Sergey Brin、英伟达 CEO 黄仁勋、马斯克、AMD CEO 苏姿丰获国家科学奖章,戴尔创始人 Michael Dell 与微软 CEO Satya Nadella 获国家技术与创新奖章。
博通正为其与OpenAI合作的定制AI芯片项目安排逾500亿美元融资,阿波罗全球管理与黑石集团是洽谈参与的贷款机构之一,甲骨文也在与阿波罗、高盛商谈为购买芯片筹资。另有消息称三星电子移动体验事业部已开始削减第四季度产量,减产幅度最高达30%,外界认为与假日季内存芯片价格上涨、营业利润率承压有关。
成都恒瀚微电子2026年8月完成近亿元天使轮融资,投资方为北京国泰、成都科创投、成都高新创投和中信聚信投资,资金用于产品迭代、人才引进和市场拓展。其首款400G RDMA智能网卡已完成送样验证并拿到正式订单,自研RDMA架构结合credit-based主动拥塞管理,部分测试场景动态时延为英伟达同类产品(CX-7)的1/2至1/3。
腾讯混元联合复旦、清华推出 ExplorationBench,用于衡量 AI 系统如何探索未知规则,包含 31 处隐藏规则改动、70 项任务的 AlienCode 与 24 条补丁推理规则、70 条定理的 AlienLogic 两个可验证沙盒。
论文发现,在整仓库迁移任务上,同一模型和相同 effort 设置下把 Codex 换成 HERMES harness 后,GPT-5.6 Sol 的成功率从 6.5% 升到 31.0%,收益来自 harness 本身。
一篇题为 Native Action-Prior Learning from Videos for World Action Models 的论文发布,提出从视频中直接学习动作先验,用于世界动作模型。论文页面可在 huggingface.co 查看。
Databricks 宣布 Unity Catalog 的 Workday Data Connect 联邦连接器进入公开 Beta,用户可直接在 Unity Catalog 中联邦查询 Workday 数据,无需先搬运数据。
论文提出 PAMI(Part Anchored Motion),用于文本到人-物交互(Human-Object Interaction)生成,论文页面已发布在 Hugging Face Papers(编号 2609.38…)。
Anthropic 发布 Claude Haiku 5.5,10 万 token 以内输入输出价为每百万 token 0.10/0.50 美元,超过则升至 0.50/2.50 美元,Max 与 Team 用户新增 API 额度;同日 Sonnet 5.5 缓存读取价降至每百万 token 0.10 美元。
Databricks 发文介绍 Lakebase 与 Agentic SDLC,提出用数据库分支支撑编码智能体工作流。其思路是让编码智能体像操作代码分支一样对数据库进行分支,从而在开发流程中隔离和并行推进变更。