创业 11 年沈亚楠的非共识:恩戈罗机器人第一步就要进家庭
沈亚楠创立具身公司恩戈罗(NGORO),第一款机器人放弃双足和拟人造型,用轮式底盘、最小转弯半径 30cm,第一批产品做洗衣、房屋清洁、物品归位与递送,2027 年将作为栖息地智能住宅标配交付真实用户,首批约 2000 台。他判断家庭是最接近通用也最难的场景,恩戈罗要借栖息地的半结构化住宅与仿真、真机数据先启动数据飞轮。
沈亚楠创立具身公司恩戈罗(NGORO),第一款机器人放弃双足和拟人造型,用轮式底盘、最小转弯半径 30cm,第一批产品做洗衣、房屋清洁、物品归位与递送,2027 年将作为栖息地智能住宅标配交付真实用户,首批约 2000 台。他判断家庭是最接近通用也最难的场景,恩戈罗要借栖息地的半结构化住宅与仿真、真机数据先启动数据飞轮。
华为数字能源首次公布源网荷储AIDC解决方案,围绕“3+1”创新重构,目标是让每一瓦特产出更多Token。方案包括MIMO供电架构、泰山UPS(单柜1280kVA、双变换效率最高98%)、恒山直流UPS(支持270V/400V/800V)和SmartLi 5.0、LUNA2000多层混合储能。商汤项目采用工厂预制与室外部署,45天完成18MW供配电系统全流程交付。
阿里巴巴在云栖大会上发布开放具身数据基础设施项目 RoboFlywheel,首发的仿真板块与清华大学赵昊团队联合打造,覆盖百万级仿真资产底座与跨引擎仿真平台。首批包含 52 万刚体、40 万铰链物体和 10 万柔性体,资产补充质量、惯量、摩擦与关节等物理属性。
阿里云栖大会透露,Qwen将训练5-10T参数新模型,平头哥发布真武V900芯片,性能是M890的3倍、单集群可扩至50万卡;阿里云计划到2032年达到20GW规模,吴泳铭在演讲中判断机器思考总量未来将是人类的1000倍以上。作者还测评了阿里AI硬件QwenNote Eva,并推荐了开源的《魔搭紫皮书》。
快手与ACM SIGIR 2026合作举办的快手探索者LLM-Rec挑战赛在北京完成线下决赛,新加坡国立大学队伍“菊花梨高智商推荐”以复赛第一、决赛第一夺得总冠军并获40万元奖金。赛事从全球231所院校、1205支队伍中选出20支队伍,围绕快手OneReason预训练基础模型探索大模型与推荐系统的融合,赛事总奖金池达99万元,决赛前20名可免笔试直入快手算法终面。
非侵入 AI 脑机接口公司华超神控(BCI-Sonics)完成2亿元人民币 Pre-A 轮融资,由红杉中国与云启资本联合领投,老股东经纬创投持续加注,成立至今累计融资近3亿元。
腾讯混元(Hunyuan)将经典临界批次规模理论扩展到在线 LLM 强化学习,在 GRPO 和 PPO 上发现,重调学习率可在一定批次规模范围内保持每条回复的学习效果。在固定硬件下,扩大批次规模使 PPO 生成阶段吞吐最高提升 2.29 倍,其最佳 GRPO 配置则以少 29% 的时间达到相同验证目标。
腾讯混元(Hunyuan)将经典临界批大小理论扩展至在线 LLM 强化学习,在 GRPO 和 PPO 上发现,重新调整学习率可在一定批大小范围内保持每个响应的学习效果。在固定硬件上,扩大批大小使 PPO 生成阶段吞吐量最高提升 2.29×,最佳 GRPO 配置以少 29% 的时间达到相同验证目标。
Modal 发布面向 AI-SQL 的推理引擎 Quail,将 SQL 查询规划与推理执行联合优化,在单条多表连接查询上达到每 H100 GPU 每分钟处理超 10 亿 token,比同硬件的 vLLM 基线快 10 倍以上。
SemiAnalysis 发布 ClusterMAX 3.0,覆盖 77 家 neocloud 的详细评测,市场观察范围从 ClusterMAX 2.0 的 209 家扩大到 323 家,并访谈了 200 多名 neocloud 终端用户。
Fireworks AI 与 Macroscope 的 Rob Bishop 将举办对谈,主题是让企业掌控产品核心的智能。其称训练可将客户所依赖工作的成本降低最多 90%,并认为下一个新模型发布无法解决这一问题。
GPU 集群即使每块 GPU、网络链路和 pod 都报健康,512-GPU 训练任务仍可能性能不达标或失败,原因可能是单块 GPU 变慢、链路在负载下降级或配置悄悄把流量引向慢速路径。这类问题往往要等到训练运行数小时后才被发现,因此需要在 AI 工作负载落地前验证集群就绪状态。
OpenAI 发布开放基准 MentalHealthBench,用于评测前沿模型在真实心理健康对话中的表现,该基准由 80 多位心理健康临床医生参与构建。OpenAI 将其公开,供其他研究者审查方法、自行评测并在此基础上继续研究。
NVIDIA 推出 NodeWright,用于管理 Kubernetes 节点本身——内核设置、系统软件包、存储布局、安全代理及 GPU 工作负载依赖的主机级调优。这些工作此前多靠 Ansible playbook、自定义脚本和手动 runbook 完成,但新集群在不同区域上线或内核升级破坏 RDMA 时便会失效。
Anthropic 称 Claude 在噬菌体 DNA 中发现了一个此前未知的酶系统,该酶基因旁有一段类似 CRISPR 的长重复 DNA 序列。团队目前尚不清楚该系统的功能,已知具备类似特征的系统都能剪切、复制和粘贴 DNA;CRISPR 正是这类可编程系统走向基因药物的先例,但弄清该系统的作用并判断能否有类似用途还需更多研究。
Fireworks 发布面向强化学习的新压缩器 ARCv3,可将 BF16 权重更新的体积缩减近 50%。该压缩器让跨区域训练更易落地,并保持 rollout 处于最新状态。对于使用自有 trainer 搭配 Fireworks rollouts 的团队,相关细节已在其博客公布。
前沿模型所学习的网页抓取数据中,印度语言内容占比远低于 1%;Sarvam 的文档模型在见到第一张图像前已读取 13 万亿 token 文本,上线四个月即数字化 3500 万页。Perceptron AI 用模型自主决定读取哪些 token,以应对一小时视频约百万视觉 token 中仅约 2% 有真值标注的问题。Meta 则在其三智能体审核流程中过滤大部分视频,压缩相似帧并对热门视频缓存判定结果。
Jev 利用 Firecrawl 的 Alexandria 数据,在 3.6 秒内完成 5000 项决策。团队抓取了全部 Fortune 1000 公司的数据,Alexandria 覆盖 100+ 数据源,现已面向 Jev 及其他用户上线。
Hugging Face 推出新 JS 包 huggingface/lerobot,可在浏览器中直接读取 Hub 上的 LeRobot 数据集,无需下载。官方给出的示例是用约 600 行 JS 在该包之上实现一个自定义查看器 UI,并建议把编码智能体指向它来快速构建。
ElevenLabs 发布语音转文字模型 Scribe v2 Medical,专为临床音频微调,相比基础版 Scribe v2 在临床音频上的词错误率(WER)降低 35%,提升了对药物名称、解剖结构和病理术语的识别准确度。
Anthropic 最新报告指出,存在代理查询路由支撑的大规模知识蒸馏活动,未授权代理将用户提示词转发到 Claude API,为商业平台上的蒸馏提供数据。这类查询转发带来严重的数据隐私风险。
vivo BlueImage Lab 提出妆容迁移框架 ART,通过两阶段训练把监督信号从合成伪目标逐步锚定到真实参考图像,解决复杂妆容迁移中的细节丢失与身份漂移问题。该方法在 MT、LADN、MT-Wild、MF2K 四个测试集上 MSimG 全部第一,MF2K 艺术妆测试集 MSimG 达 9.22,并发布首个 2K 妆容数据集 MF2K(8,573 张 2048×2048 人像)。
vivo 互联网存储团队提出知识驱动计算(KDC)理论,将知识定义为"已经验证、可复用,并能降低预测、推理、决策或行动不确定性的认知成果",而非文件、向量或 RAG 检索片段。
得物交易搜索团队过去一年将召回从判别式检索改为生成式建模,让模型主动生成候选商品而非从商品池中找最相似的。方案覆盖基于LLM的文本索引语义增强、基于MLMM的多模态向量表征、基于HLLM的深度语义表征、基于HSTU的生成式行为序列建模及基于语义ID的统一生成式召回,并推进召粗一体架构。
字节跳动安全研究团队与香港城市大学联合研究的 TWIST 被 ACM CCS 2026 接收,该方案用密钥将输入 Token 与模型权重映射到同一变换空间,使云端可沿用标准推理流程处理混淆态数据。
OpenAI 在 2026 年 7 月发布的 GPT-5.6 首次把自我改进列为评测科目,其 RSI 指数从 GPT-5.5 的 41.7% 升至 GPT-5.6 Sol 的 57.9%,相差 16.2 个百分点。文章按四条标准(持久改进、自主闭环、递归增益、稳健可控)划分 RSI 层级,指出前两层已有实现,递归自我加速尚无充分公开证据。
小米黑客松 Sensaro OS 团队在 48 小时内基于 Xiaomi MiMo 赛道搭建了一套智能家居系统原型,把用户意图转化为包含目标、作用范围、动作、安全边界和时长的“Sensaro State”,而非单条设备指令。
2026云栖大会首日,阿里公布大模型系列进展:基于新一代架构的Qwen4已在训练中,未来Qwen4.5、Qwen5等版本将扩展至5-10T参数;Qwen3.8-Max在人类零参与下自主迭代超1个月、完成33轮有效迭代,并在平头哥新款GPU上自主优化Qwen3.8-Flash推理框架,单实例推理吞吐量提升96%。
Opus 5.5 在 PDF 表格解析基准 ParseBench 上得分 93.9%,比 Opus 5 提升 7% 以上,超过 Fable、Gemini 和 Astra。其表格质量与 LlamaParse Agentic Plus 相当,但在图表、格式和版面处理上仍有不足,每页成本 5.8 美分,作为生产级 OCR 方案偏贵。完整结果见 parsebench.ai。
Perplexity 通过提示引导自蒸馏(hint-guided self-distillation)对 Computer 模型进行后训练,让模型从自身错误中学习。在一次线上 A/B 测试中,较晚训练的 checkpoint 相比早期 checkpoint 将工具调用失败率相对降低 21.2%。
Perplexity 公布其 Computer 智能体后训练方法,结合拒绝采样微调(RFT)与提示引导自蒸馏,让模型模仿优质轨迹并显式纠正错误工具调用。在线 A/B 测试中,后训练 checkpoint 将工具调用失败率相对降低 21.2%。
在加入提示的情况下,未改动的模型规避原有失败案例的比例从 75.1% 升至 93.7%。另一项实时测试显示,不同训练版本之间工具调用失败率从 2.24% 降至 1.77%,且推理阶段未使用提示。
Perplexity 通过提示引导自蒸馏(hint-guided self-distillation)对 Computer 模型进行后训练,让模型从自身错误中学习。在一项实时 A/B 测试中,较晚训练的 checkpoint 相比早期 checkpoint 将工具调用失败率相对降低 21.2%。
Sluicebox 构建了名为 Lucy 的 AI 供应商智能体,用于梳理零部件清单、文档和供应商邮件等数据,帮助工程师在设计阶段就了解数据中心碳足迹。Lucy 基于 NVIDIA Nemotron 3 Ultra,在 Sluicebox 测试中提升了准确率,成本降低 51–80%,响应速度最高提升 2 倍。
onPanda 提出通过 Token 级纠正实现 LLM 与智能体的 on-policy 对齐数据高效标注,论文已发布在 Hugging Face Papers。该工作面向对齐训练数据的标注环节,具体方法与实验结果可查阅论文原文。
DolphinBench 是一个新的智能体记忆基准,在长历史对话后直接评测智能体的动作是否正确,而非问答式打分,并把准确率、成本与延迟放在同一张榜单上。它针对现有记忆评测已趋于饱和、且忽略选型时最关键的成本与延迟问题,主张关注工具调用中真正决定成败的事实。
AICC2026 人工智能计算大会上,播客屠龙之术梳理出三条主线:从 Chat 到 Agent 的需求侧结构性跃迁、智能从概率拟合转向可信生产、以及算力与芯片在系统、器件、生态上的突围。会上 IDC 与浪潮信息联合发布《中国人工智能计算力发展评估报告》,并提到浪潮信息的智算系统双唯进化主张与新产品、芯算一体、让计算走进存储,以及 FlagOS 生态下的国产模型与国产芯片 Day 0 适配。
一个智能体记忆基准需满足三项属性:按行动评分、在准确率之外同时衡量成本与延迟、以及可解性认证(带历史能通过、不带历史则失败)。该观点用于对比现有的 Agent Memory Benchmarks。
Anthropic 成立生命科学实验室,让 Claude 智能体在 DNA 数据库中自主搜索,发现了一种与重复序列关联的新型逆转录酶系统 ART,相关预印本已发布。
Firecrawl 宣布将这笔资金用于 Alexandria,帮助研究者、出版商、专家、内容创作者和数据提供方获得报酬,以便为 AI 智能体提供更好的信息。该平台现已开放提供方等待名单(waitlist)申请。