世界—动作模型综述:从预测未来到机器人闭环控制
MBZUAI、Caltech 等机构发布综述《World-Action Models for Robot Learning and Control: A Survey》,系统梳理世界—动作模型(WAMs)的概念、架构、训练与评测,核心是把未来世界预测与可执行动作生成连接起来。论文按语言接口、视觉编码器、预测骨干与动作解码器拆解 WAM,并区分联合预测与逆动力学两条路径,覆盖操作、导航与自动驾驶。
MBZUAI、Caltech 等机构发布综述《World-Action Models for Robot Learning and Control: A Survey》,系统梳理世界—动作模型(WAMs)的概念、架构、训练与评测,核心是把未来世界预测与可执行动作生成连接起来。论文按语言接口、视觉编码器、预测骨干与动作解码器拆解 WAM,并区分联合预测与逆动力学两条路径,覆盖操作、导航与自动驾驶。
有用户称在 Grok bot 上搭建了一个「推特运营专家」Agent,过去一个月把推特账号从近 0 起号做到涨粉 4000+。该 Agent 每天调研热门和低粉高爆帖子、挖掘选题、按其风格写出文案并沉淀到 Notion 选题库,用户只需在 Notion 表格中筛选和提修改意见,最后人工发布。该 Bot 已开源,可通过 x.ai/bot/ScOhH1qaoq 免费使用。
LongLive-Plug 提出一种面向视频生成的“plug once-for-all”蒸馏方法,论文已发布在 Hugging Face Papers。该方法主打一次蒸馏即可通用适配,具体加速倍数与评测结果原文未披露。
Runway 机器人业务负责人 Andy Chen 阐述了 Runway 在机器人领域的独特路线,并首次发布开放权重的世界动作模型 Praxis-1。Praxis-1 已在 runway.com/praxis-1 开放提前访问申请。
Perplexity 开源其上下文嵌入模型,其中 pplx-embed-v2-context-9b-preview 在 ConTEB 和 turbopuffer 新推出的非公开 context-bench 上均刷新 SOTA。该模型采用新训练方式,编码文档每个片段时会以整篇文档为上下文。官方称其在 turbopuffer 的 context-bench 上表现最佳。
Ideogram 发布 Ideogram 4.5,称其为最精确的编辑模型。官方表示其他领先模型每次编辑都会累积伪影、像素偏移和色彩变化,而 Ideogram 4.5 消除了伪影累积,使多轮编辑成为可能。该模型已在 Ideogram、API 及发布合作伙伴处上线,开放权重即将推出。
Spotcat 是一款免费开源的 macOS 启动器,内置 AI 能力,可通过 ⌥Space 唤起,用于启动应用、查找文件、搜索网页、与 AI 智能体对话,并支持通过扩展延伸工作流。该项目由 xgo.ing 提供支持,已在 GitHub 开源并邀请用户 Star。
Audio8 ASR Infinite 是一款原生流式语音识别模型,每秒解码 12.5 次,靠滚动 KV Cache 让内存和延迟保持恒定,可支撑 24/7 连续运行。它以每个时钟步一个文本 token 的方式工作(每秒 12.5 / 8.3 / 6.25 次决策),在感知粒度与资源开销之间取得平衡。模型已在 Hugging Face 上线,并配有 Gradio 试用工作流。
LlamaIndex 发布 Jev 模型,并联合其他 OSS 模型(含通用分类器与文档专用模型)在方向检测、语言检测、分类、拆分等需快速决策的文档任务上做了基准测试,从准确率、成本、延迟三个维度评估,Jev 在多数基准中领先。模型代码与视频已通过 GitHub 仓库和 YouTube 公开。
GitHub 分享了其最高星标仓库之一的诞生历程,并附上 YouTube 视频链接。原帖未透露该仓库具体名称,仅给出视频地址 youtube.com/watch?v=5VSwaU…。
NVIDIA 发布 Kumo Tabular,一个面向表格数据的基础模型系列,据称在准确率与推理时间的权衡上建立了新的帕累托前沿。该系列以开放权重、开源软件和允许商用的宽松许可发布,已上线 Hugging Face(huggingface.co/nvidia/Kumo-Ta…)和 GitHub(github.com/NVIDIA/structu…)。
Berkeley AI 人类智能中心发布 DexTacWAM,一个将预训练视频世界模型通过持续视触觉学习改造而成的视触觉世界-动作模型,用于多指接触预测与动作生成。
Perplexity 宣布开源 Bumblebee,这是一个面向 macOS 和 Linux 的只读扫描器,用于检查开发机上的风险包、扩展和 AI 工具配置。接入 Computer 后,它能在出现新的供应链风险时触发更深层扫描;Computer 会复核 Bumblebee 与 Numbat 的发现并提出更优检测规则,但所有改动都须人工批准,智能体不能自行批准自己的变更。
Douchat 现已开源,是一个让 AI 智能体共同工作与交谈的桌面工作空间。它把 Claude Code、Codex、Gemini 等放进同一个联系人列表,支持智能体在群聊中协作并交接任务,用户可自带模型。聊天记录与记忆保留在本地机器上。
项目 douchat.ai 的 GitHub 仓库与官网 douchat.ai 链接已公开,并欢迎用户提交反馈、issue 与 PR。该条信息未披露模型名称、参数规模或具体功能细节。
NanoGPT 训练纪录被刷新至 39.9 秒,比此前的 67.6 秒缩短 27.7 秒。该方案不再优化 matmul 或增加算子,而是逐 flop 判断价值。
开源堡垒机 JumpServer 发布 v5.0.0,进入 V5 时代,核心变化是原生客户端可统一连接 SSH、RDP、Kubernetes、数据库和 Web 站点等资产。
Qdrant 发布 Constella 研究预览,这是一组围绕 400M 参数英文嵌入模型 Stella 构建的模型家族,文档向量由 Stella 编码,查询可由 Zero、Nano 或 Stella 本身编码,均搜索同一个 Qdrant 集合,因此查询编码器可按请求热插拔,无需重新嵌入。
论文提出 FuseReg,通过正则化层融合缓解表征自编码器中的重建-生成差距。论文已在 HuggingFace 上线(huggingface.co/papers/2609.31…)。
作者把自己的 SEO 文章写作流程做成了一个叫 content-gate 的 skill,用于让 AI 撰写 SEO 类文章。该 skill 基于 Google Search Central 官方文档的内容质量与合规指南,配有发布前 checklist 供 AI 自查,并提供双语本地化指南——按目标语言写作而非逐句翻译。项目已开源在 GitHub,作者已用它写过一部分文章。
idoubi 发布了 thinkany-ai 的开源仓库地址 github.com/thinkany-ai/au…,该推文获得 1062 次浏览、4 条回复、1 次转发和 3 次点赞。
autojev.ai 已开源,这是一个基于 jev 决策的模型路由器,能为本地 Agent 自动选择合适的模型处理对话请求,在速度、成本、质量之间取得平衡。
GitHub 项目 HowToLiveBetter 将 612 条生活建议整理成 33 个主题的开源指南,已获 2 万多 Star。每条建议统一标注成本、收益、证据等级与原始来源,其中 413 条为 A 级、150 条 B 级、49 条 C 级。
HelloGitHub 第 126 期收录 31 个开源项目,含为 Claude Code 显示模型、Git 分支、Token 用量与上下文占比的 ccstatusline 状态栏工具,以及可把技能一键同步到 Claude Code、Codex、Cursor 的 skills-manager。
Tw93 重新介绍了他在过年期间开发的 Mac 终端 Kaku,安装后无需配置即可使用,对 AICoding 友好,并结合自己的编程习惯做了不少顺手优化。该项目已开源并迭代 21 个版本,保持 0 issue,作者称其为自己做过的最复杂的项目。项目地址为 github.com/tw93/Kaku。
开发者 anderspitman 的 GitHub 仓库被分享后引发关注,分享者称其中自造的轮子数量多到令人惊讶。原帖仅给出仓库链接 github.com/anderspitman/a…,未说明具体项目名称与功能细节。
METR 开发并部署了一个基础的实时逐动作监控器,用 LLM judge 在智能体每次动作执行前审查,超过阈值即转人工审核并暂停评测,专注识别可能造成现实危害或试图绕过监控的行为。
AI Agent 管理平台 Paperclip 登上 GitHub 热榜第一,单日新增 2000 多 Star,总 Star 超 8.5 万,支持接入 Claude Code、Codex、Cursor 等 Agent,并提供组织架构、审批、预算与审计记录。
一个号称"决策模型界 Ollama"的项目可本地拉取并服务 Laya、decider、NLI、GLiClass 等开放决策模型,并暴露 TypeSafe 兼容 API,可用于 LLM 路由和零样本分类的本地推理底座。项目地址为 github.com/ollaya-dev/oll。
TypeSafe AI 推出决策模型 Jev 后,开源项目 Laya 作为其开源版非自回归决策模型上线一周左右获得近 2 万个 Star,它不做文本生成,只根据输入文本和问题在几十毫秒内返回结构化答案和概率。
HuggingFace 开源 SmolDataEnvs,包含 5,000 个可验证的 RL 环境任务,面向代码和数据科学领域的小模型能力爬坡,环境、评测与训练全部开源。该数据集由 @adithya_s_k 贡献,已在 HuggingFace 上发布。
Qdrant 在 Hugging Face 上免费开源了嵌入向量生成工具 Supernova 和 10B 数据集 Qdrant-FineWeb-10B,可用于评估、测试和配置向量搜索基础设施。BetterStackHQ 还发布了讲解这些资源的高质量视频。
Qdrant 用 Rust 重写 cross-encoder 推理并开源为 cross-encode-rs,在小型 reranking 模型上中位延迟仅比 Python 快 1.1x,较大模型上约 1.4x。
小米 MiMo 基础模型权重已在 Hugging Face 上线,同时发布了量化 GGUF 版本,分别托管于 XiaomiMiMo/MiMo 与 bartowski/MiMo 仓库。两个链接均指向 Hugging Face 的模型发布页,方便开发者下载部署。
Pruna-Qwen-Image-2.1 是一组少步 LoRA 适配器,可让 Qwen-Image-2.1 的图像生成与编辑最高提速 6.3 倍,生成或编辑一张图只需 5 步或 8 步,而非原来的 40 步。5 步用于追求最高速度,8 步用于速度与质量的最佳平衡,Hugging Face 上有对应工作流可试用。
Gumroad 创始人 Sahil Lavingia 把《The Minimalist Entrepreneur》(中文版《小而美》)做成了一系列 skills,已发布在 GitHub 的 slavingia/skills 仓库。这些 skills 按几个常见场景和步骤拆分,适合想做产品和个人品牌的人参考。
开源库 OpenSEO 近日获得大量推荐,GitHub stars 已达 2 万,并对 agent 友好,号称可替代 Semrush 和 Ahrefs。发帖者询问实际用过的用户:效果真的不错,还是只是 hype?
中国电信星辰通用人工智能实验室开源 1.2B 参数文档解析模型 TeleOCR,在 OmniDocBench v1.6 取得 96.87 总分登顶榜单,并拿下 PureDocBench 榜首和 ICDAR-2026 科学图解析挑战赛冠军。
Contrastive Language Models 已在 Hugging Face 发布,项目主页为 huggingface.co/Contrastive-LM。该发布帖获得 549 点赞、49 次转发和 17 条回复,浏览量约 57860。
NVIDIA 发布 NV-Reason-CT,一款面向放射科医生链式推理的开源 3D CT 视觉语言模型。当前通用前沿模型在 3D CT 这类体成像上表现不佳,多数开放医疗 AI 模型也缺乏相应能力。