Jina AI 发布 jina-ocr-v1:基于 DeepSeek-OCR 后训练,支持 25 种语言
Jina AI 推出基于 DeepSeek-OCR 后训练的 jina-ocr-v1,多语言支持扩展至 25 种,并针对 NVIDIA L4 等低预算 GPU 优化。该模型在 OmniDocBench v1.6 上得分 91.14,olmOCR-Bench 上得分 83.4,页面吞吐量在所有竞品中最高。
Jina AI 推出基于 DeepSeek-OCR 后训练的 jina-ocr-v1,多语言支持扩展至 25 种,并针对 NVIDIA L4 等低预算 GPU 优化。该模型在 OmniDocBench v1.6 上得分 91.14,olmOCR-Bench 上得分 83.4,页面吞吐量在所有竞品中最高。
小米 MiMo-V2.6 正处于 RL 训练中,团队近半年专注研究 RL 能扩展到多大程度。这一轮在三个方向做了扩展:每步约 2B tokens 的算力(1568 prompts × 16 rollouts,全异步)、多任务智能体 RL 环境与 harness(单次运行中混合多种 harness),以及评分算力(组内智能体信用分配,结合测试用例与 rubric 奖励)。
字节豆包迎来 Seed-2.1-Pro 升级,作者在内测中用豆包工作、API 接入 Codex 和 Claude Code 三种环境完成5个案例。案例包括用豆包工作连接 Godot 做完整可玩游戏、制作3D T恤定制页面、用 Methy 加 Blender 跨软件做海洋动物3D管线并测试 Unity 场景、生成飞机地球航线 web、以及网络电台音乐播放器。
Periodic Labs 在 Menlo Park 建立高通量材料实验室,让实验与模型形成闭环:实验室产生新数据,模型从中学习并决定下一步实验方向。团队仅用 1300 张 H200,加上数月的实验数据,对一个开源模型做中期训练和 RL,得到 Neon,并称其在自己设定的分析基准上超过 GPT-6 Astra。团队表示先聚焦材料科学难题,包括超导体、磁体和半导体材料。
材料给出了高通量材料实验室与模型闭环的训练路径和硬件规模,读者可据此了解实验数据驱动的模型迭代方式。
Google DeepMind 推出两款面向 Live API 的 Gemini 模型:Gemini 3.8 Live 和 3.8 Live Extended Thinking,官方称其为目前最好的对话式 AI。新模型在智能水平和并行推理上有较大升级,可在对话中思考并在后台处理任务而不打断用户流程,实时语音协作更顺畅自然,可在 ai.studio/live 测试。
Google 发布 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking 两款实时音频模型,称其为新的 SOTA 实时音频模型,并提供前沿级别的价格与性能。Gemini 3.8 Live 支持 97 种语言且可无缝切换,并支持异步工具调用。
Gemini 3.8 Live 与 3.8 Live Extended Thinking 发布,延续上月 3.5 Transcribe 对实时语音智能体的投入。
Gemini 3.8 Live 公布了实时语音定价与智能体任务得分,可据此判断实时语音智能体的能力与接入方式。
Google 发布两款 Gemini Audio 模型。Gemini 3.8 Live 主打规模、速度与成本效率,支持句子中途打断、在 97 种语言间即时切换,并能理解视觉上下文;Gemini 3.8 Live Extended Thinking 面向更复杂任务,可边推理边说话,并在工作时同步播报进展,以处理活动策划这类多步骤后台项目而不打断对话。
Google 宣布 Gemini 3.8 Live 正在推送,消费端进入 Search Live,开发者可在 Gemini API 通过 Google AI Studio 公开预览,企业端通过 Gemini Enterprise 定向预览。
Google DeepMind 发布两款实时对话模型 Gemini 3.8 Live 与 Gemini 3.8 Live Extended Thinking,分别面向规模化低成本场景和高复杂度多步推理任务。
Google DeepMind 推出 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking,官方称其为最强对话式 AI。这两款模型可对话、思考,并在后台处理任务而不打断用户当前流程。
NVIDIA Nemotron Labs 推出「Ask the Experts」栏目,专门解读 Nemotron 的后训练流程。内容以直播形式发布,原帖附带 x.com 直播链接。
阶跃星辰发布 StepAudio 3 系列语音大模型,包含 Realtime、ASR、TTS、Gen 和 Music 五款模型,均已上线阶跃星辰开放平台。
2026 年 9 月 14 日 Imagination In Action 硅谷 AI 峰会上,嘉宾反复提到模型能力仍在变强但已不值钱,真正的门槛转向速度、路由架构、专有数据和物理供应链。
Reward AI 推出首个机器人基础模型 OM-1,可零样本泛化到桌面机械臂、工业机械臂和人形机器人等任意机器人本体。该模型直接从人类操作数据中学习,无需遥操作或机器人数据,据称在灵巧度与效率上接近人类水平,并支持多机器人协作。
Google DeepMind 的 WeatherNext 3 改为每小时更新一次,用于应对快速变化的天气条件。该模型可为风电场预测高达 100 米处涡轮机的风速与风向以推算发电量,并为太阳能电站预测云量与辐射以估算到达太阳能板的日照水平。
Yann LeCun 指出,现代 AI 系统底层的 LLM 是自回归的,但 AI 系统本身不是:所谓"reasoning"系统会生成大量 token 序列并挑选最优解,这属于非自回归搜索。他认为当前系统的错误在于把搜索放在离散 token 空间,主张 planning/reasoning 的 inference-by-search 应在抽象表示空间完成,因为人类的推理与规划大多与语言无关。
小红书 AllSpark 团队发布 Search Agent Iris,权重与评测代码已开源,并计划陆续公布数据与训练完整配方。
LovartAI 展示了一段 GPT-Image 2.5 的演示,用户只需说“GPT-Image 2.5, help me arrange the flowers.”,模型便能完成插花安排。该内容在 X 上获得 31 个点赞、7 条评论和约 2 万次浏览。
ChatGPT Work 和 GPT-6 Astra(作者用的是 "Max")能基于 OSM 数据,从给定地址生成 5K/10K 环形跑步路线。该体验由 Simon Willison 分享,称其"挺不错"。
GPT-VI ASTRA 亮相,相关视频已在 X 上发布,该帖获得 4431 次点赞、196 次转发和 298 条回复,浏览量达 550388。目前公开信息仅包含该视频演示,尚未披露模型参数、上下文长度或可用性细节。
Mustafa Suleyman 在 X 上发帖,引导读者前往 microsoft.ai/models/mai-tra… 了解该模型详情,正文未披露模型名称、参数规模或评测数据。
GPT-Image 2.5 在像素艺术上表现出色,相关演示视频已在 Twitter 发布,获得 639 次点赞、48 次转发和 5.6 万余次浏览。该推文由 xgo.ing 提供支持。
腾讯混元团队在北京接待 Ivan Fioravanti 后预告,Hy4 Preview 只是冰山一角,未来还会有更多 AI 产品发布。Fioravanti 参观了腾讯北京总部,并与混元团队讨论了混合 AI 场景等话题,称期待看到腾讯近期交付的新成果。
Ollama 宣布 DeepSeek-V4.1-Flash 正在 Ollama 云端推送,先面向 Max 和 Team 账号开放,随后扩展到 Pro 订阅用户。官方表示正在快速增加容量,以便向所有订阅用户推送。
Cognition 发布 SWE-2,称这是其目前最接近前沿的模型,在主要评测上与近期前沿模型持平,成本最高降低 70%。该模型将强化学习扩展到数万亿参数规模,使用改进后的配方同时推进能力与成本两个维度。Fireworks 表示参与了其背后的基础设施栈,并链接了自家关于 RL 的博客文章。
GPT-6 Astra 在抗体可开发性预测基准测试中成为表现最好的前沿模型,在聚集性、稳定性、成药性等可开发性属性上的预测优于其他受测前沿模型。展示抗体工作机理的交互式可视化同样由 Astra 构建,耗时约 1 小时。
Cognition 发布 SWE-2,官方称这是其迄今最接近前沿水平的模型,在主流评测上得分与近期前沿模型持平,成本最高低 70%。Scott Wu 表示,这是团队第一个性能可与前沿水平相比的模型,将把 RL 扩展到数万亿参数规模,并在能力与成本两端同时推进帕累托曲线。SWE-2 面向 Devin 套餐用户免费开放一个月。
Genspark 推出首个自研 AI 模型 Gen-1 Slides,官方称其性能与最先进的前沿模型相当,价格仅为后者的 1/17。该模型已在 genspark.ai 上线,可通过 ai_slides 页面体验。
Genspark 发布其首个面向知识工作的 AI 模型 Gen-1 Slides,基于开源权重基座并与 Fireworks AI 共同训练,现已驱动 Genspark AI Slides 的 Standard 模式。官方称其生成质量对标前沿模型,价格约为 Opus 5 的 1/17。
Genspark 发布其首个面向知识工作的模型 Gen-1 Slides,由 Genspark 与 Fireworks AI 基于开源权重底座训练,现已驱动 Genspark AI Slides 的 Standard 模式。官方称其质量达到前沿水平,价格约为 Opus 5 的 1/17,完整说明见 Genspark 博客。
Cognition 发布 SWE-2,称其是在前沿能力上最接近自家前沿水平的模型,在主要评测上得分与近期前沿模型相当,成本最多低 70%。该模型已可在 Devin Desktop 和 CLI 使用,Pro、Teams 用户及接下来一个月可无限使用。团队称将 RL 扩展到数万亿参数规模,配方在能力与成本上同时推进帕累托曲线。
Genspark 发布其首个面向知识工作的模型 Gen-1 Slides,与 Fireworks AI 合作基于开源权重底座训练,现已驱动 Genspark AI Slides 的 Standard 模式。官方称其可生成前沿质量幻灯片,价格约为 Opus 5 的 1/17,博客全文见 genspark.ai/blog/gen-1-sli。
腾讯混元正式发布开源基础模型 AuK,面向统一语音生成与编辑,支持自然语言指令加参考音频的单一接口,能力覆盖零样本 TTS、指令控制生成、内容编辑、Whisper-conversion、去口音以及音色、风格、情感编辑和语速、音高控制,还包括增强、降噪、多说话人分离与音乐分离。
DeepSeek 宣布将与开源社区紧密合作,推进 V4.1-Flash 的推理支持,并探索更多部署选项,同时开放 2000 块 GPU 加存储集群的大规模部署合作洽谈。相关模型已发布在 Hugging Face 的 deepseek-ai 主页。
DeepSeek 在 API 上线 V4.1-Flash,原生支持多模态,模型名设为 deepseek-flash。
DeepSeek V4.1-Flash 相比上一代大幅压缩 KV cache,所需 HBM 仅为 1/4、SSD 存储仅为 1/8。缓存命中费用常占 AI 智能体成本的很大一部分,压缩缓存可显著降低这部分开销。
DeepSeek 发布新模型,采用 552B 参数的 MoE 非对称架构。其新 Causal Encoder–Decoder 架构在输入端仅激活 8B 参数、输出端激活 16B 参数。官方称新预训练方法配合更大规模 RL 后训练,基准测试结果超过包括 DeepSeek-V4-Pro 在内的旗舰模型。
DeepSeek 发布 DeepSeek-V4.1-Flash,是新架构家族中体量最小的模型,原生支持视觉理解。该模型主打更强能力、更快推理与更高吞吐,并可扩展至更大模型。
DeepSeek 正式发布 DeepSeek V4.1 Flash,这是其全新模型结构系列中最小尺寸的模型,具备原生多模态视觉理解能力。该模型为 552B 参数的 MoE 模型,采用 Causal-Encoder-Decoder 非对称结构,输入激活 8B、输出激活 16B,官方称其在基准测试中超越了包括 DeepSeek V4 Pro 在内的旗舰模型。
官方给出新模型的参数结构、KV Cache 压缩与定价变化,可据此判断 Agent 类任务的成本走向。