新模型正在带来变革,用户称其"jevolutionizing"
有用户称一款新模型正在带来变革("jevolutionizing what new model can do"),相关内容获得 93 次点赞、7 条回复、3 次转发和 10064 次浏览,但未透露模型名称与具体能力。
有用户称一款新模型正在带来变革("jevolutionizing what new model can do"),相关内容获得 93 次点赞、7 条回复、3 次转发和 10064 次浏览,但未透露模型名称与具体能力。
LangChain 将于下周二举办直播,由工程团队的 Sydney Runkle 讲解 TypeSafe AI 的新模型 Jev 如何用于 AI 智能体。该模型在分类任务上据称推理速度最高快 200 倍、成本低 400 倍,目标是解决智能体循环慢且昂贵的问题。直播内容涵盖 Jev 在智能体循环中的位置以及如何搭建 harness。
PrismML 宣布推出 Ternary Bonsai 2 27B,基于 Qwen3.8 27B,体积比全精度版本小 9 倍,仍保留 98.2% 的综合基准性能,占用仍为 5.9 GB,今日以 Apache 2.0 许可开放。
xAI 发布 Grok Voice Transcribe 2.0,称其为全球最准确的语音转写模型。原文未给出具体准确率数据、语言支持范围或开放使用方式。
Muse Image、MAI-Image-2.6 和 GPT Images 2.5 在近几周大幅推进了文生图在价格与速度两个维度上的帕累托前沿,Artificial Analysis 的数据显示生成高质量图像比以往更便宜、更快。Mustafa Suleyman 称这是全球图像生成领域最佳的性价比表现。
豆包2.1 Pro 0915版进入火山方舟模型列表,支持百万 Token 上下文与多模态编程,并强化长程 Agent 协作与异步子任务验收。Anthropic 开源含 36 套工具的生物模型推理优化工具集,报告平均提速约 4 倍,其中 FlashPairformer 专用内核加速结构预测,仓库为研究参考发布、不计划持续维护。
新一代原生全模态模型 Qwen3.8-Omni-Flash 正式上线千问AI平台,支持文本、图像、音频和视频输入以及 1M 长上下文,目标是把全模态能力从理解内容推进到规划任务、调用工具并完成创作。
原文给出全模态模型的评测提升、API 降价幅度与配套开源工具,读者可据此判断音视频智能体的落地成本变化。
Jev 决策模型已在 OpenRouter 上线,定位为 System One,不做长文生成,只处理布尔判断、枚举选择、候选打分三类决策任务。它不兼容 OpenAI Chat Completions 格式,需用 Decisions API 自行拼 state 与 questions。典型场景包括搜索意图识别、本地模型网关路由和多 Agent 协作中的 Bot 分派。
智谱正式推出 GLM-5.3-FlashX,最高 200 tokens/s,API 已上线,Model Key 为 GLM-5.3-FlashX。官方称该版本前身以 Ox Alpha 之名与开发者见面,调用量持续攀升,此次在10万张国产芯片提供的推理算力基础上加大 Infra 投入与推理优化。GLM-5.3-Flash 长期保持同尺寸最强智能水平,本次提速进一步形成智能、价格、速度的全面竞争力。
Qwen 公布了更多案例与细节,相关视频需在支持 video 标签的浏览器中查看。原文仅附链接与互动数据,未披露模型版本、参数或具体功能信息。
Qwen 发布内容聚焦"性能与价格"这一主题,未披露具体模型版本、参数规模或定价数字。该条内容互动数据为 4 条回复、5 次转发、182 个点赞、27766 次浏览。
阿里发布 Qwen3.8-Omni-Flash,称其为 Qwen 首个围绕智能体能力构建的全模态模型,将原生音视频理解、推理与工具调用整合在同一模型中,实现理解内容、规划任务、用工具执行并交付结果。
TypeSafe AI 发布新模型 Jev,它不生成文字,只输出决策与置信度,定位为 System One Model 通用分类器,主打高频判断场景。官方称其速度比常规大模型快 20~200 倍、成本低 40~400 倍,价格为 0.042 美元/百万 Token,输出 Token 免费,并采用名为 RLCD 的面向校准决策的强化学习方法。
Character.AI 对开源图像模型进行后训练,做出自己的 CAI-Image 模型家族,目标是让同一个 Character 在故事所需的每种风格、场景和页面中都保持可识别。该模型家族支撑 Character.ai 上的 Comics 与图像生成功能。
NVIDIA AI 转发 World Labs 的测试:给世界模型 Atlas 输入 32 张 NVIDIA Voyager 总部图像,Atlas 以前述图像作为 3D 空间上下文生成新视角,并支持实时飞行浏览与像素级精确的相机控制。
Runway 发布帧插值模型 Enhance Frame Rate,可将任意素材转换为所需帧率规格,支持 25、30、48、60、120 fps 以及 NTSC 的 59.94 标准。用户可通过官方链接开始使用。
Jina AI 推出 OCR 模型 jina-ocr-v1,已在 Hugging Face 上线可直接使用,并同步放出技术报告与模型博客。官方同时向用户征集使用反馈。
Jina AI 推出基于 DeepSeek-OCR 后训练的 jina-ocr-v1,多语言支持扩展至 25 种,并针对 NVIDIA L4 等低预算 GPU 优化。该模型在 OmniDocBench v1.6 上得分 91.14,olmOCR-Bench 上得分 83.4,页面吞吐量在所有竞品中最高。
小米 MiMo-V2.6 正处于 RL 训练中,团队近半年专注研究 RL 能扩展到多大程度。这一轮在三个方向做了扩展:每步约 2B tokens 的算力(1568 prompts × 16 rollouts,全异步)、多任务智能体 RL 环境与 harness(单次运行中混合多种 harness),以及评分算力(组内智能体信用分配,结合测试用例与 rubric 奖励)。
向阳乔木用豆包 Seed-2.1-pro-0915 实测 7 个案例,覆盖深度调研、多模态 Agent 开发、Blender 3D 建模、视频生成、钓点地图、视频剪辑与代码仓库分析。
豆包 Doubao-Seed-2.1-pro 升级到 0915 版本,官方称重点提升 Coding、Agent 与多模态能力。作者实测了用平面图和作品资料生成三维电子展馆网页、从零策划含 Office 三件套的完整游戏项目、以及借助 Blender MCP 生成白模运镜参考视频再交给 Seedance 出片等案例。
小米 MiMo 大模型负责人罗福莉宣布,新一代模型 MiMo-V2.6 处于强化学习训练阶段,训练过程实时对外直播,页面同时跑 MiMo-V2.6-Pro 和 MiMo-V2.6-Flash 两条线,数据直接来自训练器日志。
字节豆包迎来 Seed-2.1-Pro 升级,作者在内测中用豆包工作、API 接入 Codex 和 Claude Code 三种环境完成5个案例。案例包括用豆包工作连接 Godot 做完整可玩游戏、制作3D T恤定制页面、用 Methy 加 Blender 跨软件做海洋动物3D管线并测试 Unity 场景、生成飞机地球航线 web、以及网络电台音乐播放器。
社区多位用户发现请求 GPT-5.6 Sol 时返回模型名显示为 GPT-6 Sol,调用记录出现模型不一致提示;V2EX 用户通过 sub2api 反代也报告了相同现象。
Epoch AI 用 Epoch Capabilities Index(ECI)及面向数学和软件领域的 ECI 变体,对比 GPT-6 Astra、Claude Fable 5.1、GPT-5.6 Sol 和 Kimi K3 四款近期模型,结果显示 GPT-6 Astra 在数学基准上领先,但在软件工程上并非如此。
Periodic Labs 在 Menlo Park 建立高通量材料实验室,让实验与模型形成闭环:实验室产生新数据,模型从中学习并决定下一步实验方向。团队仅用 1300 张 H200,加上数月的实验数据,对一个开源模型做中期训练和 RL,得到 Neon,并称其在自己设定的分析基准上超过 GPT-6 Astra。团队表示先聚焦材料科学难题,包括超导体、磁体和半导体材料。
材料给出了高通量材料实验室与模型闭环的训练路径和硬件规模,读者可据此了解实验数据驱动的模型迭代方式。
OpenAI 宣布将于 10 月 14 日在 ChatGPT、ChatGPT Work 和 Codex 的所有套餐中下线 GPT-5.5。在 Codex 中使用 GPT-5.5 的用户被建议切换到 GPT-5.6 Sol 或 GPT-6 Astra。
Google DeepMind 推出两款面向 Live API 的 Gemini 模型:Gemini 3.8 Live 和 3.8 Live Extended Thinking,官方称其为目前最好的对话式 AI。新模型在智能水平和并行推理上有较大升级,可在对话中思考并在后台处理任务而不打断用户流程,实时语音协作更顺畅自然,可在 ai.studio/live 测试。
Google 发布 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking 两款实时音频模型,称其为新的 SOTA 实时音频模型,并提供前沿级别的价格与性能。Gemini 3.8 Live 支持 97 种语言且可无缝切换,并支持异步工具调用。
Gemini 3.8 Live 与 3.8 Live Extended Thinking 发布,延续上月 3.5 Transcribe 对实时语音智能体的投入。
Gemini 3.8 Live 公布了实时语音定价与智能体任务得分,可据此判断实时语音智能体的能力与接入方式。
Google 发布两款 Gemini Audio 模型。Gemini 3.8 Live 主打规模、速度与成本效率,支持句子中途打断、在 97 种语言间即时切换,并能理解视觉上下文;Gemini 3.8 Live Extended Thinking 面向更复杂任务,可边推理边说话,并在工作时同步播报进展,以处理活动策划这类多步骤后台项目而不打断对话。
Google 宣布 Gemini 3.8 Live 正在推送,消费端进入 Search Live,开发者可在 Gemini API 通过 Google AI Studio 公开预览,企业端通过 Gemini Enterprise 定向预览。
Google DeepMind 发布两款实时对话模型 Gemini 3.8 Live 与 Gemini 3.8 Live Extended Thinking,分别面向规模化低成本场景和高复杂度多步推理任务。
Google DeepMind 推出 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking,官方称其为最强对话式 AI。这两款模型可对话、思考,并在后台处理任务而不打断用户当前流程。
NVIDIA Nemotron Labs 推出「Ask the Experts」栏目,专门解读 Nemotron 的后训练流程。内容以直播形式发布,原帖附带 x.com 直播链接。
Claude Fable 5.1 在 Artificial Analysis 的 Intelligence Index v4.2 上守住第一,并与 OpenAI 的新模型在更新后的基准测试中并列。
阶跃星辰发布 StepAudio 3 系列语音大模型,包含 Realtime、ASR、TTS、Gen 和 Music 五款模型,均已上线阶跃星辰开放平台。
Reward AI 推出首个机器人基础模型 OM-1,可零样本泛化到桌面机械臂、工业机械臂和人形机器人等任意机器人本体。该模型直接从人类操作数据中学习,无需遥操作或机器人数据,据称在灵巧度与效率上接近人类水平,并支持多机器人协作。
Google DeepMind 的 WeatherNext 3 改为每小时更新一次,用于应对快速变化的天气条件。该模型可为风电场预测高达 100 米处涡轮机的风速与风向以推算发电量,并为太阳能电站预测云量与辐射以估算到达太阳能板的日照水平。
DeepLearning.AI 指出 GPT-6 Astra 登顶 ARC-AGI-3 榜单,同时降低 token 成本。它在 Artificial Analysis 的 Intelligence Index 上与 Claude Fable 5.1 持平,并具备异步工具调用以支持并行执行、跨 API 调用保留推理记忆等特性。