Perplexity 开源 pplx-embed-v2-late 多向量嵌入模型,9B 与 0.6B 双版本
Perplexity 开源 pplx-embed-v2-late,包含 9B 和 0.6B 两个晚期交互多向量嵌入模型,用于检索文本、图像和页面,二者共享同一嵌入空间以支持跨模型查询。
Perplexity 开源 pplx-embed-v2-late,包含 9B 和 0.6B 两个晚期交互多向量嵌入模型,用于检索文本、图像和页面,二者共享同一嵌入空间以支持跨模型查询。
OpenAI 宣布 GPT-6 与 Intelligent UI 开始在 ChatGPT 面向所有用户推送。Intelligent UI 提供快速、可交互的答案,让日常问题更直观、复杂话题更易理解,并可在回答中直接调用与当前任务相关的交互工具。
OpenAI 官方宣布 GPT-6 与 Intelligent UI 在 ChatGPT 全量上线,读者可了解交互形式与答案呈现的变化。
Mistral Large 4 预览版在 Code Arena: WebDev 以 1534 分位列第 45 名,比 Mistral Large 3 提升 304 分,使 MistralAI 进入该榜前 15 实验室,是唯一上榜的欧洲实验室。
Claude Haiku 5.5 现可在 Arena 的 Battle Mode 和 Agent Mode 中测试,入口为 arena.ai。该消息由 LMArena 发布,未披露模型参数、上下文长度或跑分数据。
Anthropic 发布 Claude Haiku 5.5,官方称这是其推出的最便宜、最快、能力最强的小模型,平均运行成本比 Claude Haiku 4.5 低约 75%。该模型现已加入 Agent Arena,可在其中使用网页搜索、文件系统和终端工具完成长流程智能体任务,成绩尚未公布;同时也在 Code Arena 的 WebDev、Text、Document 和 Vision 板块上线。
Mistral AI 的 Mistral Large 4 是一个 1T 参数、49B 激活的模型,权重将于月底开放。
Claude Haiku 5.5 在 Code Arena 得分 1587 分,比 Haiku 4.5 的 1330 分提升 257 分,且各分类均有明显进步。相关榜单可在 Code Arena: WebDev(arena.ai/leaderboard/co…)查看。
Anthropic 在 X 上宣布推出最新模型 Claude Haiku 5.5。该帖未披露参数、能力指标或开放范围等细节。
Mistral Large 4 在 Agent Arena 超过 5000 场真实智能体会话中录得 -6.6% 的净提升分数,位列总榜第 43,比上一版本 Mistral Medium 3.5(-12.60%)高 11 个名次。
星动纪元自研的世界动作模型VPP2登顶RoboDojo仿真榜单,平均成功率32.26%、平均得分39.26分,两项均列第一,领先GPT-6-Astra。该模型未额外加数据、未用Agent RSI等增强手段,仅靠标准数据集,在泛化、精细操作、记忆三个维度也拿下第一。团队将视频预测与动作学习分阶段训练,真机ALOHA零样本操作平均成功率58.5%,高于π0.5的40%,现已在GitHub开源。
OpenAI 宣布在 ChatGPT 上线 GPT-6 系列模型与全新 Intelligent UI 交互界面。Plus 及更高付费订阅用户即日起可使用 GPT-6 Sol,免费版与 Go 档位用户自 10 月 8 日起可使用轻量模型 GPT-6 Luna。
读者可了解 GPT-6 系列在 ChatGPT 的分档开放方式,以及新交互界面如何让模型直接渲染交互组件。
OpenAI 推出 GPT-6.1 Sol Ultrafast,覆盖 API、Codex 和 ChatGPT Work,智能水平接近 Astra,速度最高为 Sol Standard 的 8 倍,Ultrafast API 定价为每百万输入 token 12 美元、输出 token 60 美元。
DeepLearning.AI 发布智能体研究模型与配套框架 AREX,它会逐条要求核验答案,保留已验证部分,只针对缺口继续研究。AREX 在 BrowseComp 上取得 82.5%,在 WideSearch-en 上 F1 为 82.0;仅使用该框架最多可提升 10 分,微调后的 4B 模型在 6 项基准中的 5 项上优于未微调的 35B 模型。
LightOn OCR-3 已在 OpenDocRouter 上线,定价 $0.28 / 1m input、$1.40 / 1m output,在 ParseBench 上约 $3.19 / 1k 页。
OpenAI 解雇了 Tomek Korbak、Mikita Balesni 和 Jasmine Wang 三名安全研究员,三人发公开信称因"把安全置于公司短期利益之上"被辞退,OpenAI 称其不当处理机密信息。
OpenAI Developers 宣布 Ultrafast 今天起在 API、Codex 和 ChatGPT Work 中面向 GPT-6.1 Sol 上线。官方称其具备接近 Astra 级别的智能水平,速度最高可达 Sol Standard 的 8 倍。
Odyssey 发布 Odyssey-3 系列世界模型,其中 Odyssey-3 Pro 在 Physics-IQ Verified 上刷新最高分,该基准要求模型续写真实物理实验视频。
GPT-6 Astra 读取用户的 Memory 后,按个人喜好用 Blender 建模的几个模型做出一张海报,模型的细节、材质、光影都处理得很好。该演示展示了它在 3D 方向的表现。
Google Gemini 4 Argon 在 Artificial Analysis Intelligence Index 上以 53 分追平 GPT-6 Astra,单任务成本约为后者 60%。
OpenAI 宣布面向全球所有 ChatGPT 用户(含免费和付费用户)推出 GPT-6,取代 ChatGPT 中的 GPT-5.6 Sol 和 GPT-5.6 Luna,但通过 Codex 和 ChatGPT Work 访问这两款模型的用户仍使用之前发布的版本。
OpenAI 将 GPT-6 开放给免费用户并引入可自主生成交互界面的 Intelligent UI,读者可据此了解这一交互形态的变化。
Claude haiku 5.5 的定价被吐槽不合理:上下文超过 100k 后价格直接变为 5 倍。该帖引发 38 条讨论、146 次点赞,浏览量达 57068。
JetBrains 发布开源模型 Mellum2.1,这是 6 月开源的 12B MoE 模型的新版本,架构未变,仍为 2.5B 激活参数、Apache 2.0 许可,改进集中在预训练之后的强化学习阶段。
Anthropic 发布 Claude Haiku 5.5,OSWorld 2.1 评测从上一代 15.7% 提升到 72.4%,平均运行成本下降约 75%,并首次支持可调节推理强度的 Adaptive Thinking 与 100 万 Token 上下文。
Anthropic 于 10 月 7 日发布 Claude Haiku 5.5,面向摘要、上下文压缩、数据库查询和分类等高频任务,是首款支持可调推理强度的 Haiku 模型,提示词不超过 10 万 Token 时每百万输入、输出 Token 分别为 0.10 美元和 0.50 美元,当前未开放模型权重。
Anthropic 发布 Claude Haiku 5.5,这是 Haiku 系列约一年来的首次更新,定价与 OpenAI 的 GPT-6 Luna 持平,同日 Sonnet 5.5 缓存读取价格减半并推出订阅 API 额度。
汇总了 Haiku 5.5 的定价、第三方评测与 token 消耗代价,读者可据此判断小型模型在智能体工作流中的实际位置。
谷歌于 10 月 6 日开源 EmbeddingGemma 2,这是其首个原生多模态开源嵌入模型,可把文字、代码、图片、视频、音频放进同一个 768 维空间并用一句话检索。
Cloudflare 在 Birthday Week 期间发布开源权重决策模型 Clef,包含 27B 多模态模型和面向延迟敏感场景的 9B 模型 Clef-Flash,输入为状态与带类型问题的 schema,输出每个候选项的概率,不生成自由文本。
OpenAI 在 X 上宣布 GPT-6 开始向全球 ChatGPT 用户分批推送,付费用户先行,10 月 8 日起扩展到 Free 和 Go,免费版与 Go 使用 GPT-6 Luna,付费档日常 Chat 使用 GPT-6 Sol。
GPT-6 向免费用户开放并带来回答内可交互的智能 UI,读者可据此判断日常问答形态的变化。
OpenAI 宣布 GPT-6 面向全球推送,付费用户先行,10 月 8 日起免费用户也能使用,正式取代 GPT-5.6 Sol 和 Luna,并带来可自动生成图表、按钮、表单的 Intelligent UI。
Anthropic 的 Haiku 5.5 定价低于 DeepSeek-V4.1 flash 和智谱 GLM 5.3 flash,在 Terminal Bench 4.0 上比 GLM 5.3 flash 高一分,与其他两个中国竞品相当或更高。Anthropic 还向每个 Max 和 Team 用户赠送对应额度的 API 金额,该 API 可在任何支持输入 API 的产品中使用。
Mistral 发布原生多模态 MoE 模型 Mistral Large 4(昵称“Le Chonk”)公开预览,总参数 1 万亿、激活约 490 亿,可通过 Mistral Studio API 试用,权重计划月底发布。
OpenAI 宣布 GPT-6 正式全量上线,向全球每周超 12 亿 ChatGPT 用户开放,高级付费用户由 GPT-6 Sol 驱动,免费用户由 GPT-6 Luna 驱动。
OpenAI 为 GPT-6 引入原生流式渲染的智能 UI,可作为观察聊天界面能否取代固定软件形态的样本。
DeepSeek 针对智能体"读多写少"的特点压缩了其记忆机制,每 token 仅占 890 字节缓存,比 DeepSeek-V1 小 437 倍。输入从 4K 扩展到 1M 时,每输出 token 的算力增加 25%。Flash 在 AA Index 上以 39 比 36 超过 V4-Pro,价格为每百万 token 0.27 美元对 0.67 美元。
Anthropic 发布快速低价模型 Claude Haiku 5.5,价格与 OpenAI 上月发布的 GPT-6 Luna 完全一致,为每百万 token 输入 0.10 美元。
AWS 宣布 Claude Haiku 5.5 已在 Amazon Bedrock 和 Claude Platform on AWS 上线。据 Anthropic 介绍,它是 Claude 5.5 家族中速度最快、效率最高的模型,面向子智能体和高并发成本敏感场景,多数任务成本比 Claude Haiku 4.5 低约 75%。
GPT-6 with Intelligent UI 今日面向 Plus、Pro、Business 和 Enterprise 用户全球推送,明天起扩展至 Free 和 Go 用户。
官方给出 GPT-6 在各订阅档位的模型分配与分层推送时间,可据此判断自己何时能用上。
Anthropic 发布 Claude Haiku 5.5,加入 5.5 系列,官方称其为迄今最便宜、最快且能力最强的小模型。它在运行时平均成本约为 Claude Haiku 4.5 的 25%,即低约 75%。Mike Krieger 表示 Opus 负责重推理,Haiku 承担高吞吐工作。
Perplexity 将两款模型发布到 Hugging Face,并给出了对应的模型集合链接。原文未披露模型名称、参数规模或具体能力信息。
Perplexity 发布 pplx-embed-v2-late,包含两个 late-interaction 嵌入模型,可在共享嵌入空间中检索文本、图像和页面,支持跨模态查询。两个模型均达到前沿性能,并已在 Hugging Face 公开提供。
Google 发布 Gemini 3.8 Live 语音到语音模型,将听、推理和回应放在一个系统中,跳过语音转文字再转语音的接力流程。Extended Thinking 版本在 Artificial Analysis 的 Speech to Speech Index 排名第一,标准版在真人盲测实时对话中排名第二。