Anthropic 的 Haiku 5.5 已在 AWS、Google Cloud 和 Microsoft Azure 全平台上线
Anthropic 宣布 Haiku 5.5 现已在所有平台上线,包括 Amazon Web Services、Google Cloud 和 Microsoft Azure。官方给出详情链接 anthropic.com/claude-haiku-5。
Anthropic 宣布 Haiku 5.5 现已在所有平台上线,包括 Amazon Web Services、Google Cloud 和 Microsoft Azure。官方给出详情链接 anthropic.com/claude-haiku-5。
Anthropic 将 Claude Sonnet 5.5 的缓存读取价格减半,降至每百万 token 0.10 美元。官方称这一调整使 Sonnet 5.5 在大多数长时任务上的运行成本降低约 20%。
GPT-6 开始面向每周超过 12 亿 ChatGPT 用户全面推送,并带来全新的 Intelligent UI 能力。该能力让回复可用文本、图形、按钮、表单、图表乃至交互式工具共同组织:对比类问题并排呈现,原理类问题用交互式图解,简单问题仍用纯文本。
GPT-6 把回复从纯文本扩展到可交互界面,文中给出了组件库和界面编译器两层实现思路。
Claude Haiku 5.5 的 benchmark 全面领先 GPT-6 Luna,OpenRouter 观测到的 token 输出速度也是 2 倍。Anthropic 官方称 Claude Haiku 5.5 是迄今最便宜、最快、最强的小模型,运行成本比 Claude Haiku 4.5 低约 75%。
Anthropic 发布 Claude Haiku 5.5,10 万 Token 以内请求每百万 Token 输入 0.1 美元、输出 0.5 美元,比 Haiku 4.5 便宜 90%,官方估算平均运行成本降约 75%。
宝玉指出 Haiku 5.5 的价格看似很低,但上下文一旦超过 100K,价格会上涨 5 倍,这一细节在价格页被隐藏起来。他引用其他用户的说法称这是阶梯定价,对比之下 GPT 的分界线是 272K,并认为这种设计相当于面向 Benchmark 的特化优化。
Perplexity 开源 pplx-embed-v2-late,这是面向文本与图像的多向量嵌入模型,提供 9B 和 0.6B 两个版本并共享同一嵌入空间。其中 9B 可用于索引多模态数据,0.6B 可用于端侧查询,还支持无需 OCR 直接搜索 PDF 页面。官方称其在 MADQA 上得分 92.4%,在 BrowseComp+ 上得分 64%,权重已在 Hugging Face 发布。
Mistral Large 4 预览版在 Code Arena: WebDev 以 1534 分位列第 45 名,比 Mistral Large 3 提升 304 分,使 MistralAI 进入该榜前 15 实验室,是唯一上榜的欧洲实验室。
Anthropic 发布 Claude Haiku 5.5,官方称这是其推出的最便宜、最快、能力最强的小模型,平均运行成本比 Claude Haiku 4.5 低约 75%。该模型现已加入 Agent Arena,可在其中使用网页搜索、文件系统和终端工具完成长流程智能体任务,成绩尚未公布;同时也在 Code Arena 的 WebDev、Text、Document 和 Vision 板块上线。
Mistral AI 的 Mistral Large 4 是一个 1T 参数、49B 激活的模型,权重将于月底开放。
Claude Haiku 5.5 在 Code Arena 得分 1587 分,比 Haiku 4.5 的 1330 分提升 257 分,且各分类均有明显进步。相关榜单可在 Code Arena: WebDev(arena.ai/leaderboard/co…)查看。
Arena.ai 公布 Claude Haiku 5.5 (High) 在 Code Arena: WebDev 的真实评测结果,首秀以 1587 分排在第 30 位,略在帕累托前沿之外,但仍然具备很强的成本效率。
Anthropic 在 X 上宣布推出最新模型 Claude Haiku 5.5。该帖未披露参数、能力指标或开放范围等细节。
Mistral Large 4 在 Agent Arena 超过 5000 场真实智能体会话中录得 -6.6% 的净提升分数,位列总榜第 43,比上一版本 Mistral Medium 3.5(-12.60%)高 11 个名次。
Edge0 团队开源一个月后,其 35B 模型已能在 iPhone 飞行模式下运行,峰值内存仅 1.8GB,无需云端、远程服务器,也没有按 token 计费成本。该模型已从手机扩展到耳机、智能眼镜、机器人和 AI 玩具,并获得 8 万+客户。转发者还发起讨论,期待 Edge0 接下来跑在哪种设备上。
Genspark 宣布 Claude Haiku 5.5 已在其 AI Chat、Code Agent 和 Claw 中上线,并称这是 Anthropic 目前最便宜、最快、能力最强的小模型。Anthropic 官方介绍称,Claude Haiku 5.5 平均运行成本比 Claude Haiku 4.5 低约 75%。
OpenAI 宣布在 ChatGPT 上线 GPT-6 系列模型与全新 Intelligent UI 交互界面。Plus 及更高付费订阅用户即日起可使用 GPT-6 Sol,免费版与 Go 档位用户自 10 月 8 日起可使用轻量模型 GPT-6 Luna。
读者可了解 GPT-6 系列在 ChatGPT 的分档开放方式,以及新交互界面如何让模型直接渲染交互组件。
OpenAI 推出 GPT-6.1 Sol Ultrafast,覆盖 API、Codex 和 ChatGPT Work,智能水平接近 Astra,速度最高为 Sol Standard 的 8 倍,Ultrafast API 定价为每百万输入 token 12 美元、输出 token 60 美元。
新智能体研究模型与框架 AREX 逐条核验答案需求,保留已验证部分,只对缺口继续研究。它取得 BrowseComp 82.5%、WideSearch-en 82.0 F1,仅框架本身即可带来最多 +10 分提升;微调后的 4B 模型在 6 项基准中的 5 项上超过未调优的 35B。
LightOn OCR-3 已在 OpenDocRouter 上线,定价 $0.28 / 1m input、$1.40 / 1m output,在 ParseBench 上约 $3.19 / 1k 页。
OpenRouter 宣布 OpenAI GPT-6.1 Sol 的 Ultrafast 模式已在其平台上线,链接指向 openrouter.ai/openai/gpt-6.1。
OpenAI Developers 公布 GPT-6.1 Sol 在 Ultrafast 模式下的 API 定价,为每百万输入 token 12 美元、每百万输出 token 60 美元。该模式面向对速度和智能同时有要求的场景,例如排查线上故障、智能体操作应用,以及分秒必争的实时体验。
Odyssey 发布 Odyssey-3 系列世界模型,其中 Odyssey-3 Pro 在 Physics-IQ Verified 上刷新最高分,该基准要求模型续写真实物理实验视频。
GPT-6 Astra 读取用户 Memory 后,按用户喜好用 Blender 建模的几个模型做了一张海报,模型的细节、材质、光影都做得很好。
OpenAI 宣布面向全球所有 ChatGPT 用户(含免费和付费用户)推出 GPT-6,取代 ChatGPT 中的 GPT-5.6 Sol 和 GPT-5.6 Luna,但通过 Codex 和 ChatGPT Work 访问这两款模型的用户仍使用之前发布的版本。
OpenAI 将 GPT-6 开放给免费用户并引入可自主生成交互界面的 Intelligent UI,读者可据此了解这一交互形态的变化。
Vidu 发布旗舰视频模型 Q4 的首个预览版本 Q4 Preview,最高支持 4K 直出,最多可输入 15 张参考图,并支持 3 段参考音频统一音色。SaaS 侧 Preview 阶段提供两个月限时优惠,最低 0.09 元/秒起,官方称一个 10s 视频的创作成本首次可以低至不到一块钱。
Claude haiku 5.5 的定价被吐槽不合理:上下文超过 100k 后价格直接变为 5 倍。该帖引发 38 条讨论、146 次点赞,浏览量达 57068。
JetBrains 发布开源模型 Mellum2.1,这是 6 月开源的 12B MoE 模型的新版本,架构未变,仍为 2.5B 激活参数、Apache 2.0 许可,改进集中在预训练之后的强化学习阶段。
Anthropic 发布 Claude Haiku 5.5,OSWorld 2.1 评测从上一代 15.7% 提升到 72.4%,平均运行成本下降约 75%,并首次支持可调节推理强度的 Adaptive Thinking 与 100 万 Token 上下文。
Anthropic 于 10 月 7 日发布 Claude Haiku 5.5,面向摘要、上下文压缩、数据库查询和分类等高频任务,是首款支持可调推理强度的 Haiku 模型,提示词不超过 10 万 Token 时每百万输入、输出 Token 分别为 0.10 美元和 0.50 美元,当前未开放模型权重。
Lovart 发布 Nano Banana 2.1 与 GPT Image 2.5 的并排对比图,称前者在人像光照和皮肤质感上有大幅提升,对比图由 Lovart 制作。引用内容显示,Google 介绍 Nano Banana 2.1 为其最新图像生成与编辑模型,在视觉设计、基于 mask 的编辑和主体一致性上均优于此前模型。
Anthropic 发布 Claude Haiku 5.5,这是 Haiku 系列约一年来的首次更新,定价与 OpenAI 的 GPT-6 Luna 持平,同日 Sonnet 5.5 缓存读取价格减半并推出订阅 API 额度。
汇总了 Haiku 5.5 的定价、第三方评测与 token 消耗代价,读者可据此判断小型模型在智能体工作流中的实际位置。
谷歌于 10 月 6 日开源 EmbeddingGemma 2,这是其首个原生多模态开源嵌入模型,可把文字、代码、图片、视频、音频放进同一个 768 维空间并用一句话检索。
Cloudflare 在 Birthday Week 期间发布开源权重决策模型 Clef,包含 27B 多模态模型和面向延迟敏感场景的 9B 模型 Clef-Flash,输入为状态与带类型问题的 schema,输出每个候选项的概率,不生成自由文本。
OpenAI 宣布 GPT-6 面向全球推送,付费用户先行,10 月 8 日起免费用户也能使用,正式取代 GPT-5.6 Sol 和 Luna,并带来可自动生成图表、按钮、表单的 Intelligent UI。
Anthropic 的 Haiku 5.5 定价低于 DeepSeek-V4.1 flash 和智谱 GLM 5.3 flash,在 Terminal Bench 4.0 上比 GLM 5.3 flash 高一分,与其他两个中国竞品相当或更高。Anthropic 还向每个 Max 和 Team 用户赠送对应额度的 API 金额,该 API 可在任何支持输入 API 的产品中使用。
OpenAI于10月7日宣布GPT-6进入ChatGPT日常对话,并推出Intelligent UI智能交互界面,向全球超过12亿周活跃用户开放。Plus、Pro、Business、Enterprise自10月7日起陆续获得GPT-6 Sol,Free和Go用户从10月8日起陆续获得GPT-6 Luna,企业工作区可用性还取决于管理员权限设置。
梳理了GPT-6在ChatGPT全员开放的分批安排,以及Intelligent UI如何把回答变成可交互界面。
Mistral 发布原生多模态 MoE 模型 Mistral Large 4(昵称“Le Chonk”)公开预览,总参数 1 万亿、激活约 490 亿,可通过 Mistral Studio API 试用,权重计划月底发布。
Haiku 5.5 在 Browser Use Bench v2.1 上跑出与 Luna 相同的性能,价格却高出 2.8 倍。Haiku 在超过 100k context 后价格再涨 5 倍,且这一计费包含 cached tokens。BU Bench 2.1 以超长程任务为主,很容易触发这一高价档位。
DeepLearning.AI 在 The Batch 本周刊中介绍了 DeepSeek 面向智能体记忆的技术拆解:智能体读取量大于写入量,因此 DeepSeek 压缩了它们所记住的内容。