跳到正文

全部动态

今日 17 条
10月1日周四
  1. Ideogram(@ideogram_ai)AI 评估 · 70/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Ideogram 发布 4.5 编辑模型,支持多轮编辑并即将开放权重

    Ideogram 发布 Ideogram 4.5,称其为最精确的编辑模型。它消除了编辑过程中的伪影累积,使多轮编辑成为可能,而其他领先模型每次编辑都会引入伪影、像素偏移和颜色变化。该模型已在 Ideogram、API 和发布合作伙伴处上线,开放权重即将推出。

9月30日周三
  1. Google DeepMind BlogAI 评估 · 67/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google DeepMind 推出 SynthID Bio,为 AI 生成蛋白质加水印

    Google DeepMind 推出 SynthID Bio,将 SynthID 水印技术扩展到合成生物学,可在生物代码中嵌入不可感知的签名,并能在合成出的物理蛋白质上验证,同时保持其生物学功能。

  2. Recraft(@recraftai)AI 评估 · 26/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Recraft V4.1 Flash 成为 Design Arena 榜单最快模型

    Recraft V4.1 Flash 在 Design Arena 榜单上成为速度最快的模型,生成质量还优于许多耗时十倍于它的模型。该成绩由 Recraft 公布。

  3. cohere(@cohere)AI 评估 · 36/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Cohere Embed 5 上线 API、Model Vault、Microsoft Foundry 与 Amazon SageMaker

    Cohere Embed 5 现已通过 Cohere API、Model Vault、Microsoft Foundry 和 Amazon SageMaker 提供,也可直接在 North 中使用。Embed 5 的 Pro 与 Fast 两个版本共享同一嵌入空间,因此可用其中一个建索引、另一个做检索,同时保持性能表现。

  4. cohere(@cohere)AI 评估 · 36/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Cohere 推出 Embed 5 Fast:高吞吐嵌入模型,RCP-nDCG @10 评测首发

    Cohere 发布高吞吐、高速选项 Embed 5 Fast,在 fast-tier 模型中领先 6 分以上,成本比 Pro 低三分之一。Embed 5 也是首个采用 RCP-nDCG @10 检索评测方法评估的模型家族。

  5. cohere(@cohere)AI 评估 · 32/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Cohere 推出 Embed 5 系列嵌入模型,含 Pro 与 Fast 两个版本

    Cohere 发布 Embed 5 系列嵌入模型,包含 Embed 5 Pro 和 Embed 5 Fast 两个版本。前者主打前沿能力,后者侧重低延迟性能。

  6. Kling AI(@Kling_ai)AI 评估 · 23/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Kling 4.0 Flash 抢先体验:Umesh 称提示词理解出色

    Umesh 获得 Kling 4.0 Flash 早期访问权限并进行了首批尝试,称其提示词理解能力出色。他同时公开了所使用的提示词,并带上 #Kling4 标签。

  7. Qwen(@Alibaba_Qwen)AI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Qwen3.8-27B 上线 Nebius Token Factory

    Qwen3.8-27B 现可通过 Nebius Token Factory 调用。这是一款 27B 稠密模型,面向编程、研究与智能体工作流,侧重多步任务的规划与完成。

  8. Kling AI(@Kling_ai)AI 评估 · 45/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    可灵 Kling 4.0 满血版短片实测:原生 30 秒直出,10 月上线

    可灵 Kling 4.0 满血版生成短片曝光,相比 Flash 版本,支持原生 30 秒直出、画面与声音更清晰、口型匹配更精准,并提供 21:9 电影画幅。该版本将于 10 月上线。

  9. 智东西AI 评估 · 53/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    美团 LongCat-2.5-Preview 上线,万亿参数模型实测复刻 Muse 前端

    美团 LongCat 团队于 9 月 25 日上线预览版模型 LongCat-2.5-Preview,并在 OpenCode 开放两周限时免费体验。该模型总参数 1.6 万亿,每次推理激活约 480 亿参数,支持 100 万 Token 上下文窗口和原生多模态,主要面向长周期任务。

  10. Recraft(@recraftai)AI 评估 · 38/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Recraft V4.1 Flash 1.3 秒出图,可用 V4.1 Pro 精修至 2048×2048

    Recraft V4.1 Flash 可在 1.3 秒内完成从提示词到图像的生成,便于快速尝试不同方向。定下方向后,Refine 会用 V4.1 Pro 以 2048×2048 重新生成,保持相同构图与光照,同时让文字更干净、发丝与水滴更清晰、线条更精细。

  11. 甲子光年AI 评估 · 52/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    影溯发布世界模型 InSpatio-World 1.5,支持多类输入并开放试用

    影溯科技发布并上线新一代世界模型 InSpatio-World 1.5,支持单图、多图、全景图和视频等不同输入,强化实时场景探索与时空一致性,并已开放试用与开源代码,同时即将邀测世界模拟器 Topos-Pro 1.0。

  12. 夕小瑶科技说AI 评估 · 52/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    实测 MiniMax M3.1-Flash-Preview:四个真实任务与 DeepSeek、GLM 对比

    MiniMax 于 9 月 27 日在 MiniMax Code 上线 M3.1-Flash-Preview,1M 上下文,原生支持文字、图片、视频输入,思考强度五档可调,主力场景是 Coding。

  13. ollama(@ollama)AI 评估 · 21/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Ollama 上线 Nimble、Tev1 4b 与 Tev1 0.8b 三款模型,支持 /v1/systemone

    Ollama 平台上新三款模型,分别为 Nimble、Tev1 4b 和 Tev1 0.8b,均可在 /v1/systemone 下调用。三款模型已收录于 Ollama 模型库,链接为 ollama.com/library/nimble 与 ollama.com/library/tev1。

  14. AK(@_akhaliq)AI 评估 · 47/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Audio8 ASR Infinite 流式语音识别模型:原生流式架构每秒解码 12.5 次

    Audio8 ASR Infinite 是一款原生流式语音识别模型,每秒解码 12.5 次,靠滚动 KV Cache 让内存和延迟保持恒定,可支撑 24/7 连续运行。它以每个时钟步一个文本 token 的方式工作(每秒 12.5 / 8.3 / 6.25 次决策),在感知粒度与资源开销之间取得平衡。模型已在 Hugging Face 上线,并配有 Gradio 试用工作流。

  15. Jerry Liu(@jerryjliu0)AI 评估 · 43/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    LlamaIndex 发布 Jev:面向文档任务的 system one 模型

    LlamaIndex 对 Jev 与其他开源模型(含通用分类器和文档专用模型)在方向检测、语言检测、分类、切分等文档任务上做了基准测试,衡量准确率、成本和延迟三个维度。Jev 在多数基准和这三个维度上领先。相关代码已开源于 github.com/run-llama/jev_。

  16. Geek(@geekbb)AI 评估 · 10/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    GPT-6.1 这斩杀线,留给友商的空间真的不多了

    GPT-6.1 被指"斩杀线"表现强势,留给友商的空间已经不多。原文仅给出这一评价,未披露具体参数、benchmark 分数或可用性信息。

  17. orange.ai(@oran_ge)AI 评估 · 40/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    GPT 6.1 Sol 发布:缓存降价 50%,Anthropic 以安全为由未放 Astra

    OpenAI 发布 GPT 6.1 Sol,缓存价格下降 50%,但能力仍不及 Anthropic。Sonnet 5.5 跑分已超过 Astra,而 GPT 6.1 Astra 因安全原因未发布,Anthropic 由此稳居第一,并点名批评 GLM 5.3「跑太快、不够安全」。

  18. Jerry Liu(@jerryjliu0)AI 评估 · 34/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    GPT-6.1 Sol 文档 OCR 基准测试:表格解析与阅读顺序较 GPT-6 Sol 明显提升

    对 GPT-6.1 Sol 在文档 OCR 任务上的综合基准测试显示,其表格解析能力与阅读顺序较一周前的 GPT-6 Sol 有明显提升,表格解析水平已接近 GPT-6 Astra。前沿模型在文档解析上仍通常比高性价比方案贵一个数量级,但这也意味着"高端"档位(每页超过 1 美分)的能力提升空间很大。

  19. Vercel NewsAI 评估 · 40/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    InclusionAI 的 Ling 3.1 Flash 上线 AI Gateway,10 月 13 日前免费

    InclusionAI 的 Ling 3.1 Flash 已在 AI Gateway 上线,10 月 13 日前免费使用。该模型为混合推理语言模型,总参数 560B、每 token 激活 25B,在 AI Gateway 上支持 262K token 上下文窗口,面向编码、多步分析与工具调用智能体。

  20. orange.ai(@oran_ge)AI 评估 · 52/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    GPT 6.1 Sol 发布,缓存降价 50%

    GPT 6.1 Sol 发布,缓存价格下降 50%。作者提到其能力不如 Opus 5.5,但价格更低;并补充称近期流行的动效视频 Luna 也能制作。

  21. NVIDIA AI(@NVIDIAAI)AI 评估 · 51/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    NVIDIA 开源 Kumo Tabular 表格数据基础模型系列

    NVIDIA 发布 Kumo Tabular,一个面向表格数据的基础模型系列,据称在准确率与推理时间的权衡上建立了新的帕累托前沿。该系列以开放权重、开源软件和允许商用的宽松许可发布,已上线 Hugging Face(huggingface.co/nvidia/Kumo-Ta…)和 GitHub(github.com/NVIDIA/structu…)。

  22. NVIDIA AI(@NVIDIAAI)AI 评估 · 28/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Physis-Lang 搭配 NVIDIA Cosmos 3 Super 与 Nano 登顶 Physics-IQ Verified 图生视频榜前二

    Physis-Lang 搭配 NVIDIA Cosmos 3 Super 和 Nano 在 Physics-IQ Verified 图生视频(image-to-video)排行榜上分列第 1 和第 2 名。该基准测试衡量生成视频对真实世界物理规律的遵循程度,完整排名见 physics-iq-verified.anates.ai/?track=i2v。

  23. Notion(@NotionHQ)AI 评估 · 63/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    GPT-6.1 Sol 模型上线

    Notion 在 X 上表示 GPT-6.1 Sol 已经上线,进入可选模型列表。该推文仅宣布模型上线,未给出具体能力、价格或可用范围等细节。

  24. Sam Altman(@sama)AI 评估 · 69/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    6.1 Sol 发布:价格为 Astra 的五分之一,缓存读取折扣 95%

    Sam Altman 转发 Tibo 的推文介绍 6.1 Sol,称其以 Astra 五分之一的价格提供接近 Astra 的智能水平,并提供 95% 的缓存读取折扣。推文还提到 ultrafast 为 Astra 带来 8 倍速度,该能力今日可用,并即将登陆 6.1 Sol。

  25. AI SDK(@aisdk)AI 评估 · 55/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    AI SDK 支持调用 GPT-6.1 Sol

    AI SDK 宣布支持使用 GPT-6.1 Sol。该模型被描述为以五分之一的价格提供接近 Astra 的智能水平,是当前同等性能下成本效率最高的模型。原文未披露具体调用方式与价格数字。

  26. Cognition(@cognition_labs)AI 评估 · 54/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Cognition:GPT-6.1 Sol 低算力档位单任务 0.21 美元得分 58.1%

    Cognition 引用 Devin 博客数据称,GPT-6.1 Sol 在低算力档位下得分为 58.1%,单任务成本 0.21 美元;同一设置下 GPT-6 Sol 得分为 50.5%。这一成绩是排行榜上单任务成本低于 0.30 美元的模型中最高分,原文称更大的变化发生在低端档位。完整数据见 devin.ai/blog/gpt-6-1-s…。

  27. The Rundown AI(@TheRundownAI)AI 评估 · 79/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI 发布 GPT-6.1 Sol,称以五分之一价格接近 Astra 智能水平

    OpenAI 发布 GPT-6.1 Sol,官方称其以五分之一的价格提供接近 Astra 的智能水平,输入 $2 / 百万 token、输出 $10 / 百万 token。

    为什么值得看

    材料给出 GPT-6.1 Sol 在编码、办公与电脑操作三类任务上的对标结果和定价,可用来比较同价位模型的取舍。

  28. OpenAI(@OpenAI)AI 评估 · 80/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI 向 ChatGPT Work 和 Codex 付费用户开放 GPT-6.1 Sol

    OpenAI 宣布 GPT-6.1 Sol 从今天起面向 ChatGPT Work 和 Codex 的 Plus、Pro、Business、Enterprise 和 Edu 用户开放。官方同时给出了介绍页面链接 openai.com/index/introduc…。

    为什么值得看

    OpenAI 公布 GPT-6.1 Sol 面向各付费档位开放,读者可据此了解新模型的可用范围。

  29. OpenAI(@OpenAI)AI 评估 · 73/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI 发布 GPT-6.1 Sol,缓存输入价格降至每百万 tokens 0.10 美元

    OpenAI 发布 GPT-6.1 Sol,主打让前沿智能更可负担,开发者可以更大规模地构建和运行应用。缓存输入价格为每百万 tokens 0.10 美元,比标准输入价格低 95%,比 GPT-6 Sol 的缓存输入价格低 50%。

  30. OpenAI(@OpenAI)AI 评估 · 53/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI 称 GPT-6.1 Sol 对齐评测表现优于 GPT-6 Sol

    OpenAI 表示,GPT-6.1 Sol 在自家对齐评测中较 GPT-6 Sol 有明显改进,表现更接近 GPT-6 Astra。它在说明自身局限时更透明,在遵循用户意图和安全约束方面也更可靠。

  31. OpenAI(@OpenAI)AI 评估 · 69/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI 发布 GPT-6.1 Sol,多项基准接近 GPT-6 Astra 且成本更低

    OpenAI 宣布 GPT-6.1 Sol 发布,称其在编码、computer use 和复杂专业工作上相较 GPT-6 Sol 有显著升级。该模型在多项基准上接近 GPT-6 Astra,同时成本大幅更低。

  32. OpenAI(@OpenAI)AI 评估 · 23/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    GPT-6.1 Sol 发布:接近 Astra 的智能水平,价格仅为其五分之一

    OpenAI 发布 GPT-6.1 Sol,称其以 Astra 五分之一的成本提供接近 Astra 的智能水平,是目前同性能下最具成本效益的模型。原文未披露参数规模、上下文长度及具体定价。

9月29日周二
  1. 印记中文AI 评估 · 47/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    AI周刊 #102:OpenAI 发布 GPT-6 Sol/Luna,Anthropic 发布 Claude Opus 5.5

    OpenAI 9/22 上线 GPT-6 Sol 和 Luna,Sol 定价 $2/$10 MTok 约为 GPT-5.6 一半,DeepSWE 68.8%,Luna 定价 $0.10/$0.50 MTok、单任务成本约 Sol 的 1/5。

  2. The Rundown AI(@TheRundownAI)AI 评估 · 25/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    今日 AI 要闻:Anthropic Sonnet 5.5 以半价逼近 Opus,AMD 82 亿美元收购 Fei-Fei Li 的 World Labs

    Anthropic 的 Sonnet 5.5 性能逼近 Opus,价格仅为其一半。多位 AI 领袖继续就自我改进型 AI 发出警告,另有一个快速测试可帮助用户选择合适的 Claude 模型。AMD 以 82 亿美元收购 Fei-Fei Li 创办的 World Labs。

  3. 机器之心SOTA模型AI 评估 · 57/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Anthropic 发布 Claude Sonnet 5.5,IQuest 开源 320B MoE 模型 IQuest-Q1

    Anthropic 发布 Claude Sonnet 5.5,面向日常编程、代码修复与文档制作,官方称相比 Sonnet 5 输出速度提升超过 30%,相同任务消耗更少 Token。

  4. AI科技评论AI 评估 · 72/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    深度拆解 Claude Sonnet 5.5:半价 Opus 只是表象,Agent Runtime 才是变化核心

    Anthropic 发布 Claude Sonnet 5.5,API 单价没变、生成速度更快,Terminal-Bench、CursorBench 等 Agent benchmark 成绩明显上涨。

  5. Genspark(@genspark_ai)AI 评估 · 66/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Genspark 上线 Claude Sonnet 5.5,覆盖 AI Chat、Code Agent 与 Claw

    Claude Sonnet 5.5 已上线 Genspark,接入 AI Chat、Code Agent 和 Claw。Genspark 称这是 Anthropic 目前最快的 Sonnet,输出速度提升 30% 以上,单任务成本比 Sonnet 5 最多降低 30%,价格保持不变。

  6. Qdrant(@qdrant_engine)AI 评估 · 15/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Qdrant 推出 /4 Nano 和 Zero,向量兼容 Stella 文档嵌入

    Qdrant 的 /4 Nano 和 Zero 专门训练用于生成与 Stella 文档嵌入兼容的向量,因此无需重建文档索引即可在两者间切换,权衡检索质量与查询延迟。其中 Zero 极其轻量,Nano 是小型 Transformer,检索质量更接近 Stella。

  7. Simon Willison(@simonw)AI 评估 · 52/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Simon Willison 进一步讨论 Sonnet 5.5

    Simon Willison 发推表示将就 Sonnet 5.5 展开更多讨论,并附上一篇自己网站的链接 simonwillison.net/2026/Sep/28/cl…。推文本身未给出关于该模型的具体信息,详细内容需点开链接查看。