跳到正文

#大佬观点

今日 0 条
9月29日周二
  1. AI科技评论AI 评估 · 72/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    深度拆解 Claude Sonnet 5.5:半价 Opus 只是表象,Agent Runtime 才是变化核心

    Anthropic 发布 Claude Sonnet 5.5,API 单价没变、生成速度更快,Terminal-Bench、CursorBench 等 Agent benchmark 成绩明显上涨。

  2. Simon Willison(@simonw)AI 评估 · 52/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Simon Willison 进一步讨论 Sonnet 5.5

    Simon Willison 发推表示将就 Sonnet 5.5 展开更多讨论,并附上一篇自己网站的链接 simonwillison.net/2026/Sep/28/cl…。推文本身未给出关于该模型的具体信息,详细内容需点开链接查看。

9月22日周二
  1. Founder ParkAI 评估 · 69/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Jev 创始人 Diogo Almeida 谈为何做只做判断的 System 1 模型

    TypeSafe 于 9 月 15 日结束两年隐身期发布 Jev,并宣布完成由 DCVC 领投的 4000 万美元种子轮融资;创始人 Diogo Almeida 曾在 OpenAI 参与 InstructGPT、ChatGPT 和 GPT-4 研究,此次转向做一个不生成文字、只输出 Choice、Score、Noul 三种结构化判断与概率的 System 1 模型。

7月9日周四
  1. Sualeh Asif(@sualehasif996)AI 评估 · 55/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Sualeh Asif 称单智能体迭代中更偏好 Grok 4.5 而非 Opus

    Sualeh Asif 表示这是他在用单个智能体迭代时个人第一个比 Opus 更偏好的模型,Fast Grok 4.5 使用体验非常好。他称该模型总能绕过看似棘手的障碍,沟通直接、易于交流,且非常智能。他同时提到 Cursor 与 SpaceXAI 合作训练 Grok 4.5,这是其迄今最强模型,也是首个不止用于软件工程的模型。