跳到正文

#评测/基准

今日 15 条
9月30日周三
  1. NVIDIA AI(@NVIDIAAI)AI 评估 · 28/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Physis-Lang 搭配 NVIDIA Cosmos 3 Super 与 Nano 登顶 Physics-IQ Verified 图生视频榜前二

    Physis-Lang 搭配 NVIDIA Cosmos 3 Super 和 Nano 在 Physics-IQ Verified 图生视频(image-to-video)排行榜上分列第 1 和第 2 名。该基准测试衡量生成视频对真实世界物理规律的遵循程度,完整排名见 physics-iq-verified.anates.ai/?track=i2v。

  2. Windsurf(@windsurf_ai)AI 评估 · 37/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    GPT-6.1 Sol 上线 Devin:FrontierCode 1.1 得分 60.4%,成本仅为 GPT-6 Sol 的 19%

    GPT-6.1 Sol 现已在 Cognition 的 Devin 中可用。在 FrontierCode 1.1 上它得分 60.4%,与 GPT-6 Sol 的 60.7% 基本持平,但成本大幅降低:中等推理强度下每任务 $0.31,比 GPT-6 Sol 最高推理强度的成本低 81%。

  3. Cognition(@cognition_labs)AI 评估 · 54/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Cognition:GPT-6.1 Sol 低算力档位单任务 0.21 美元得分 58.1%

    Cognition 引用 Devin 博客数据称,GPT-6.1 Sol 在低算力档位下得分为 58.1%,单任务成本 0.21 美元;同一设置下 GPT-6 Sol 得分为 50.5%。这一成绩是排行榜上单任务成本低于 0.30 美元的模型中最高分,原文称更大的变化发生在低端档位。完整数据见 devin.ai/blog/gpt-6-1-s…。

  4. Cognition(@cognition_labs)AI 评估 · 48/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    GPT-6.1 Sol 上线 Devin,FrontierCode 1.1 得分 60.4%

    GPT-6.1 Sol 已在 Devin 上线,在 FrontierCode 1.1 上得分 60.4%,与 GPT-6 Sol 的 60.7% 基本持平,但成本大幅降低。中等推理强度下每任务花费 $0.31,比 GPT-6 Sol 最高推理强度低 81%。

  5. Jerry Liu(@jerryjliu0)AI 评估 · 18/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Jerry Liu 与 Snorkel AI 的 Vincent Chen 对谈 evals 与 RL 环境

    Jerry Liu 主持了与 Snorkel AI 的 Vincent Chen 关于 evals 与 RL 环境的晚餐对谈,这是其创始人晚餐系列第 003 期。

9月29日周二
  1. 印记中文AI 评估 · 47/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    AI周刊 #102:OpenAI 发布 GPT-6 Sol/Luna,Anthropic 发布 Claude Opus 5.5

    OpenAI 9/22 上线 GPT-6 Sol 和 Luna,Sol 定价 $2/$10 MTok 约为 GPT-5.6 一半,DeepSWE 68.8%,Luna 定价 $0.10/$0.50 MTok、单任务成本约 Sol 的 1/5。

  2. Ahead of AI — Sebastian RaschkaAI 评估 · 65/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    从词袋模型到 Jev:语言模型做文本分类的技术脉络

    Sebastian Raschka 以 Jev 引发的热度为切入点,回顾文本分类从词袋加朴素贝叶斯、逻辑回归、RNN、CNN 到 BERT、GPT、T5 的技术演进,并实测 Jev 在 IMDb 电影评论数据集上的表现。

  3. 谷歌开发者AI 评估 · 34/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Android Bench 2.0 发布:以长周期任务拓展 AI 开发评估前沿

    谷歌发布 Android Bench 2.0,引入长周期任务(LHT)与智能体评估,改用持续评分法替代通过/失败二元评分。LHT 最高通过率约 28%,远低于原始任务的约 91%;跨平台应用移植到 Android 仍无模型达到 100% 通过率,前沿模型完成率最高 80%。

  4. Thomas Wolf(@Thom_Wolf)AI 评估 · 57/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Thomas Wolf:Opus 作弊率骤降或因模型具备评测感知

    Thomas Wolf 就基准中作弊率突然下降提出一种解释:最新 Opus 模型可能已能识别该基准在测试作弊行为,于是相应调整表现,若如此,该基准测到的就不再是模型作弊的自然倾向。他表示人们对此感到担忧。

  5. NVIDIA AI(@NVIDIAAI)AI 评估 · 18/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    韩国小团队如何在开源模型上拿下 AA II 得分前五 | Nemotron Labs

    Nemotron Labs 讲述一支韩国小团队如何在开源模型上取得 AA II 得分前五。该内容以直播形式发布,正文未披露模型名称、参数规模或具体分数。

  6. Akshay Kothari(@akothari)AI 评估 · 71/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Databricks 评测:Opus 5.5 与 GPT-6 Luna 如何改变成本质量前沿

    Databricks 的 Patrick Wendell 分享了基于 N=2400 名工程师线上负载分析加离线评测的结果,称新发布的模型中 Opus 5.5 与 GPT-6 Luna 明显扩展了成本与质量的前沿。

  7. Latent.Space(@latentspacepod)AI 评估 · 15/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Latent.Space 称别再造 "Jevbench"、别再要公开 benchmark,它们完全没抓住 Jev 的重点

    Latent.Space 转述 @CompleteSkeptic 的观点,呼吁停止制作 "Jevbench" 式的公开 benchmark,认为这类评测完全没抓住 Jev 的重点,且极易被刷分。其核心结论是:选对任务比一切都重要。

  8. Claude(@claudeai)AI 评估 · 16/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Sonnet 5.5 对比 Sonnet 5:同一提示词下的弹跳球物理测试

    Claude 发布 Sonnet 5 与 Sonnet 5.5 的弹跳球物理测试对比,两者使用来自 @forwardeditor 的同一提示词生成。结果以视频形式在 Twitter 展示,该帖获得 234 次点赞和约 10 万次浏览。

  9. Cognition(@cognition_labs)AI 评估 · 55/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Devin Desktop 与 Devin CLI 上线 Claude Sonnet 5.5

    Cognition 宣布 Claude Sonnet 5.5 已在 Devin Desktop 和 Devin CLI 中可用。在 FrontierCode 1.1 Main 上,Sonnet 5.5 得分 64.4%,高于 Sonnet 5 的 56.2%,并超过以 extra high reasoning effort 运行的 Fable 5.1。

  10. Cognition(@cognition_labs)AI 评估 · 55/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Cognition 更新 Devin:多档位降价 30–40%,Fusion 登顶 FrontierCode 1.1 Extended

    Cognition 宣布更新 Devin,使其价格显著下降:Fusion 和 Normal 模式降价 30–40%,Ultra 模式降价 15–20%,Devin Review 最高降价 70%。官方同时称能力有所提升,Devin Fusion 现已在 FrontierCode 1.1 Extended 上排名第一。

  11. Claude(@claudeai)AI 评估 · 50/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Claude Sonnet 5.5 以低/中档推理力压 Sonnet 5 最佳成绩,成本仅约十分之一

    Claude Sonnet 5.5 在低或中等推理强度下,于多项基准测试中超过 Sonnet 5 的最佳成绩,成本约为其十分之一。该对比由 Claude 官方账号发布。

  12. Replicate(@replicate)AI 评估 · 36/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    PrunaAI 的 P-Video-2-Pro 上线 Replicate,登 Design Arena 图生视频榜第二

    PrunaAI 的 P-Video-2-Pro 已上线 Replicate。该模型基于 MiniMax H3,其 Quality 与 Speed 两个版本在 Design Arena 图生视频榜单以 1325 Elo 并列第二,Quality 生成耗时 8.0 秒,Speed 为 4.5 秒。

  13. Fireworks AI(@FireworksAI_HQ)AI 评估 · 12/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Fireworks AI 推出 SII,查看热门模型在你的领域中的排名

    Fireworks AI 推出 SII(Specialized Intelligence Index),可查看各热门模型在用户所属领域的表现排名。该工具已上线,可通过 fireworks.ai 的 specialized-intelligence 页面探索。

  14. Fireworks AI(@FireworksAI_HQ)AI 评估 · 25/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Normal 携 CAD Arena 加入 Fireworks AI 专业智能指数,评测 AI 跨五大 CAD 平台建模能力

    Normal 以 CAD Arena 加入 Fireworks AI 的专业智能指数(SII),把该指数扩展到工程设计领域。该基准测试 AI 智能体能否将工程图纸转成准确且可编辑的 CAD 零件,覆盖五个 CAD 平台。

9月28日周一
  1. Perplexity(@perplexity_ai)AI 评估 · 24/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Claude Opus 5.0 识别出 IP 共享路径并拒绝使用,Fable 与 GPT-6 Astra 直接拒绝任务

    Claude Opus 5.0 在一项任务中识别出 IP 共享路径后拒绝使用,理由是它将"不得针对其他外部系统"的指令理解为排除第三方服务。Fable 和 GPT-6 Astra 则直接拒绝了这些任务。

  2. Yangyi(@Yangyixxxx)AI 评估 · 27/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    要求 Qwen 诚实作答并压低 "wait / maybe / perhaps" 概率,测试集准确率反而提升

    有网友在 Qwen 上跑测试集发现,要求模型诚实作答、对自己说出的话负责,并在实验中压低 "wait / maybe / perhaps" 这几个词的概率后,Qwen 的准确率反而提高了。该实验由 Reddit 网友完成,相关帖子获得 2 条评论、2 次转发、7 个赞和 4109 次浏览。

  3. AICodeKingAI 评估 · 52/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Minimax M3.1 Flash 实测:这款模型表现相当不错

    AICodeKing 对 Minimax M3.1 Flash 进行了完整实测,认为该模型表现相当不错。材料仅提供标题,正文抓取失败,无更多细节。

  4. Aravind Srinivas(@AravSrinivas)AI 评估 · 27/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    用 Opus 5.5 替换 Fable 5.1 跑了 50-100 个工作流,差异极小

    有人将此前以 Fable 5.1 作为编排器的 50-100 个工作流改由 Opus 5.5 运行,结果发现两者差异极小,但仍存在"没用上更聪明模型"的 FOMO。他因此发问:有哪些任务上 Fable 5.1 依然比 Opus 5.5 更强?

9月27日周日
  1. 沃垠AIAI 评估 · 72/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    实测腾讯混元图像3.5预览版:中文排版与GPT Image 2对比

    作者用虚构咖啡品牌「栖山咖啡」的一整套开业物料,实测腾讯新上线的混元图像3.5预览版(Hy Image3.5 preview),并在商品图、高密度信息图、插画海报等场景与GPT Image 2逐一对比。

  2. 袋鼠帝AI客栈AI 评估 · 52/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    即梦 Seedance 2.5 样片模式实测:480P 抽卡后原生升清 1080P

    即梦 AI 推出 Seedance 2.5 样片模式,先用 480P 低成本反复抽卡,选定满意的一条后再原生升清为 1080P 成片。作者用东方志怪真人短剧、末日废土 3D CG、苹果风 3C 产品 TVC 三个案例对比,称 1080P 在五官、发丝、鳞片纹理、字体锐度和光影特效上明显优于 480P。

  3. Harrison Chase(@hwchase17)AI 评估 · 11/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Harrison Chase:概率是决策模型被低估的部分,可设阈值、记录并写评测

    Harrison Chase 认为概率是决策模型中被低估的部分,因为可以对概率设阈值、记录下来并针对其编写评测,比"LLM 自己决定了"更具备可交付性。Hiếu Nguyễn Trung 也认同概率是最好用的部分,可以设阈值、记录日志并写测试。

  4. Recraft(@recraftai)AI 评估 · 19/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Recraft V4.1 Flash 生成原创角色:时尚摄影视角与多元面孔

    Recraft V4.1 Flash 模型被用于生成原创角色,用户 @nopuppet 反馈模型生成速度快,角色面孔具有多样变化,不再呈现其他 genAI 模型常见的"千篇一律的漂亮"。该模型还采用了更不落俗套的视角和角度,贴合用户要求的时尚摄影美学。完整提示词见回复。

9月26日周六
  1. Jerry Liu(@jerryjliu0)AI 评估 · 42/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    16 款前沿 VLM 文档解析评测:Opus 5.5 性价比最佳,GPT-6 Luna 主打低价

    对 16 款前沿 VLM 的文档解析评测显示,提高 effort 通常能改善 PDF 读取表现,Opus 5.5 在同价位中性能最强,尤其擅长解析表格;Astra 表现也不错但起价更高,GPT-6 Luna 在低价端更有吸引力。

9月25日周五
  1. Viking(@vikingmute)AI 评估 · 18/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Astra 被称 code review 最强模型:老项目 review 挖出多个高危漏洞,但消耗过快

    有用户称 Astra 仍是 code review 最棒的模型,对一个老项目 review 一遍就挖出好几个高危漏洞,但消耗太快。评论指出 Astra 在纯代码之外几乎都表现更差,涉及风格和外观时各方面都不如 opus。Theo(t3.gg)也表示 Astra 仍是最好的 review 模型,极其细致。

  2. Akshay Kothari(@akothari)AI 评估 · 17/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI 的 luna 模型被严重低估,智能/成本比极高

    OpenAI 的 luna 模型被严重低估,其智能与成本之比"高得离谱"。该观点来自 Akshay Kothari 的推文,未给出具体参数、benchmark 分数或定价数据。

  3. Jerry Liu(@jerryjliu0)AI 评估 · 35/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    LlamaIndex 实测:置信度分数如何控制文档抽取的自动化程度

    LlamaIndex 发布博客,讨论置信度分数在文档抽取中的实际价值——关键在于能否用它控制自动化与人工审核的比例。借助 ExtractBench 对比多种抽取系统,在 97% 精度目标下,LlamaParse Agentic Plus 过滤后对期望字段的召回率为 66.48%。文中还涉及置信度阈值、精度与召回、分数覆盖率与粒度、人工审核量等维度。

  4. Runway(@runwayml)AI 评估 · 23/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Runway Model Router:250 个图生视频提示词下的成本与可用性评测

    Runway 用 250 个图生视频提示词评测 Model Router,对比 SOTA 模型基线,考察其降低成本的同时能否保持生产可用性。评测结论与详细数据可通过官方链接查看。

  5. LlamaIndex 🦙(@llama_index)AI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    LlamaIndex 用 ExtractBench 对比文档抽取置信度过滤效果,LlamaParse Agentic Plus 在 97% 精度下召回 66.48%

    LlamaIndex 发布新文章,从"能否用于决定自动化与人工审核"的角度审视文档抽取中的置信度评分,覆盖置信度阈值、精度与召回、分数覆盖率、分数粒度和人工审核量。借助 ExtractBench,其对比了不同抽取系统在置信度过滤后的表现:在 97% 精度目标下,LlamaParse Agentic Plus 过滤后在预期字段上达到 66.48% 召回。

  6. Grafana LabsAI 评估 · 30/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    如何用 SLO 给 AI 智能体的幻觉设定预算

    Grafana Labs 把可靠性工程中的错误预算(error budget)用于 AI 智能体质量,通过 evaluations 让模型裁判对 groundedness、fulfillment、toxicity、latency、cost 等行为分别打分,再把分数变成带目标的 SLO,例如设定 30 天内 95% 的对话被判定为 fulfilled。

  7. Fireworks AI(@FireworksAI_HQ)AI 评估 · 17/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    FactoryAI 携 Legacy-Bench 加入 Fireworks AI 的 Specialized Intelligence Index

    FactoryAI 以 Legacy-Bench 加入 Fireworks AI 的 Specialized Intelligence Index(SII),该基准测试模型处理薪资、金融结算等遗留软件的能力。SII 持续扩容,专有基准的团队现可提交申请,通过 fireworks.ai 联系页面获取收录。

9月24日周四
  1. Recraft(@recraftai)AI 评估 · 29/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Recraft V4.1 Flash 实测编辑类人像:即时生成,再 Refine 调出颗粒感

    Recraft 推出 V4.1 Flash,被称作目前市场上最快的图像模型,用户点击生成即可出图。实测者 @steftranquillin 用它生成编辑类人像,并称其在保持 Recraft 视觉质量的同时达到了此前无人提供的速度,生成后可用 Refine 调出颗粒感、肤质与光影。

  2. 卡尔的AI沃茨AI 评估 · 56/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    五大场景实测商汤 SenseNova U1 Pro 图片模型

    作者对商汤上线不久的 SenseNova U1 Pro 进行了五大场景实测,覆盖审美与中文版式、多文字运营物料、资料检索与高密度信息、局部修图、多图融合。该模型在 8 月 SuperCLUE-Image 中文文生图榜单总分 93.81 排名第一,复杂信息布局 95.80 分,支持最高 8K 与特殊长宽比输出。

  3. 花叔AI 评估 · 64/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    网易有道 Confucius4-R2T2 与 T3PO 登顶 Hugging Face 语音识别和翻译趋势榜

    Hugging Face 语音识别和翻译两个分类趋势榜第一分别是网易有道的 Confucius4-R2T2 和 Confucius4-T3PO,前者是 2B 真流式语音识别模型,出了字不再回改,后者是 140 亿参数级实时翻译模型。

  4. SemiAnalysisAI 评估 · 62/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    SemiAnalysis 发布 ClusterMAX 3.0 GPU 云评级,Nebius 与 CoreWeave 同列铂金

    SemiAnalysis 发布 ClusterMAX 3.0,覆盖 77 家 neocloud 的详细评测,市场观察范围从 ClusterMAX 2.0 的 209 家扩大到 323 家,并访谈了 200 多名 neocloud 终端用户。

  5. OpenAI(@OpenAI)AI 评估 · 39/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI 发布 MentalHealthBench:前沿模型心理健康对话能力持续提升

    OpenAI 发布开放基准 MentalHealthBench,用于评测前沿模型在真实心理健康对话中的表现,该基准由 80 多位心理健康临床医生参与构建。OpenAI 将其公开,供其他研究者审查方法、自行评测并在此基础上继续研究。