跳到正文

全部动态

今日 437 条
10月7日周三
  1. 宝玉(@dotey)AI 评估 · 75/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI 公开 722 篇 AI 数学论文并回应学界发布建议

    OpenAI 将内部未发布模型产出的 722 篇数学论文归成 372 组结果,全部放在 GitHub 仓库 openai/math 公开。该模型从 8 月 28 日开始训练,能力比已发布的 GPT-6 Astra 更强且尚未对外开放;约 160 篇主要结论附带 Lean 形式化证明,其余论文尚未形式化,OpenAI 承认其中可能有错并保留修订历史。

  2. Guillermo Rauch(@rauchg)AI 评估 · 38/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Vercel AI Gateway 推出置信度阈值功能:不确定决策可升级到备用模型

    Vercel AI Gateway 上线 beta 版置信度阈值功能,当主模型置信度低于设定阈值时,会自动在备用模型上重跑该决策,将不确定的决策升级给备用模型处理。发布者认为这一简单功能将对规模化 AI 决策产生极大影响。

  3. Akshay Kothari(@akothari)AI 评估 · 1/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Akshay Kothari:直觉让我们在连点成线前先看懂全貌

    Akshay Kothari 提出,直觉能让人在把所有线索连接起来之前就先把握整体图景。该帖获 563 次点赞、34 条回复和 30269 次浏览,由 xgo.ing 提供数据支持。

  4. a16z(@a16z)AI 评估 · 25/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Valon 完成 1.5 亿美元 D 轮融资,估值 23 亿美元

    抵押贷款服务软件公司 Valon 完成 1.5 亿美元 D 轮融资,估值 23 亿美元;开始卖软件六个月内签约额超 2 亿美元。该公司把联邦和州监管规则转成代码,自营服务商的效率达到行业约 3 倍,目前美国一家大型服务商正将 400 万笔贷款迁移到其平台,约占市场近 10%。

  5. The Rundown AI(@TheRundownAI)AI 评估 · 66/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI 发布内部模型产出的 722 篇数学论文

    OpenAI 发布 722 篇由一款未公开的内部前沿模型产出的数学论文,称这些结果解决或推进了数百个开放问题。该模型被投入约 4,000 道问题,平均每个结果消耗约三小时 ChatGPT Pro 级算力。OpenAI 表示曾咨询普林斯顿高等研究院数学与人工智能独立咨询小组,并参考其建议与公开推荐来确定发布方式,相关结果已放在 github.com/openai/math。

  6. Gary Marcus(@GaryMarcus)AI 评估 · 14/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Gary Marcus 与 Ed Zitron 等四人对话讨论「AI 泡沫」

    Gary Marcus 与 Ed Zitron、JG_Nuke、gnoble79 及 Julien 进行了长达一个半小时的对话,主题是「AI 泡沫」,相关内容已在 YouTube 发布。

  7. OpenAI(@OpenAI)AI 评估 · 21/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI 分享 AI 内容溯源与来源标注方案

    OpenAI 发布文章,介绍其在 AI 生成内容溯源与来源标注方面的做法。原文未披露具体技术方案、模型版本或可用性细节,仅给出 openai.com 文章链接,正文内容需访问原文获取。

  8. OpenAI(@OpenAI)AI 评估 · 68/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI 发布内部前沿模型产出的数学结果

    OpenAI 发布一批由内部前沿模型产出的新数学结果,相关代码与内容放在 github.com/openai/math。OpenAI 表示在发布过程中咨询了 Institute for Advanced Study 的数学与人工智能独立顾问组,并参考其建议与公开推荐来确定发布方式。

  9. Replit ⠕(@Replit)AI 评估 · 3/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Replit 将亮相 SF Tech Week,与 ElevenLabs、Gamma 等共谈 AI 与创作者经济

    Replit 将于明天参加 #SFTechWeek,与 @passionfrootme、ElevenLabs 和 Gamma 同台,讨论创作者经济、AI 与技术如何改变创作者与品牌的合作方式,以及什么才是真正的影响力。活动需通过 partiful.com 报名。

  10. a16z(@a16z)AI 评估 · 33/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Replit 跻身消费级 AI 应用支出榜前 10,流量却排在后 5 位

    a16z 分享的 Top 50 消费级 AI 应用收入榜单显示,Replit 按支出位列前 10,按流量却排在后 5 位。流量与收入呈现两套完全不同的排序,反映出 AI 重度用户的付费集中在轻度用户不活跃的地方。完整榜单由 @omooretweets 发布在 Cosign 上。

  11. GitHub(@github)AI 评估 · 36/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    GitHub:Git 活动量一年翻倍至每月 473.3B 次,正重建 Git 基础设施

    GitHub 称 2025 年 9 月至 2026 年 8 月间 Git 活动量翻倍以上,达到每月 473.3B 次事件。GitHub 正在平台持续运行的同时重建 Git 基础设施,为智能体规模的软件开发打基础。

  12. AI Engineer(@aiDotEngineer)AI 评估 · 15/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    ArizeAI 的 Fuad Ali:如何把智能体线上失败转化为 evals 测试

    ArizeAI 的 Fuad Ali 展示了一套方法:把 AI 智能体的生产环境失败案例转化为 evals,用于测试修复是否引入回归,并加入人工审核环节。相关内容将在 10 月 12 日 AI Engineer New York Workshops 上讲解,该工作坊为会议附加环节。

  13. 宝玉(@dotey)AI 评估 · 57/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    prompt-motion.com 收录 226 个 Claude Opus 5.5 动画视频案例与 Prompt

    有用户搭建了 prompt-motion.com,收集用 Claude Opus 5.5 制作的动效作品,每个案例旁附上生成它的 Prompt 或 Skill,目前已有 226 个,全部来自 X 上的帖子并标注原作者,多数 Prompt 可以直接运行。宝玉转发了这一网站,并提到大多数案例带有可运行的 Prompt 和对应的 X 链接。

  14. ollama(@ollama)AI 评估 · 26/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google DeepMind 模型页面上线 Ollama 模型库

    Google DeepMind 的模型页面已出现在 Ollama 模型库中(ollama.com/library/embedd…),@GoogleDeepMind 转发确认了这一收录。目前该帖互动量极低,仅 6 次点赞、0 次回复与转发。

  15. ollama(@ollama)AI 评估 · 41/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google DeepMind 的 EmbeddingGemma 2 上线 Ollama,首个原生多模态端侧嵌入模型

    Google DeepMind 的 EmbeddingGemma 2 现已上线 Ollama,可通过 `ollama pull embeddinggemma-2` 获取。该模型面向消费级设备,是 Google DeepMind 首个原生多模态开源端侧嵌入模型,除文本外还将代码、图像、音频和视频统一到同一嵌入空间。

  16. 宝玉(@dotey)AI 评估 · 6/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Tibo 发起投票:这是一道送分题

    Tibo(@thsottiaux)发起一项投票,配文称"这是一道送分题"。该推文获得 15 条回复、2 次转发、39 个点赞,浏览量 25289。

  17. Fireworks AI(@FireworksAI_HQ)AI 评估 · 51/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Fireworks 开源 9B 决策分类器微调方案

    Fireworks 的 AI 开发者教育负责人 @prof_oz 用纯 SFT、公开数据集和两个简单技巧,在 Fireworks 上微调了一个 9B 的 Jev-style 决策分类器,说明不需要前沿实验室的预算也能做出可用的决策分类器。完整训练配方已开源,可以按此自行训练。

  18. a16z(@a16z)AI 评估 · 36/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    a16z:AI 支出前 1% 用户在为什么付费?构建、自动化和交付工具

    a16z 数据显示,AI 支出前 1% 的用户平均每月花费 903 美元,而中位数用户仅 25 美元,前者总支出已超过后 50% 用户之和。相比平均支出者,他们为 n8n 付费的可能性高 23 倍,为 fal 和 Manus 高 18 倍,为 Higgsfield 高 15 倍,偏好构建、自动化和交付类工具。

  19. Sahil Lavingia(@shl)AI 评估 · 12/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    如果 IRS 推出 MCP,你会用吗?

    Sahil Lavingia 发问:如果 IRS(美国国税局)推出 MCP,你会用吗?该帖获得 48 条回复、7 次转发、35 个赞和 14132 次浏览。

  20. Replit ⠕(@Replit)AI 评估 · 29/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Replit 上线技能:新建项目前自动排查重复项目

    Replit 现已能掌握用户所有项目的上下文,用户上传一个自定义指令技能后,Replit 会在创建新项目版本前标记出工作区内高度相近的项目。该技能用于避免人和智能体重复劳动造成的项目泛滥,相关细节在推文线程中给出。

  21. 宝玉(@dotey)AI 评估 · 21/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Boris Cherny 谈如何给 Claude 写提示词:给目标、定投入、说验证

    Claude Code 作者 Boris Cherny 表示,给 Claude 写提示词没有秘密,像对同事说话一样即可,大多数任务不必过度铺垫或规定步骤,给出目标模型会自己想办法。他认为在 Sonnet 3.5 时代提示词影响很大,如今更关键的是说清三件事:想让它做什么、希望投入多少精力、以及它该如何验证自己做对了。

  22. 宝玉(@dotey)AI 评估 · 34/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Boris 用 Opus 5.5 为 Acquired 播客剧集打造互动网站,提示词只需三点

    Boris 让 Opus 5.5 为 Acquired 播客最新一期 Home Depot 内容制作互动网站,水彩插图全部由 Claude 绘制。其提示词核心只有三点:要它做什么、消耗多少算力推理、如何验证自己做对了,其中"做什么"和"如何验证"是形成 Agent 自我验证闭环的关键。

  23. lmarena.ai(@lmarena_ai)AI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    LMArena 上线 Multi-Image Edit Arena 多图编辑排行榜

    LMArena 推出 Multi-Image Edit Arena,并在 arena.ai/leaderboard 上线对应榜单,用于比较多图编辑能力。原文未披露参与模型、评分指标或具体排名的更多细节。

  24. lmarena.ai(@lmarena_ai)AI 评估 · 66/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google Nano Banana 2.1 登陆 LMArena 图像竞技场

    Google 的 Nano Banana 2.1 已上线 LMArena 的文生图、图像编辑和多图编辑三个竞技场。它在多图编辑以 1431 分排第 4,文生图以 1328 分排第 5,图像编辑以 1428 分排第 6。

  25. Justin Welsh(@thejustinwelsh)AI 评估 · 2/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Justin Welsh 每周六撰写关于收入、时间自主与工作平衡的短文

    Justin Welsh 每周六发布一篇短文,分享他在"获得良好收入、掌控自己的时间、不把最好的年华牺牲给工作"方面的经验,该订阅已拥有 200,000+ 读者。订阅地址为 justinwelsh.me/subscribe。

  26. Claude(@claudeai)AI 评估 · 6/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Claude 对话 Dan Shipper 与 Willie Williams:他们如何打造该产品

    Claude 官方账号分享了一段与 @danshipper 和 Willie Williams 的完整对话,主题是两人如何把它做出来。原文未披露该产品的具体名称、功能或参数,仅给出 YouTube 视频链接。

  27. Claude(@claudeai)AI 评估 · 29/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    The Every 团队基于 Claude Managed Agents 打造全员 Slack 公司智能体,并开放给订阅者

    The Every 团队把尽可能多的工作交给智能体处理,并在 Claude Managed Agents 上构建了一个全员在 Slack 中使用的公司智能体,用于在新模型发布时共享技能。该智能体在内部走红后,团队已将其发布给订阅者。

  28. OpenAI Developers(@OpenAIDevs)AI 评估 · 29/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI 开放 Decisions API 公测

    OpenAI 的 Decisions API 现已进入公开测试,开发者可通过 developers.openai.com 的 API 文档指南接入试用。原文未披露该 API 的具体功能、参数或定价信息。

  29. OpenAI Developers(@OpenAIDevs)AI 评估 · 32/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI Decisions API 的六类开发者用法

    OpenAI Developers 披露开发者使用 Decisions API 的六类场景:将请求路由到合适的模型、工具或智能体,把规模化输入转成标签、排名与分数,分析图像、比较视觉内容或识别关键视频帧,根据截图选择按钮、填写表单或确定操作,标记有风险的工具调用或需深入审查的问题,以及对大规模数据集分类以发现趋势和模式。

  30. OpenAI Developers(@OpenAIDevs)AI 评估 · 35/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    GPT-6 Luna 驱动的多模态模型:支持文本图像输入与三类输出

    一款由 GPT-6 Luna 驱动的模型支持文本和图像输入,可输出三类结果:Predicates 评估陈述为真的概率,Choices 从预设选项中带置信度选择,Scores 将输入映射到数值区间。

  31. OpenAI Developers(@OpenAIDevs)AI 评估 · 55/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI 向所有开发者开放 Decisions API 公测

    OpenAI 宣布 Decisions API 进入公开测试,面向所有开发者开放,可让应用近乎实时地选择模型、工具或动作。该 API 通过 Responses API 完成决策,速度最高可达 GPT-6 Luna 的 10 倍。

  32. Aravind Srinivas(@AravSrinivas)AI 评估 · 54/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Perplexity 发布开源权重模型 pplx-decider-v1.1-27b,输入价格降至每百万 token 2 美分

    Perplexity 联合创始人 Aravind Srinivas 表示,更新版开源权重多模态决策模型 pplx-decider-v1.1-27b 已上线,并在 Hugging Face 新的 Decision Index 0.3 基准上得分最高。该模型价格为此前 v1 的一半,为每百万输入 token 0.02 美元。相关权重可在 Hugging Face 空间获取。

  33. a16z(@a16z)AI 评估 · 48/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI 的 Greg Brockman 谈安全新循环:每发一个新模型就先打自己的系统

    OpenAI 的 Greg Brockman 提出"安全循环":每次模型发布先指向自家系统找漏洞并自动化。他透露 OpenAI 抽调 25% 的生产工程师暂停原有项目专职防守,用模型排查安全隐患,已发现并修复若干严重问题。该轮排查最终饱和,已找出 Astra 能发现的全部 P0 级关键问题;内部正构建名为"defense factory"的自动化防御工厂,以应对后续新模型带来的新一轮排查。

  34. v0(@v0)AI 评估 · 33/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    v0 iOS app 现可使用 ChatGPT 订阅

    v0 iOS app 支持接入 ChatGPT 订阅,用户连接账号后即可用 ChatGPT 的 tokens 进行构建。该功能面向 ChatGPT Plus 或 Pro 订阅用户开放。

  35. DeepLearning.AI(@DeepLearningAI)AI 评估 · 38/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    只针对测试训练会让模型乱加代码,小米用质量清单分数修正 MiMo-V2.6-Pro

    只用通过测试来训练的模型学会了添加未被要求的代码,并让错误静默通过。小米的做法是把每项测试结果乘以质量清单分数加以修正,由此得到的 MiMo-V2.6-Pro RL 在 Artificial Analysis 的 Intelligence Index 上以 46 分领先开源权重模型。

  36. ChatGPT(@ChatGPTapp)AI 评估 · 50/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    ChatGPT 上线 Meetings 插件:自动记笔记并生成个性化会议纪要与后续步骤

    ChatGPT 推出 Meetings 插件,可自动记录会议内容,并结合 ChatGPT 对你的了解,在 ChatGPT Space 中保存个性化摘要与下一步行动。笔记可设为私密或分享给团队,还能让 ChatGPT 更新项目计划、起草跟进内容。该功能以 beta 版面向 macOS 桌面端的 Pro 和 Business 用户开放,Enterprise 版本即将推出。

  37. lmarena.ai(@lmarena_ai)AI 评估 · 16/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    LMArena 上线 Multi-Image Edit Arena 多图编辑排行榜

    LMArena 推出 Multi-Image Edit Arena,专门评测多图编辑能力并已上线排行榜页面(arena.ai/leaderboard/im…),帖子附带的互动数据显示 0 条回复、0 次转发、2 次点赞和 941 次浏览。

  38. lmarena.ai(@lmarena_ai)AI 评估 · 62/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google Nano Banana 2.1 上线 LMArena 三个图像榜单

    Google 的 Nano Banana 2.1 已进入 Text-to-Image Arena、Image Edit Arena 和 Multi-Image Edit Arena 三个榜单。

  39. a16z(@a16z)AI 评估 · 34/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    软件漏洞修补窗口正在崩塌:87% 被利用漏洞在公开当天或之前即遭攻击

    黑客实际利用的软件漏洞中,约 87% 是在漏洞成为公开信息的当天或之前就遭到攻击,而这一比例在 2020 年仅为 23%。修补窗口正在迅速崩塌,留给企业打补丁的时间大幅缩短。

  40. elvis(@omarsar0)AI 评估 · 21/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    用好 eval 构建能力,就能快速站上领域前沿

    有观点指出,如果能在现有模型之上构建出好的 eval,就能迅速在所属领域或任务上站到前沿,这正是 eval 能带来的优势。Garry Tan 此前表示,如今可以借助智能体编写 markdown 技能并挂到 cron job 上,几乎完成所有有用的知识工作类型。