跳到正文

#Agent

今日 0 条
10月7日周三
  1. 跨国串门儿计划AI 评估 · 61/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Lauren & Matt Pocock:如何把每月数千个 PR 上到生产环境

    Lauren Tan(Poteto,pstack 创作者)在 SpaceX AI 的工作中,把 Agent 提交代码做成了日常流程,实现每月数千个 PR 上到生产环境。

  2. AWS Machine Learning BlogAI 评估 · 37/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    在 AgentCore 和 OpenClaw 上构建上下文感知的 AI 助手

    基于 Amazon Bedrock AgentCore 运行时和开源智能体系统 OpenClaw,可搭建具备长期记忆的上下文感知 AI 助手,AgentCore memory 负责将一次性对话沉淀为持久知识。文本走 Claude Haiku 4.5、图像走 Claude Sonnet 4.5,整套系统装在单个 AWS CloudFormation 模板中一键部署,轻度个人使用每月约 1–2 美元。

  3. a16z(@a16z)AI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    a16z 对话 Valon:如何用 AI 重建 13 万亿美元抵押贷款市场的基础设施

    a16z 的 Angela Strange 与 Valon 的 Andrew Wang、Linda Du 对谈,讨论如何重建仍依赖互联网前系统的 13 万亿美元抵押贷款市场基础设施。

  4. LangChain(@LangChainAI)AI 评估 · 17/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    LangChain 用 90 秒讲清 Deep Agents

    LangChain 发布了一段 90 秒视频,用于解释 Deep Agents。正文除视频外未披露具体功能、参数或可用性信息。

  5. LangChain(@LangChainAI)AI 评估 · 21/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    LangChain 推出 Deep Agents 课程:构建长时运行的复杂工作流智能体

    LangChain 上线 Deep Agents 课程,教开发者构建可长时间运行、处理复杂工作流的 AI 智能体,课程已在 LangChain Academy 开放。

  6. a16z(@a16z)AI 评估 · 52/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI 的 Greg Brockman 谈 AI 找漏洞对防守方为何是伪装的好事

    a16z 发布 OpenAI 的 Greg Brockman 访谈,他称能帮攻击者发现安全漏洞的 AI 对防守方其实是伪装的好事:一旦攻击者能找出漏洞就可能被滥用,但防守方可以据此打补丁,并掌握系统布防的主动权。

  7. elvis(@omarsar0)AI 评估 · 44/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    每个智能体基准都应审计其验证器:Parsewave 修复 AutomationBench 206 个验证器 bug,发布 AutomationBench Verified

    Parsewave 审查了 Zapier AutomationBench 全部 600 个公开任务,用智能体写出逼真的错误答案来诱导验证器,人工复核确认 206 个真实 bug,并全部修复,发布 AutomationBench Verified。

  8. Mistral AI(@MistralAI)AI 评估 · 42/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Mistral Large 4 端到端逆向分析恶意软件,12 分钟完成一天工作量

    Mistral Large 4 面对未知二进制样本可完成端到端逆向分析:判定样本为 Cobalt Strike,提取 IoC 与恶意软件配置,并输出含 YARA 规则的报告以捕获后续事件。这一原本需要一天的任务在 12 分钟内完成。

  9. elvis(@omarsar0)AI 评估 · 38/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    AgentMail 推出 AgentID,为 AI 智能体提供独立身份登录

    AgentMail 发布 AgentID,让每个 AI 智能体拥有专属验证收件箱用于登录,并关联真实人类所有者,应用可借此识别智能体背后的真人。该功能被形容为面向 AI 智能体的"Sign in with Google",已集成提示词并在回复截图后可获 3 个月任意 AgentMail 套餐免费使用权。

  10. elvis(@omarsar0)AI 评估 · 36/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Parsave 审计 Zapier AutomationBench:600 个任务查出 206 个验证器 bug,发布 AutomationBench Verified

    Parsave 对 Zapier AutomationBench 全部 600 个公开任务逐一审计验证器,智能体标记出 323 个可疑验证器,人工复核确认 206 个真实 bug,并已全部修复,发布 AutomationBench Verified。

  11. elvis(@omarsar0)AI 评估 · 30/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Gumloop 推出 Agent Browsers:为个人智能体提供可靠快速的浏览器使用工具

    Gumloop 的 Agent Browsers 已在 Gumloop 上线,让智能体访问没有 MCP 或 API 的工作。该工具在没有连接器时会在自有云沙盒中打开浏览器,登录并下载导出文件,把任务步骤保存为 recipe 后每周自动重复执行。支持安全凭证存储与 1Password 集成、会话回放、隐蔽代理会话,且完全模型无关。

  12. 歸藏(guizang.ai)(@op7418)AI 评估 · 40/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Hark Pro 上线:由 Opus 5.5 和 Sonnet 5.5 驱动的 personal agent,早期用户送一个月 Pro 会员

    personal agent 产品 Hark Pro 已在 web、iOS 和 Android 上线,据称由 Opus 5.5 和 Sonnet 5.5 驱动。早期申请用户可获赠一个月 Pro 会员,其左侧卡片支持 AI 自定义,整体设计与动效细节获好评。

  13. Claude(@claudeai)AI 评估 · 62/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Claude 接入 Google Docs、Sheets 和 Slides

    Claude 现已支持在 Google Docs、Sheets 和 Slides 中工作,这些文件也能在 Claude 内打开。在 Google Workspace 中,Claude 以侧边栏形式出现在文件旁,读取当前打开的内容并就地编辑,每处修改可在生效前逐条确认。

  14. elvis(@omarsar0)AI 评估 · 60/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Overmind 开源:从 agent traces 构建数据集并训练自有专用小模型

    作者推荐开源项目 Overmind,认为应通过挖掘 agent traces 中的知识来掌控自己的智能栈。Overmind 能从代码和 traces 构建上下文图、整理训练与评估数据集、评估提示词和模型,并训练出用户自己拥有的更小专用模型。项目地址为 github.com/overmind-core/。

  15. LlamaIndex 🦙(@llama_index)AI 评估 · 10/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    LlamaIndex 参与合办 SF Tech Week 智能体经济晚宴,120+ 智能体创始人到场

    LlamaIndex 等团队合办的 Agent Economy Gala 将于周五在 Redwood Room 举办,是 SF Tech Week 规模最大的一晚,采用黑领结着装、仅限受邀参加,现场有爵士乐演出。活动预计聚集 120+ 智能体创始人和 50 位投资人,合作方包括 SpaceX、Daytonaio、lemma_、Tiny_Fish、thelinqapp、Obvious 等。

  16. Browser Use(@browser_use)AI 评估 · 42/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Gumloop 上线 Agent Browsers:让智能体操作没有 API 或 MCP 的系统

    Gumloop 推出 Agent Browsers,让智能体能够触达没有 API 或 MCP 的工作流程。该功能支持安全凭证存储与 1Password 集成、会话回放以及隐身代理会话,且完全模型无关。

  17. LangChain(@LangChainAI)AI 评估 · 49/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    LangChain 如何在 harness 中构建模型路由器,成本降低 64%

    LangChain 在编码智能体的 harness 中内置模型路由器,成本降低 64% 且未牺牲质量。Sydney Runkle 的视频介绍了具体做法:理解任务、理解模型、在 harness 中构建路由器,并跟踪任务结果。

  18. The Rundown AI(@TheRundownAI)AI 评估 · 48/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Figure AI 创始人 Brett Adcock 的 Hark 推出 Hark Pro 主动式个人 AI 助手

    Figure AI 创始人 Brett Adcock 的 Hark 推出 Hark Pro,一款主动式个人 AI 助手,界面由曾发布 iPhone Air 的前 Apple 设计师主导。该产品在网页和移动端免费提供,硬件将于 2027 年推出。

  19. Claude(@claudeai)AI 评估 · 21/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Claude 推出 Startup Stack,整合 Linear、Lovable、ElevenLabs 等合作方优惠

    Claude 推出 Startup Stack,整合 Linear、Lovable、ElevenLabs、Granola 和 Hex 等基于 Claude 构建的公司提供的优惠。该计划覆盖销售、设计、数据工程等工具,折扣与 credits 价值最高 45,000 美元。

  20. a16z(@a16z)AI 评估 · 62/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Mandia:Armadin 年初至今在客户生产环境发现 90 多个零日漏洞

    Kevin Mandia 称,Armadin 自今年 1 月以来在客户生产环境累计发现 90 多个零日漏洞,涉及大型软件公司,多数在 48 小时内通知对方 CISO。他表示团队用真实红队人员对模型做后训练,扫描时以黑盒方式从互联网侧切入、不依赖源码审查,因此能发现远程代码执行等问题;他还指出 AI 驱动的攻击会更多寻找定制应用中的逻辑漏洞而非代码漏洞,并持续穷举所有路径。

  21. elvis(@omarsar0)AI 评估 · 42/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Harness-Aware Distillation:面向小模型智能体的 harness 感知蒸馏框架

    Harness-Aware Distillation 让同一教师模型分别在带与不带 harness 信息时作答,再训练学生模型偏好带 harness 时的动作,且不使用任务奖励或成功标签。

  22. elvis(@omarsar0)AI 评估 · 18/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Jev 的一致性特性可用于构建智能体工作流的可靠评审器

    作者称 Jev 的一个有趣之处是其一致性(consistent property),这对为智能体工作流构建可靠的评审器很有用。目前作者正在做一个小型 benchmark,以更广泛地测试这一点,并与其他决策 API 进行比较,更多内容将很快公布。

  23. elvis(@omarsar0)AI 评估 · 34/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Ampersand:为企业 AI 智能体打造的系统集成基础设施

    Ampersand 是专为企业 AI 智能体打造的系统集成基础设施,让智能体能够在 Salesforce、SAP、NetSuite、Workday 等系统记录中执行操作。用户只需在一份配置中定义每个客户的对象与映射,Ampersand 负责处理认证、重试、回填和监控。它已支撑 11x、Orb 和 Square 的智能体行动能力。

  24. ElevenLabs(@elevenlabsio)AI 评估 · 35/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    ElevenLabs 推出 ElevenAgents Architect,可在 Claude、ChatGPT、Cursor 等平台管理 AI 智能体

    ElevenLabs 发布 ElevenAgents Architect,让团队任何成员都能在 ElevenAgents 中通过对话管理 AI 智能体。该工具还可从 Claude、Claude Code、ChatGPT、Cursor 和 Grok Bot 直接调用。

  25. ElevenLabs(@elevenlabsio)AI 评估 · 37/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    ElevenLabs 推出 ElevenAgents Architect,内置 AI 智能体专家

    ElevenLabs 为 ElevenAgents 推出内置专家 ElevenAgents Architect,用户只需对话或输入文字,即可让团队快速搭建并优化 AI 智能体。该功能定位为嵌入 ElevenAgents 的专家角色,官方同步发布了演示视频。

  26. LangChain(@LangChainAI)AI 评估 · 15/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    LangChain 举办 The Agentic Operating Model 网络研讨会,探讨企业级智能体运营模式

    LangChain 将举办名为 The Agentic Operating Model 的网络研讨会,聚焦企业规模化落地生产级 AI 时人与流程、技术如何协同演进。议题包括智能体开发与运维由谁负责、跨团队应标准化哪些内容、治理与控制应放在哪里、团队如何在不拖慢开发的前提下共享基础设施,以及如何持续评估和改进生产环境中的智能体。

  27. Replit ⠕(@Replit)AI 评估 · 60/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Replit 上线跨项目上下文能力

    Replit 现在支持跨所有项目共享上下文,用户可在新对话中让它查找已有项目、添加功能,或以某个项目为参照修改另一个项目。它还能读取项目文件,把编辑作为后台任务启动,并提供链接查看改动、继续工作;官方举例包括按 Partner Marketing Hub 的配色更新 Competitor Weekly 和 GTM Strategy 幻灯片。

  28. 大模型智能AI 评估 · 51/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Datawhale 开源 Jev 中文教程 Jev Cookbook,含 11 章与 18 篇 Notebook

    Datawhale 发布开源中文教程《Jev Cookbook》,面向 System One 决策模型,包含 11 章系统讲解与 18 篇可运行的 Jupyter Notebook,从 Choice、Score、Noul 三种核心原语讲起,覆盖 RAG 引用过滤、动态工具路由、风险拦截等接入场景。

10月6日周二
  1. AWS Machine Learning BlogAI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    用 Amazon Bedrock AgentCore、Managed Knowledge Base 和 Nova Sonic 构建语音旅行助手

    航空应用可借助 Amazon Nova Sonic 语音模型、Amazon Bedrock AgentCore 与 Bedrock Knowledge Bases 加上一层实时语音层,让旅客用说话完成改座位、查延误、更新餐食偏好。

  2. Figma(@figma)AI 评估 · 56/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Figma agent 结束 beta,输出质量与长任务能力提升

    Figma 宣布 Figma agent 结束 beta 并带来多项改进,包括输出质量提升。新 agent 在遵循指令和处理更长任务上表现更好,在与专业设计师的人工评测中胜率超过约 60%。

  3. elvis(@omarsar0)AI 评估 · 13/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    elvis 回应关注:已为该版本加入连接器与记忆改进

    elvis 回应 @pidotdev 称该版本引发大量关注,此后已加入不少内容,包括用于测试多种主动能力的连接器,并小幅改进了记忆。更多更新即将发布。

  4. Aravind Srinivas(@AravSrinivas)AI 评估 · 24/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Perplexity Decider 被称最佳决策模型,Tetris 基准测试中持续领先

    Perplexity Decider 被 Aravind Srinivas 称为最佳决策模型。在一项用 8 个决策模型玩 Tetris 的基准测试中,Perplexity Decider 持续排名第一,测试者可在 app.routerplus.com 的 playground 中试用。

  5. The Keyword (blog.google)AI 评估 · 55/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google Earth AI 用地理空间智能体推进公共卫生预测

    Google Research 与 Google Health 发布研究,展示 Google Earth AI 结合卫星影像、移动性数据与基础模型(AlphaEarth Foundations、Population Dynamics Foundation Model),并配合 Geospatial Reasoning 智能体原型,帮助公共卫生机构预测疾病暴发。

  6. LangChain(@LangChainAI)AI 评估 · 30/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    LangChain Managed Deep Agents 免费接入网页搜索,由 p0 提供支持

    LangChain 为 Managed Deep Agents 免费加入网页搜索能力,由 p0 提供支持,无需单独开通供应商账号、管理额外 API key 或自行接入搜索工具。官方同时放出一段由 @ndrezn 演示的快速上手视频。

  7. a16z(@a16z)AI 评估 · 54/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Armadin Security 用 AI 智能体主动攻击企业网络,已发现 90+ 零日漏洞

    a16z 介绍新公司 Armadin Security,用 AI 智能体从外部主动攻击企业网络,在犯罪分子之前找出可利用的零日漏洞,并最终实现自主修复。公司自 1 月以来已在财富 500 强企业中发现 90+ 个零日漏洞。

  8. Aravind Srinivas(@AravSrinivas)AI 评估 · 40/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    AI 智能体实时对战《星际争霸》,Blue 2 – Red 5 蓝方落败

    两个 AI 智能体在《星际争霸》中实时对战,全程不暂停,各自思考时游戏仍在继续,最终 Blue 2 – Red 5。蓝方安全发育至 41 个 Dragoons 后出击,红方以 High Templar 的 Psionic Storm 迎击,而蓝方未侦察红方建造内容。

  9. lmarena.ai(@lmarena_ai)AI 评估 · 11/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    在 Battle Mode 与 Agent Mode 中测试 Mistral

    Mistral 现可在 Battle Mode 和 Agent Mode 中测试,入口为 arena.ai。

  10. lmarena.ai(@lmarena_ai)AI 评估 · 75/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Mistral Large 4 上线 Arena 的 Agent Arena 与 Code Arena

    Mistral AI 的 Mistral Large 4(代号 Le Chonk)已上线 Arena,可在 Agent Arena 中实测,投票将影响其评估,分数稍后公布。

  11. elvis(@omarsar0)AI 评估 · 18/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Jev-as-a-Judge:用一致性提升 LLM 评判可靠性

    Jev-as-a-Judge 通过一致性提升 LLM judge 的可靠性,适合用作评判器、验证器和持续监控。该用例被评价为 Jev 最亮眼的应用之一,作者长期从事 agent evals、judges 和 verifiers 相关工作。

  12. Figma(@figma)AI 评估 · 47/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Figma agent 结束 beta 正式上线

    Figma agent 已结束 beta 正式上线。原文未披露模型版本、参数规模或评测数据,仅附带演示视频与 Twitter 链接,浏览量超 140 万。