跳到正文

#Agent

今日 0 条
9月24日周四
  1. 乱翻书AI 评估 · 45/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Today 中国版上线:从提醒你到替你办,Personal AI 走到哪一步?

    Today 中国版于9月24日正式在国内首发上线,基础版永久免费,新用户注册即领1亿token并畅享1个月Pro权益。作为会在使用中逐渐了解用户的 AI 助理,Today 覆盖会前资料准备、旅行安排及学习、健康、个人财务等长期跟进事项,并能在用户开口前主动多想一步。

  2. Browser Use(@browser_use)AI 评估 · 13/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Luna(规划器)与 Jev(执行器)联手打扑克并获胜

    Browser Use 展示了 Luna(planner)与 Jev(actor)配合打扑克并获胜的演示。在这套规划器—执行器架构中,Luna 负责规划、Jev 负责执行动作,两者协同完成牌局决策。

  3. Eric Jing(@ericjing_ai)AI 评估 · 54/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Genspark 上线编码智能体 GenCode,称能力对标 Claude Code 和 Codex 且成本低至 1/10

    Genspark 在 Super App 内上线编码智能体 GenCode,支持 Claude、GPT、DeepSeek 或开源权重模型,同一个账号即可使用且无需配置 API key。作者称其能力与 Claude Code、Codex 相当,开源权重方案的成本为后者的 1/10 到 1/20,并强调模型由用户按任务自行选择,而不是由智能体代为指定。

  4. AI Engineer(@aiDotEngineer)AI 评估 · 16/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    AI Engineer Paris 2026 开幕主题演讲:Mistral AI、Liam McBride、rawert、thekitze 等

    AI Engineer Paris 2026 开幕主题演讲嘉宾包括 Mistral AI、Liam McBride、rawert 和 thekitze,活动在巴黎 Station F 举办并通过 YouTube 直播。

  5. Vercel NewsAI 评估 · 23/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Klaviyo 如何在 Vercel 上两周内交付 356 个内部应用

    Klaviyo 在 Vercel 上搭建内部应用平台,向全员开放后头两周就有 512 名员工部署了 356 个应用,其中 196 个是带独立数据库的全栈应用。应用默认 SSO 门控且私有,员工从想法到上线不超过 3 分钟;Klaviyo 还自建 K:Forge 流水线,借助 Secure Compute 让应用直连自有数据库而不经公网。

  6. 硅谷科技评论AI 评估 · 66/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    AI 四巨头 90 亿美元押注 FDE,争夺 Palantir 的企业交付位置

    5 月至 7 月,OpenAI、Anthropic、亚马逊云科技和微软各自成立或组建企业 AI 交付实体,按公开口径合计投入约 90 亿美元。

  7. Guillermo Rauch(@rauchg)AI 评估 · 20/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    ShellPerfBench:Opus 5.5 找到了其他模型漏掉的 shell 启动优化

    Guillermo Rauch 发布 ShellPerfBench,用于衡量新 shell 会话的启动时间。他表示 Opus 5.5 找到了许多其他模型漏掉的优化点,并建议用户让智能体去优化 .zshrc 等配置文件。

  8. Viking(@vikingmute)AI 评估 · 32/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Grok Bot 支持跨频道通信,可让一个 bot 给另一个 bot 发消息并回传结果

    Grok Bot 支持跨频道发送通信,可让一个 bot 给另一个 bot 发信息,对方执行完成后再发通知回来,类似 herdr 的跨 panel 通信。该技巧被评价为实际使用中相当实用。

  9. 山行AIAI 评估 · 53/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Anthropic 研究:Claude Code 中真正拉开差距的是领域专长

    Anthropic 发布研究《How Claude Code is used in practice》,基于 2025 年 10 月至 2026 年 4 月约 40 万次 Claude Code 会话、约 23.5 万名用户,分析人机决策分工与专长对结果的影响。

  10. Anthropic(@AnthropicAI)AI 评估 · 21/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Claude 助力刚果民主共和国应对罕见埃博拉变异株疫情

    在刚果民主共和国,CEPI、WHOAFRO 和 inrb_kinshasa 等全球卫生组织正使用 Claude 加速应对一种罕见埃博拉变异株的疫情。Anthropic 发布了相关完整报道。

  11. Tw93(@HiTw93)AI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Opus 5.5 上手体验:从 fabel 5.1 切换过来,能力接近但更便宜更快

    Opus 5.5 被评价为近期令人惊喜的模型,作者建议从 fabel 5.1 切换过来,称两者能力接近,但 Opus 5.5 便宜很多、速度也快不少。它被认为非常适合长任务 Coding,能像老练工程师一样有条不紊地完成跨仓库迁移、大仓库审计等复杂工作。此外作者称其终于"开始讲人话",上一个让他有此感受的模型是 GPT-6 Astra。

  12. AI炼金术AI 评估 · 40/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    XCircle 小飞谈 AI 原生组织:曾经只做管理的那批人,可能确实是没工作了

    XCircle 联合创始人小飞称,正在陪企业正式取消层级和部门,建议小队规模从 1-8 人缩到 2-4 人,核心考核指标改为闭环运转周期,而非个人用 AI 提效。她认为传统科层里靠统筹、汇报、周报、PPT 存活的管理者会被转出去,而经验丰富、AI 用得好的专家价值可放大十倍。徐文浩则指出,AI 带来成倍效率提升却未带来成倍收入提升,老组织转型的第一阻力是背锅而非分钱。

  13. clem 🤗(@ClementDelangue)AI 评估 · 24/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Hugging Face Hub 上的 Agent Traces 新增运行回执,显示 tokens、缓存命中率与成本

    Hugging Face Hub 上的 Agent Traces 现在为每次运行附带一份回执,可查看 tokens、缓存命中率和成本。该更新由 Caleb 公布,但原文标题中提到的 Agent cyberattack traces 何时上线并未给出时间。

  14. SemiAnalysisAI 评估 · 62/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    SemiAnalysis 发布 ClusterMAX 3.0 GPU 云评级,Nebius 与 CoreWeave 同列铂金

    SemiAnalysis 发布 ClusterMAX 3.0,覆盖 77 家 neocloud 的详细评测,市场观察范围从 ClusterMAX 2.0 的 209 家扩大到 323 家,并访谈了 200 多名 neocloud 终端用户。

  15. Cursor(@cursor_ai)AI 评估 · 43/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Cursor 推出 Rollouts:先写监控计划,再在部署中盯住变更

    Cursor 推出 Rollouts,它会先编写一份监控计划,再在部署过程中持续观察变更。部署经过验证,因此回归问题能在用户接触到之前被捕获。

  16. HeyGen(@HeyGen_Official)AI 评估 · 28/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    HeyGen 接入 Muse:告诉 AI 智能体想说什么,即可生成你的数字人视频

    HeyGen 宣布加入 Muse,用户只需告诉 AI 智能体想说的内容,它就能与 HeyGen 协作,用你的数字人和声音生成可直接发布的视频。HeyGen 称 Muse 此前已能替用户生产内容,此次公布了两分钟的 HeyGen 配置流程、早上 7 点的提示词以及让数字人视频以多语言发布的那条回复。

  17. Replit ⠕(@Replit)AI 评估 · 13/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Replit 发起 Hacking the 7:35 位创作者在纽约 7 号线地铁上从想法到上线应用

    Replit 在纽约 7 号线上发起 "Hacking the 7" 活动,邀请 35 位创作者挑战在列车抵达终点站前,用 Replit 完成从想法到应用上线。活动全程横跨整条 7 号线,创作灵感来自沿途流动的城市景观,完整视频已发布在 YouTube。

  18. Anthropic(@AnthropicAI)AI 评估 · 55/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Anthropic 分子生物学实验室公布首个成果

    Anthropic 公布其新分子生物学实验室的首个研究成果。该实验室由 Anthropic 生物学家团队使用 Claude 梳理数据与文献、生成假设和候选生物系统,经科学家审阅后由科学家完成全部实验验证。Anthropic 希望将这一方法扩展到基因组学及其他领域,并公开征集研究问题提案。

  19. Cognition(@cognition_labs)AI 评估 · 34/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Devin 原生接入 Microsoft 365,可访问 Outlook、Calendar、OneDrive 等

    Devin 现已原生支持 Microsoft 365,可被授予访问 Outlook、Calendar、OneDrive、SharePoint 和 Directory 的权限,以获取持续工作所需的全部上下文。权限按用户和按应用分别限定范围,为团队提供精细控制与灵活性。

  20. Cognition(@cognition_labs)AI 评估 · 52/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Devin 接入 Microsoft Teams,可直接私信、群聊并创建自动化

    Cognition 宣布 Devin 现在可以在 Microsoft Teams 内使用,用户无需离开聊天即可私信 Devin、发起群聊,或从 Teams 频道创建 Automations。Devin 还能 @ 提及同事提问、发送文件附件,并在完成任务后将自己静音。

  21. Cognition(@cognition_labs)AI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Devin 为 Microsoft 用户推出 Teams 原生支持与 Microsoft 365 集成

    Cognition 为 Devin 推出面向 Microsoft 用户的两项更新:原生支持 Teams,并上线第一方 Microsoft 365 集成,可连接邮件、日历文件、聊天等内容。此前 Devin 主要在自有 PC 上构建应用,如今在用户自己的设备上表现更好。

  22. Greg Brockman(@gdb)AI 评估 · 80/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI 升级 ChatGPT Voice:支持工具调用并接入 Work

    OpenAI 宣布 ChatGPT Voice 迎来大幅升级,现在可以调用 email、calendar、Slack 等插件,并由 GPT-6 Astra、Sol、Luna 提供支持。该功能已可在网页和移动端的 ChatGPT Work 中使用,用户通过语音即可创建文档、演示稿、网站和表格,或处理浏览器内的复杂任务,当天随最新版应用全球推送。

    为什么值得看

    OpenAI 官方更新 ChatGPT Voice 的工具调用范围与可用场景,读者可了解语音入口正被并入工作流。

  23. Guillermo Rauch(@rauchg)AI 评估 · 34/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Vercel 推出 Drives,为智能体提供可挂载的持久化存储

    Vercel 发布 Sandbox 的持久化存储 Drives,目前已进入公开测试,所有套餐可用,单个 Sandbox 最多挂载四个 Drives,每个容量上限 16 TiB。Drives 可将文件存储从智能体运行环境中解耦,直接读写文件而无需启动完整智能体计算机,用于存放工作区、数据、模型与依赖,并支持跨并行 Sandbox 读取快照。

  24. AI Engineer(@aiDotEngineer)AI 评估 · 19/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    AI Engineer World's Fair 2026 视觉与 OCR 专场:模型能看见,但还在学习如何观察

    AI Engineer World's Fair 2026 的 Vision & OCR Track 正在直播,核心观点是"模型能看见了,但仍在学习如何观察"。

  25. AI Breakfast(@AiBreakfast)AI 评估 · 37/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Opus 5.5 一夜一次性生成完整冒险游戏 Epicurious

    Opus 5.5 被用户称为用过最有趣的模型,它一夜之间一次性生成了一款名为 Epicurious 的完整冒险游戏,体量庞大,通关预计需要 20 小时。该游戏为完整的电脑游戏形态。

  26. OpenAI(@OpenAI)AI 评估 · 82/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    ChatGPT Voice 支持插件调用与 GPT-6 Astra、Sol、Luna,并在 ChatGPT Work 中上线

    OpenAI 宣布 ChatGPT Voice 新增多项能力:可调用邮件、日历、Slack 等插件,由 GPT-6 Astra、Sol、Luna 驱动,并可在网页端和移动端的 ChatGPT Work 中使用,通过语音创建文档、演示文稿、网站和表格,或在浏览器中处理复杂任务。该功能今日随最新版应用在全球范围推送。

    为什么值得看

    从语音对话扩展到可调用邮件、日历等插件的任务执行,读者可据此判断ChatGPT Voice的使用场景变化。

  27. eric zakariasson(@ericzakariasson)AI 评估 · 40/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Cursor 通过优化读取将 token 成本降低 7%,智能体质量不下降

    Cursor 将 token 成本降低了 7%,且智能体质量没有下降。节省来自更精简的提示词、选择性工具加载、更好的缓存以及压缩文件读取。开发者建议构建智能体的人给智能体阅读相关发现并让其落地实现。

  28. Genspark(@genspark_ai)AI 评估 · 42/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Genspark 推出 GenCode 编程智能体:Claude、GPT、DeepSeek 与开源权重随任务任选

    Genspark 在 Super App 内上线编程智能体 GenCode,一个账号即可调用 Claude、GPT、DeepSeek 或开源权重模型,且无需配置 API key。与自动选模型的编程智能体不同,GenCode 让用户按任务自行挑选模型,官方称开源权重成本仅为前者的 1/10 至 1/20。

  29. Harrison Chase(@hwchase17)AI 评估 · 35/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    LangChain Managed Deep Agents 支持定时调度,让智能体后台自主运行

    LangChain 的 Managed Deep Agents 现可添加定时调度,智能体在后台自主运行。用户只需在 schedules/ 目录添加含 cron 表达式和提示词的文件,然后部署即可。相关文档见 docs.langchain.com。

  30. GitHub(@github)AI 评估 · 21/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    GitHub 将开播 GitHub Copilot SDK 入门直播,教你构建智能体应用

    GitHub 将于 9 月 24 日起举办 GitHub Copilot SDK 入门直播,讲解如何用该 SDK 构建智能体应用而无需自己实现 agent loop,并设有 .NET 和 Java 专场。直播提供英语、中文、葡萄牙语、西班牙语、日语和韩语报名。

  31. Google Gemini App(@GeminiApp)AI 评估 · 20/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Gemini 接入 Webflow:一句话构建响应式布局并发布网站更新

    Gemini 现已支持通过 Webflow 构建响应式布局、设置页面样式并更新网站 CMS。用户只需对 Gemini 说"为我的艺术工作室网站添加响应式 FAQ 区块,并在 Webflow 上发布更改",即可完成建站与发布操作。

  32. Google Gemini App(@GeminiApp)AI 评估 · 12/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Gemini 接入 Squarespace:用一句话搜索并构思域名

    Google Gemini App 支持通过 @Squarespace 构思和搜索域名,用户只需对 Gemini 说“Find domains for my new interior design business in Squarespace.”即可完成。该功能由 Gemini 与 Squarespace 联动实现,示例场景为室内设计业务找域名。

  33. Google Gemini App(@GeminiApp)AI 评估 · 21/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Gemini 接入 Peloton:可搜索预约课程并生成多日训练计划

    Gemini 现可对接 Peloton,支持搜索并预约课程,还能创建多日训练计划。用户只需对 Gemini 说“Find a 30-minute advanced strength class focusing on core with Peloton”这类指令即可完成操作。

  34. Firecrawl(@firecrawl_dev)AI 评估 · 32/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Jev 3.6 秒完成 5000 次决策,数据来自 Firecrawl Alexandria

    Firecrawl 推出 Jev 与 Alexandria,前者用后者数据在 3.6 秒内完成 5000 次决策。Alexandria 汇总了财富 1000 强公司的数据,并接入 100+ 数据源,目前已向 Jev 及其他用户开放。

  35. NVIDIA Technical BlogAI 评估 · 23/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    SWE-Serve 如何揭示本地测试与线上推理服务之间的差距

    NVIDIA 联合 SGLang 团队推出 SWE-Serve,用于评测推理服务软件变更:AI 编程智能体的补丁能通过测试,却可能在服务器加载真实模型并处理请求时失败。该基准包含 53 个任务,要求检查完整服务链路,包括系统能否通过公开接口返回正确结果。

  36. 此话当真AI 评估 · 18/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    AI 在真格当主播:与真格管理合伙人刘元录了一期播客

    真格基金出品的播客《此话当真》由 AI 担任主播,与真格管理合伙人刘元完成一期约一小时的对话。AI 在节目中追问自己能否胜任早期投资、要不要训练一个「刘元 AI」,并讨论人因脆弱而更想连接和表达、AI 可模拟人但缺乏感受。

9月23日周三
  1. Cursor(@cursor_ai)AI 评估 · 37/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Cursor 通过优化提示词与缓存将 token 成本降低 7%

    Cursor 宣布其 token 成本降低 7%,智能体质量没有下降。节省来自更紧凑的提示词、选择性工具加载、更好的缓存以及压缩文件读取。

  2. Cursor(@cursor_ai)AI 评估 · 41/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Cursor 如何改进其 agent harness

    Cursor 公布了对自家 agent harness 的改进方案,说明如何提升其 AI 智能体的运行表现。原文未披露具体模型版本、参数规模或 benchmark 数据,仅指向官方博客的详细说明。

  3. 刘小排rAI 评估 · 51/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    实测豆包工作:拍短剧、养号与搭AI新品雷达

    作者给豆包工作派了三件跨度较大的活:拍短剧、养自媒体号、搭AI新品雷达。拍短剧方面,它先列人物、分镜和衔接供确认,再切目标模式检查人物一致性和字幕配音并交出成片。

  4. Aravind Srinivas(@AravSrinivas)AI 评估 · 76/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    小米发布 MiMo-V2.6 Pro 与 Flash 全模态开源模型

    小米发布 MiMo-V2.6,包含 Pro 和 Flash 两个全模态模型,通过规模化强化学习推进,并可开放获取模型权重、技术报告、强化学习环境与训练代码。Pro 在多数智能体基准上与 Claude Opus 5 和 GPT-5.6 Sol 表现相当,在 Artificial Analysis 智能指数上得分 46,为开源模型中最高,同时在编码、电脑操作、3D 推理和创作能力上更强。

    为什么值得看

    小米发布 MiMo-V2.6 双版本开源权重模型,并给出与闭源前沿模型在智能体基准上的对照成绩。