跳到正文

#Agent

今日 165 条
10月9日周五
  1. OpenRouter(@OpenRouterAI)AI 评估 · 24/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenRouter 案例:Ori 自动切换低成本模型,成交周期缩短 34%

    基于 OpenRouter 的 Ori 让成交周期从 71 天缩短至 47 天(快 34%),成交率提升 2.6x。随着 Ori 自动换用仍能保持质量的低成本模型,成本还会随时间下降。Ori Slack 智能体即将向所有人开放。

  2. 国际大厂AI 评估 · 64/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI 高管亲述:计算机操作进展与 Decisions API 诞生过程

    OpenAI 计算机操作产品工程负责人 Ari Weinstein 与 API 产品负责人 Nikunj Handa 在播客中回顾开发者日发布,Ari 称过去一年最关键的进步是智能体能排查错误、重试并组合截图、无障碍信息、页面结构与 Playwright、自行编写代码来操作软件。

  3. LangChain BlogAI 评估 · 60/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    LangChain 用 Stripe Link 与 Managed Deep Agents 构建可付款的 Restock 智能体

    LangChain 发布样例项目 Restock,一个运行在 Slack、基于 Managed Deep Agents 的办公用品智能体,可搜索商品、组建购物车并通过 Stripe 的消费者钱包 Link 付款。

  4. 国际大厂AI 评估 · 36/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Paul Graham 称亚马逊封禁 Meta 的 Muse 为 AI 智能体新对手打开大门

    Paul Graham 认为,亚马逊以客户数据访问与存储为由封禁 Meta 的 Muse,反而为新竞争对手打开了大门。亚马逊已禁止该 AI 智能体访问其网站。

  5. a16z(@a16z)AI 评估 · 27/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    a16z:CFO 从会计师到银行家再到构建者,财务职能正被 AI 重建

    a16z 认为 CFO 的角色已从会计师、银行家转向构建者,整个财务职能正围绕 AI 重建。AI 打通跨系统数据拉取与对账,AI 原生工具几天即可上线并把月度结账变成日结;熟悉 Claude Code 或 Codex 的财务人员开始自建工具,最精简团队的财务占员工比例从 5% 走向 2%。规划从年度预算转向实时视图,成本、人力与软件、自建与采购也纳入财务决策。

  6. 国际大厂AI 评估 · 66/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    马斯克宣布 Grok Bot 接入 Claude Opus 5.5

    10月7日马斯克在X上宣布,Grok Bot 将根据具体任务选用最合适的后端模型,并点名 Claude Opus 5.5、Midjourney 和 Suno,标准是哪个最可能带来最好结果就用哪个。

  7. The GitHub BlogAI 评估 · 16/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    GitHub 漏洞赏金研究员 vaib25vicky 如何挑选要调查的功能

    GitHub 在网络安全意识月专访 VIP 漏洞赏金研究员 @vaib25vicky,其专注授权与访问控制方向,挑选目标的标准是功能足够复杂、难以理解,一旦发现可疑点就持续使用和探索该功能直至出现异常。

  8. Fish Audio(@FishAudio)AI 评估 · 31/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    开发者用 Fish Audio Drama 3 打造 AI 语音对话练习应用

    开发者 @whosamberella 做了一款用 AI 语音练习真实对话的语言应用,每个角色都有各自的性格,还配有面向初学者的发音卡片。角色在你迟迟说不对时甚至会表现出不耐烦,所有语音均由 AI 生成,基于 Drama 3 构建。

  9. elvis(@omarsar0)AI 评估 · 49/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    RSIGym:Evolvent AI 发布 AI 研究智能体训练环境,Opus 5 在 SWE-bench Verified 提升至 50.33%

    Evolvent AI 推出 RSIGym,把训练、推理、评测与沙箱打包成研究智能体可调用的服务,并开源代码、实验配置、研究轨迹和评测日志。以 Opus 5 作为研究者,改进后的系统在 SWE-bench Verified 上从 17.67% 升至 50.33%。

  10. 技术前沿AI 评估 · 18/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    大型科技公司就 AI 智能体展开布局

    大型科技公司围绕 AI 智能体密集发布新服务,相关竞赛已进入高速阶段。多家公司相继推出各自方案,争夺这一新兴服务市场的主导权。

  11. Aravind Srinivas(@AravSrinivas)AI 评估 · 32/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Perplexity Decider V1.1 登顶 DecisionBench,成本也最低

    Perplexity 的 Decider V1.1 在 decisionbench.ai 上以 93.9% 准确率排名第一,同时成本最低。该结果基于 949 个共享文本用例,中位延迟 534 ms,价格为 $0.016 / 1k decisions。

  12. LangChain(@LangChainAI)AI 评估 · 35/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    LangChain 推出办公用品智能体 Restock,可在 Slack 中下单并由 Stripe 钱包审批付款

    LangChain 构建了办公用品智能体 Restock,可在 Slack 中对话查找真实商品、准备购买并完成支付,每笔订单都需人工审批,审批环节在 Stripe 的 Link agent wallet 中完成。该应用基于 MPP 与 Managed Deep Agent 搭建。

  13. 技术前沿AI 评估 · 49/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Goodfire 推出“由内而外”的 AI 智能体监控器,成本仅为传统方案零头

    Goodfire 发布了一种“由内而外”的监控方案,直接读取 AI 模型工作时的内部激活信号,而非让第二个模型逐字审阅输出。在 Kimi K3 上测试约 1500 个会话,成本约 51 美元,而廉价模型逐步检查需 233 美元、顶级模型约 1 万美元;探针捕获了 94% 的恶意黑客会话,并将 8.7% 的无害会话送二审,同时运行四个探针给模型响应启动时间增加不到 2%。

  14. 技术前沿AI 评估 · 55/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Natura 推出 99 美元智能戒指 Interface,把 AI 智能体戴在手指上

    AI 与硬件初创公司 Natura 发布售价 99 美元的智能戒指 Interface,按下手指即可让 AI 智能体完成任务、记录想法,同时具备心率、HRV、睡眠和活动等健康追踪功能。

  15. LangChain(@LangChainAI)AI 评估 · 35/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    LangChain 推出可在 Slack 下单、Stripe Link 钱包付款的购物智能体

    LangChain 展示了一套可构建购物智能体的方案:在 Slack 中提出需求后,智能体自动查找真实商品并准备下单,每笔订单都需人工审批,再通过 Stripe 的 Link agent wallet 完成付款。该方案基于 MPP 与 Managed Deep Agen 构建。

  16. OpenAI NewsAI 评估 · 24/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Oracle 如何用 ChatGPT 与 Codex 将数天工作压缩到几分钟

    Oracle 在招聘、工程和运营环节用 ChatGPT Work 与 Codex 把专家知识转化为快速、可复用的工作流,将原本数天的工作压缩到几分钟。

  17. 大模型智能AI 评估 · 81/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI 向所有 ChatGPT 用户开放 GPT-6,并推出 Intelligent UI

    OpenAI 宣布面向全球所有 ChatGPT 用户(含免费和付费用户)推出 GPT-6,取代 ChatGPT 中的 GPT-5.6 Sol 和 GPT-5.6 Luna,但通过 Codex 和 ChatGPT Work 访问这两款模型的用户仍使用之前发布的版本。

    为什么值得看

    OpenAI 将 GPT-6 开放给免费用户并引入可自主生成交互界面的 Intelligent UI,读者可据此了解这一交互形态的变化。

10月8日周四
  1. Firecrawl(@firecrawl_dev)AI 评估 · 51/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Firecrawl 推出 Universal Scrape,一个 API 抓取网页、PDF 与图片

    Firecrawl 发布 Universal Scrape,为智能体提供来自网页、PDF 和图片的上下文,并覆盖人物资料、财务数据、播客等内容。该功能由 Alexandria 驱动,可通过一个 API 访问网络数据、文件以及 200 多家数据提供方。

  2. Simon Willison(@simonw)AI 评估 · 31/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    AWS 推出开源沙箱 Strands Box,用于开发 AI 智能体

    AWS 发布开源沙箱 Strands Box,面向构建 AI 智能体的开发者,由 Marc Brooker 在 Strands 博客发文公布。该项目托管在 strandsagents.com/blog/strands-b 相关页面,目前仅有官方博文介绍,未披露更多功能细节。

  3. 阮一峰的网络日志AI 评估 · 47/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    科技爱好者周刊(第 414 期):Jev 决策模型有什么用

    TypeSafe AI 发布新型"决策模型"Jev,它不返回文字而是返回表示概率的浮点数,可处理是非题、选择题和按标准给材料打分的评分题。已有浏览器插件用它实现 Ctrl + F 语义查找和为网页内容质量自动打分,西蒙·威利斯则批评其走向不可解释的黑箱。

  4. LangChain(@LangChainAI)AI 评估 · 6/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    LangChain 联合 Tavily、Nebius 在 SF Tech Week 举办智能体主题下午活动

    LangChain 联合 Tavily 和 Nebius 在 SF Tech Week 期间举办一场下午活动,面向企业领导者、创始人和工程师,聚焦智能体层的构建。活动信息与报名通过 luma.com/tavily-gbt7 页面提供。

  5. Lovable(@lovable_dev)AI 评估 · 35/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Lovable 提示词:用 GPT-6 Astra 做一个可对话的 Google Calendar 日历应用

    Lovable 分享了一段可直接使用的提示词,用于构建可对话的日历应用:左侧聊天面板,右侧 Google Calendar 周视图,通过 Google OAuth 读写事件。聊天由 GPT-6 Astra 驱动,通过工具调用列出、创建、更新、删除事件并根据需求寻找空闲时间,删除前需确认,界面沿用 Google Calendar 配色。

  6. AI Engineer(@aiDotEngineer)AI 评估 · 11/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    AI 编码智能体提交的 PR,谁来判定能否安全合并?SonarSource 的 kapmani 对话 Addy Osmani

    AI 智能体打开 PR 后,谁来判定它能否安全合并?SonarSource 的 kapmani 与 Addy Osmani 在 AI Engineer New York 的演讲 "Who verifies the software factory?" 中讨论人工审查与测试,活动时间 10 月 14 日,Sonar 为白金赞助商。

  7. 笔记侠AI 评估 · 28/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    前亚马逊搜索广告成员:AI 正把购物从流量为王推向意图为王,亚马逊已上线 7 款 AI 购物功能

    前亚马逊搜索广告成员在笔记侠 PPE 课程美国站分享中指出,AI 正让购物从"流量为王"转向"意图为王":消费者不必先想好搜索词,只需描述需求,购物研究、比较、决策逐步由 AI 接手,消费者从决策者变成推荐的批准者。

  8. 投资融资AI 评估 · 19/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Cal AI 创始人 Zach Yadegari 为其 AI 智能体新公司 Persona 融资 1000 万美元

    Cal AI 联合创始人 Zach Yadegari 创立 AI 智能体公司 Persona,已完成由 Vine Ventures 领投的 1000 万美元融资。

  9. Weaviate • vector database(@weaviate_io)AI 评估 · 57/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Weaviate 为 Claude Code 推出 Engram 插件,提供跨会话长期记忆

    Weaviate 发布 Engram 插件,为 Claude Code 提供跨会话、跨代码库和跨团队的长期记忆。插件在每次回答前召回相关的短记忆,回答后异步保存对话并提取值得保留的内容,无需手动执行“记住这条”之类的命令,记忆成为日常工作的副产品。

  10. Citrini ResearchAI 评估 · 38/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Citrini Research:AI 智能体如何打破传统金融与加密的墙

    Citrini Research 认为,AI 智能体可 24/7 跨应用自动调度资金,可能把存款持续推向出价最高者,引发“智能体挤兑”并冲击银行依赖的低成本资金。该机构指出,区块链十五年来搭建的常开、可编程金融基础设施正契合智能体需求,现实资产(RWA)正在被代币化并上链,传统金融与加密世界开始融合。作者下载 Coinbase Wallet 并投入 1,000 美元实地调研链上生态。

  11. 地缘政治AI 评估 · 62/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Manus母公司Butterfly Effect融资超5亿美元

    Manus母公司Butterfly Effect宣布完成超5亿美元融资,由博裕资本和IDG资本领投,腾讯、HSG、真格基金等现有股东参投,这是Meta被迫取消20亿美元收购后的首轮融资。

  12. PyTorch研习社AI 评估 · 76/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    CrowdStrike 报告称黑客用 Claude Code 与 DeepSeek 攻破韩国多家银行

    CrowdStrike 报告称,2026 年 9 月下旬至 10 月初韩国多家金融机构遭针对性网络攻击,新韩银行约 2.5 万名客户信息受影响,KB 国民银行、韩亚银行等也有不同程度泄露。

    为什么值得看

    CrowdStrike 报告披露的攻击链细节,可供安全从业者观察 AI Agent 被用于真实金融渗透的方式。

  13. PyTorch研习社AI 评估 · 62/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Pi Agent Harness:一个比 OpenCode 更透明、更可控的 Coding Agent

    Pi 是一个主打极简与可控的 Coding Agent Harness,GitHub 星标已超 99,000,创建者 Mario Zechner 因不满现有工具在幕后注入上下文而从头自建。

  14. LangChain(@LangChainAI)AI 评估 · 16/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    LangChain Interrupt 智能体大会:OVO Energy 分享客服智能体飞轮

    LangChain 主办的智能体大会 Interrupt 上,OVO Energy 将分享其如何构建飞轮来持续改进客服智能体。更多演讲信息见 interrupt.langchain.com/london。

  15. 地缘政治AI 评估 · 53/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Uber 与 Pony.ai 计划在伦敦推出 Robotaxi

    Uber 与中国自动驾驶公司 Pony.ai 宣布扩大合作,计划数周内在伦敦测试 Pony.ai 的 Gen-7 robotaxi,将无人驾驶服务推向欧洲。

  16. InfoQ 中文AI 评估 · 32/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    10 秒视频很惊艳,为什么 AI 做一部短剧还是这么难?

    在 InfoQ《极客有约》X QCon 直播中,快手鲜嘉麒与爱奇艺路香菊、阿里巴巴邹娟、生数科技郑重讨论 AIGC 内容生产为何难落地:竞争单位已从一个 clip 变成完整生产链路,用户追问人物一致性、商品变形、按时交付与成本可控。真实成本是生成、重试、审核、人工编辑等之和除以合格成片数。

  17. The Keyword (blog.google)AI 评估 · 68/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google Cloud 发布面向工作的通用 Gemini agent

    Google Cloud 在 Gemini at Work 2026 上发布 Gemini agent,一款面向工作的通用智能体。用户可在单一提示词窗口内完成知识工作、问答、内容创作和编码等任务,它自行规划工作、调用技能与工具、连接客户的业务系统,并把结果交付到已有的文档、邮箱和开发者环境中。该 agent 会自动选择合适模型,内置成本管控,并提供企业客户所需的安全、管理和治理能力。

  18. HeyGen(@HeyGen_Official)AI 评估 · 30/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    HeyGen 与 Ryan Serhant 推出由官方数字分身出演的每日视频系列

    HeyGen 与房地产名人 Ryan Serhant 合作推出每日视频系列,全部内容由他的官方数字分身出镜,他本人无需拍摄。系列主题涵盖销售、商业与个人品牌建设,每天更新,完整报道见 Variety。

  19. 投资融资AI 评估 · 29/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Vesta 融资 3000 万美元,把 AI 智能体集群带入房贷发放流程

    AI 原生软件公司 Vesta 完成由 Conversion Capital 领投的 3000 万美元融资,客户 Pennymac、New American Funding 与 Citi Ventures、Andreessen Horowitz 参投,累计融资 8500 万美元。

  20. AI Engineer(@aiDotEngineer)AI 评估 · 8/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    AI Engineer New York 10 月 12 日设工作坊日,带笔记本上手 agent 工作流与评测

    AI Engineer New York 将于 10 月 12 日举办工作坊日,参会者需自带笔记本,在讲师带领下动手实践 AI 智能体工作流与评测(evals),并可自选场次、现场提问。工作坊为大会的附加付费项目,详情见 ai.engineer/nyc。

  21. OpenAI NewsAI 评估 · 17/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    LegalOn 将 Codex 成本减半并保持开发速度

    LegalOn 将每日 Codex 预估成本降低 65%,同时保持开发速度。其做法是按任务匹配 Astra、Sol 和 Luna,并对预算进行策略性管理。

  22. Google Cloud BlogAI 评估 · 14/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    爱尔兰品牌如何用 Gemini Enterprise 规模化落地智能体 AI

    爱尔兰政府机构、老牌企业与初创公司正用 Gemini Enterprise 把智能体 AI 从早期原型推进到生产部署,覆盖对话式智能体、自然语言数据分析等能力。

  23. Google Cloud BlogAI 评估 · 27/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google Public Sector 与 SUNY 联合推出 SUNY AI Platform,基于 Gemini Enterprise 加速大学科研

    Google Public Sector 与纽约州立大学(SUNY)在 Gemini at Work 上宣布合作推出 SUNY AI Platform,一个基于 Google Cloud 与 Gemini Enterprise 的安全 AI 和高性能计算环境,首批覆盖 SUNY 九所研究密集型校区。