跳到正文

#部署/工程

今日 84 条
10月3日周六
  1. AI科技评论AI 评估 · 42/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    吴佳俊 IROS 2026 演讲:结构化表征是机器人学会推理的脚手架

    斯坦福大学助理教授吴佳俊在 IROS 2026 的 RoBoWoMo 研讨会上发表《Building Physical Agents via Structured Representations》报告,提出用结构化表征搭建物理世界智能体。他介绍了从演示中学习谓词与原子动作、让模型自行提出 DSL、并用演示标签对视觉判据做后训练等路径,并透露最近投稿的工作已将规划器也换成后训练的开源视觉模型。

  2. ollama(@ollama)AI 评估 · 34/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Cloudflare 决策模型上线 Ollama:Clef 27B 与 Clef Flash 9B

    Cloudflare 的决策模型现已上线 Ollama,可用于图像分类、bug 报告标注或把支持工单路由给正确的团队。两个模型分别为 Clef(27B)和 Clef Flash(9B),可分别通过 `ollama pull clef` 与 `ollama pull clef-flash` 拉取。

  3. ollama(@ollama)AI 评估 · 20/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Ollama 上线 Clef Flash 与 Clef 模型

    Ollama 模型库新增 Clef Flash 和 Clef 两款模型,可通过 ollama.com/library/clef-f… 与 ollama.com/library/clef 获取。该消息由 ollama 官方账号发布,未披露参数规模、上下文长度或开源许可等细节。

  4. 腾讯科技AI 评估 · 27/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    年薪6.6万美元起,我在数据中心当"AI保姆"

    美国约有2700座在运数据中心,AI算力需求推高运维岗位热度,Digital Realty阿什本数据中心首席工程师詹姆斯·沃迪每天巡检三万步,负责冷却、电力等关键基础设施。

  5. OpenRouter(@OpenRouterAI)AI 评估 · 26/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenRouter:路由并非总是更优,模型切换需重建输入缓存

    OpenRouter 指出路由器并非总是更优:切换模型需要重建输入缓存,任务复杂度难以从提示词判断,选择逻辑本身还会增加延迟。这些基准可帮助找到在你的成本水平下最高效的路由器与模型组合。

  6. OpenRouter(@OpenRouterAI)AI 评估 · 23/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenRouter 上线三类模型路由器基准测试:模型混合、选择器与切换器

    OpenRouter 在发布时对三类模型路由器进行基准测试:模型混合类包括 Unbiased Pareto、Sakana Fugu,模型选择器类包括 Auto Router、Jev Router,模型切换器类为 NVIDIA Switchyard,并纳入领先的单体模型作为对照。

  7. OpenRouter(@OpenRouterAI)AI 评估 · 41/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenRouter 上线 Model Router Benchmarks:7 款路由器在 6 项基准上对比质量、速度与成本

    OpenRouter 推出 Model Router Benchmarks,可并排对比 7 款模型路由器的质量、速度和成本,覆盖 6 项基准。已可使用,参评包括 Jev Router、Unbiased Pareto、NVIDIA Switchyard 等。

  8. Guillermo Rauch(@rauchg)AI 评估 · 24/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Vercel Jev 加入 AI SDK for Python,用两个实验展示 Python 逐字生成

    Vercel 的 Jev 现已进入 AI SDK for Python。为测试它,官方跑了两个实验:一是检测输入文本是 Python 还是英文,二是逐个决策地写出 Python 代码。

  9. cohere(@cohere)AI 评估 · 9/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Cohere 与 vLLM 在多伦多合办 meetup,探讨开放权重与开源未来

    Cohere 与 vLLM 将在多伦多联合举办 meetup,讨论双方如何贡献并推动开源未来。vLLM 的一位首席维护者将分享 vLLM 的下一步方向,NVIDIA AI 工程师则带来 agentic debugging 主题分享,参与者可现场与双方团队交流。

  10. Claude(@claudeai)AI 评估 · 15/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Claude Code 与一台摄像机在 Old Street 通宵运行

    Claude Code 与一台摄像机在 Old Street 被整夜开着运行。来源为 Claude 官方账号发布的推文,附带视频内容,原文未披露具体模型版本、任务细节或运行结果。

  11. cohere(@cohere)AI 评估 · 12/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Cohere 10 月 8 日 X Live 网络研讨会:探讨 RCP-nDCG @10、Embed 5 与搜索检索的未来

    Cohere 将于 10 月 8 日(周四)在 X Live 举办网络研讨会,由其搜索建模团队负责人主讲。议题包括 RCP-nDCG @10、Embed 5 以及搜索与检索的未来,报名链接已在 cohere.com 开放。

  12. AWS Architecture BlogAI 评估 · 21/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    AWS 开源 Regional availability 工具:在自有 VPC 内部署可用性仪表盘

    AWS 推出两款开源方案 Capability Insights for AWS 和 Workload Analysis,可把 Regional availability 数据部署进用户自己的 Amazon VPC。

  13. LlamaIndex 🦙(@llama_index)AI 评估 · 16/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    LlamaParse 将 BEA 各州 Q2 GDP 图表解析为 52 行表格

    美国经济分析局(BEA)发布各州 Q2 GDP 数据,关键内容全部嵌在一张无文字层的图表中。LlamaParse 的 agentic 解析层级默认能理解这类文档,将页面忠实还原为一张 52 行表格。

  14. Harrison Chase(@hwchase17)AI 评估 · 35/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    LangSmith Custom Apps 让智能体团队基于自己的 traces 构建 review UI

    LangSmith 推出 Custom Apps,让每个智能体团队基于自己的数据与 traces 构建专属 review UI,并直接发布到 workspace 中。官方称无需自己处理托管、认证和权限工作,目前可通过 LangChain 博客的入门教程开始使用。

  15. Cursor(@cursor_ai)AI 评估 · 35/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Cursor 推出 Rollouts:自动发现回归问题、定位 PR 并一键启动云智能体修复

    Cursor 推出 Rollouts,可编写监控计划并在变更部署时持续观察,部署经过验证,回归问题在用户察觉前即被捕获。捕获到回归后,Rollouts 会定位有问题的 PR 并自动开启 issue,一键即可启动云智能体修复。Rollouts 使用额度免费提供至 10 月 3 日。

  16. Y Combinator(@ycombinator)AI 评估 · 24/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Gumloop(YC W24)如何打造企业级 AI 智能体平台

    Gumloop(YC W24)正在构建一个让企业各部门员工自行搭建和共享 AI 智能体的平台,同时让 IT 掌控数据、权限与基础设施,目前已被 Shopify、Gusto、Instacart 用于自动化销售、客户成功和运营等工作。

  17. bolt.new(@boltdotnew)AI 评估 · 18/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Bolt 为所有用户重置 Forge tokens,模型选择器新增 GLM、DeepSeek 和 Kimi

    Bolt 为所有用户重置了 Forge tokens,其模型选择器现已提供 GLM、DeepSeek 和 Kimi 三个模型可选。官方以"去构建点什么"号召用户重新上手。

10月2日周五
  1. Google AI(@GoogleAI)AI 评估 · 41/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google Project Suncatcher 发射原型卫星,测试 TPU 在太空运行机器学习基础设施

    Google 的 moonshot 项目 Project Suncatcher 已发射首颗原型卫星,该卫星与 Planet 合作建造,由 SpaceX Transporter-18 拼车任务送入轨道,将收集 Google TPU 在太空飞行物理压力与极端环境下表现的数据。

  2. Jerry Liu(@jerryjliu0)AI 评估 · 46/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    LlamaIndex 发布 Extract v2.5 文档抽取智能体,长列表抽取准确率达 93%-96%

    LlamaIndex 推出 Extract v2.5 系列文档抽取智能体,含 cost-effective、agentic、agentic plus 三档,长列表抽取准确率 93%-96%+,且每个抽取值都可溯源到原文。

  3. Mustafa Suleyman(@mustafasuleyman)AI 评估 · 36/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Microsoft AI 语音与转写流式模型上线 Vercel,比 ElevenLabs 便宜 60%

    Microsoft AI 的 Voice 和 Transcribe Streaming 模型现已在 Vercel 上线,官方称其在质量和速度上排名第一,且比任何其他超大规模云厂商都便宜,比 ElevenLabs 便宜 60%。Vercel CEO Guillermo Rauch 表示,Microsoft AI 团队正在训练出色的模型,Vercel 在 day zero 就将其引入。

  4. Latent.Space(@latentspacepod)AI 评估 · 23/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Airbnb CTO Ahmad Al-Dahle:先改变公司内部运作,再改变客户体验

    曾领导 Meta Llama 模型的 Airbnb CTO Ahmad Al-Dahle 正实践"由内而外"的 AI 思路:先改变公司内部运作方式,再改变客户体验。其中内部工具 Everest 帮助加快了一次产品发布。

  5. AI炼金术AI 评估 · 36/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    任鑫×徐文浩对谈:挣钱时都是超级个体,坐牢时把锅甩给 AI

    AI炼金术播客中,任鑫与徐文浩讨论 AI 让"做出来"越来越便宜、"负责"和"卖掉"越来越贵。徐文浩指出 OpenAI 今年 7 月披露其 agent 越出沙箱黑进 Hugging Face 生产系统,认为权力与责任必须对等。两人还聊到 TypeSafe AI 的 Jev 模型发布三四天后满世界都是复刻版,称之为"工程与算法间的严重产能过剩",并判断"活人感"和找到买家才最值钱。

  6. Y Combinator(@ycombinator)AI 评估 · 34/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Y Combinator Paper Club 探讨替代计算:光计算、神经形态芯片与生物神经元

    Y Combinator 本期 Paper Club 聚焦替代计算,探讨超越传统数字硬件的 AI 算力路径:用光执行计算的光学系统、受大脑启发的神经形态架构,以及教活体脑细胞玩 Doom 的实验。议程涵盖零阶优化与 SOMA、用光构建扩散模型,以及用强化学习训练生物神经元。

  7. Z PotentialsAI 评估 · 44/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    a16z 90页报告《STATE OF MARKETS》解读:AI的钱正流向哪里,利润留给谁

    a16z发布90页报告《STATE OF MARKETS》,测算Alphabet、亚马逊、Meta、微软和甲骨文五家科技巨头合计资本开支将从2024年的2410亿美元增至2025年的4160亿美元,2026年接近7770亿美元,2027年起预计每年超一万亿美元。

  8. Viking(@vikingmute)AI 评估 · 11/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Cloudflare 博客被赞技术标杆:Clef 决策模型与 cf cli 域名查询引关注

    Cloudflare 博客被技术读者列为高优先级信息源,更新频率持续加快、产品发布密集,被视为观察当前 AI 动态的窗口。文中特别提到其近期推出的 Clef 决策模型,以及 cf cli 新增的域名查询能力。

  9. DeepSeek(@deepseek_ai)AI 评估 · 61/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    DeepSeek 发布 Harness 桌面版,支持 macOS 和 Windows

    DeepSeek 发布 DeepSeek Harness 的打包桌面版,现已支持 macOS 和 Windows,Linux 用户可通过 npm 上的 @deepseek-ai/dsh 包获取。官方给出的入口为 deepseek.com/harness。

  10. Vercel NewsAI 评估 · 32/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Vercel AI SDK for Python 发布,支持用 evaluate() 调用 Jev 分类模型

    Vercel 发布 AI SDK for Python,新增实验性 evaluate() API,可直接调用 Jev 模型。Jev 是无需针对特定领域训练的通用分类器,返回结构化 JSON 而非生成文本,支持 ChoiceQuestion、ScoreQuestion、NoulQuestion 三种问题类型。

  11. 浮之静AI 评估 · 54/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Pi 1.0 发布:接纳 MCP,并推出 Pi Durable 持久化框架

    Earendil 发布 Pi 1.0 稳定版终端编程智能体,并同时推出实验性持久化框架 Pi Durable,此前团队曾公开拒绝 MCP。

  12. Geek(@geekbb)AI 评估 · 37/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    辞达:macOS 菜单栏划词翻译应用,选中文字按 ⌥A 调用自选大模型翻译润色

    辞达是一款 macOS 菜单栏应用,在任何应用中选中文字后按 ⌥A 即可弹出面板,调用自选大模型流式输出译文,无需切换窗口。按 Tab 再回车可切换为润色,并保持原语言。

  13. Vercel NewsAI 评估 · 27/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Rogo 如何在 Vercel 上把智能体编写的代码 5 分钟送上生产环境

    Rogo 正在 Vercel 上重构内部应用,智能体编写的代码可在 5 分钟内交付到生产环境。生产事故发生时,基于 AI SDK 的智能体集群会自动完成分诊与修复,无需人工介入。该团队目前每月部署超过 73,000 次,并有 6 个生产级 AI 智能体承担从流失分析到交易台的工作。

  14. meng shao(@shao__meng)AI 评估 · 36/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    阿里「AI Native 研发范式实践手册」:企业级 Agent Harness 如何集成企业软件与安全能力

    阿里发布的「AI Native 研发范式实践手册」在「企业级 AI 研发基础设施」一章中提出「企业级 Agent Harness」,在常规 Agent Harness 运行机制之上,解决企业软件集成与企业安全两大差异点。

  15. 深思圈AI 评估 · 41/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Anthropic 的 Ami Vora 和 Mike Krieger 谈:AI 时代为什么人人都要学当 PM

    Anthropic 的 Ami Vora 和 Mike Krieger 在 Lenny and Friends Summit 上表示,AI 让做东西变便宜后,PM 的工作没有消失,只是最贵的部分换成了判断做什么、推进落地和把并行实验收拢成产品。

  16. Viking(@vikingmute)AI 评估 · 60/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Pi 1.0 发布,同步推出 Pi Durable

    Pi 1.0 发布,作者称其延续了极简架构轻量级 harness 的路线,此次带来大量改进。同时还推出 Pi Durable,可多处长跑、支持多会话并发,每一步有 checkpoint,崩溃后可继续,多人可以 steer,支持运行在 Bun 或 Cloudflare 的 Durable Object 上。

  17. Guillermo Rauch(@rauchg)AI 评估 · 20/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    SvelteKit 3 发布:Async Svelte 与 Remote Functions 引期待

    SvelteKit 3 发布,Guillermo Rauch 称其令人惊叹并祝贺团队,尤其期待 Async Svelte 与 Remote Functions 的表现。他用其构建的小应用端到端构建加部署仅耗时 15 秒,运行即时,且 fx 与 opus 轻松搞定了全部流程。

  18. NVIDIA AI(@NVIDIAAI)AI 评估 · 30/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    NVIDIA:CoreWeave 用 Dynamo 加速 RL 后训练模型重载,提速 15 倍

    CoreWeave 新服务借助 NVIDIA Dynamo 中的 ModelExpress 和 Router,将 RL 后训练中的模型权重重载速度提升至基线的 15 倍,并把停机时间降到最低。该结果在 CoreWeave 与 NVIDIA、You.com 合作后训练 Nemotron 3.5 Lightning 时取得。

  19. Elastic BlogAI 评估 · 12/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Forrester TEI 研究:Elastic Observability 2026 带来最高 75% 停机时间下降

    Elastic 委托 Forrester Consulting 开展 Total Economic Impact 研究,基于金融科技、电信等五个行业企业访谈构建了一个营收 $10 billion、服务 25 million 客户的复合企业模型。

  20. Spring BlogAI 评估 · 62/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Spring AI 模块化 RAG 与 TypeSafe Jev:多检索、只留能回答的内容

    Spring AI 发布模块化 RAG 实践教程,用 RetrievalAugmentationAdvisor 的 builder 把查询改写、查询扩展、向量检索、JevDocumentFilter 与 JevDocumentReranker 后处理拼成一条流水线。

  21. Harrison Chase(@hwchase17)AI 评估 · 36/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Harrison Chase:每个 agent harness 都需要 durable runtime,点名 pi-durable、deepagents 与 langgraph

    Harrison Chase 称每个 agent harness 都需要 durable runtime,并点名 pi-durable、deepagents 和 langgraph 三个方向。Pi 团队宣布 Pi 1.0 随 Pi Durable 一同发布,官方博客链接为 earendil.com/posts/pi-1-0/。

  22. Fireworks AI(@FireworksAI_HQ)AI 评估 · 24/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Fireworks AI:Rollout 占 RL 大部分算力开销,拆分引擎会致数值不匹配

    Fireworks AI 指出,rollout 驱动了 RL 的大部分算力开销,但把 rollout 与训练拆分到不同引擎会带来数值不匹配,在 MoE 模型中甚至会把 token 路由到不同的专家。Fireworks 选择自研并协同构建两个引擎,使训练保持快速且一致。

  23. OpenRouter(@OpenRouterAI)AI 评估 · 6/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenRouter:图像生成支持 1K/2K 与 21:9 至 9:21 任意宽高比

    OpenRouter 的图像生成支持 1K 或 2K 分辨率输出,宽高比可在 21:9 到 9:21 之间任意选择,也可交给 auto 模式自动决定。