跳到正文

#部署/工程

今日 0 条
9月28日周一
  1. NVIDIA Technical BlogAI 评估 · 25/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    NVIDIA OpenShell 为 AI 智能体添加运行时控制

    NVIDIA 发布 OpenShell,为 AI 智能体加入运行时控制能力,使其在获得工作区、算力、数据、凭证与外部服务访问权限的同时可被约束。AI 智能体可被赋予目标、编写代码、调用工具,并在新信息出现时持续工作,支撑软件故障排查、实验运行以及跨越数天或数周的关键业务操作与研究。

  2. 大淘宝技术AI 评估 · 35/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    大淘宝技术团队 Ontology 决策结构化实践:不预画 workflow,让 Agent 全托管 120+ 工作项

    大淘宝商家财务团队用 Ontology 四层图谱(业务/系统/交付/治理)加 decision_function 结构化决策,替代预设 workflow 和打包 Skill,让 Agent 按"先取证、再决策、后行动"闭环动态生成流程,3 个月在 Agent Room 完成 120+ 需求与工作项,覆盖需求开发、工单处理、数据订正和业务运维。

  3. Milvus(@milvusio)AI 评估 · 8/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Milvus 巴黎线下活动:Criteo、Gorgias 与 Zilliz 分享向量检索规模化实践

    Milvus 社区将于 10 月 7 日在 Criteo 巴黎办公室举办线下活动,聚焦向量搜索在生产环境中的难点。Zilliz 解决方案架构师 Simon Hearne 将可视化向量索引并讲解召回率下降的原因,Criteo 与 Gorgias 的工程师将分别分享分布式向量搜索系统的落地历程与 RAG 索引模式。活动 18:00–22:00 CEST 举行,演讲为英文,需提前注册且名额有限。

  4. Geek(@geekbb)AI 评估 · 39/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Magpie 接上 DeepSeek 并叠加 RTK,Bash 工具输出 token 省七成多

    Magpie 接入 DeepSeek 后 prompt 成本已压得很低,再叠加一层 RTK 过滤 Bash 工具输出的噪声,实测可省掉七成多的工具输出 token。两个省钱方向叠加后性价比明显提升。

  5. Guillermo Rauch(@rauchg)AI 评估 · 19/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Guillermo Rauch 用 Rust 和 Swift 重写 Mini 浏览器,弃用 Electron + Bun

    Vercel CEO Guillermo Rauch 将 Mini 网页浏览器移植到 Rust 和 Swift,称其更快、更安全,且迭代体验优于 Electron + Bun。

  6. 架构师之路AI 评估 · 33/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    AI时代每秒10W并发无锁缓存,spec怎么写?

    针对每秒20w写、1k读的写多读少定长value场景,无锁缓存通过写入定长value加16bit CRC签名、读取时校验签名,签名不一致则返回NULL视为cache miss,以牺牲一致性换取零锁冲突。

  7. NVIDIA Technical BlogAI 评估 · 20/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    NVIDIA DSX MaxLPS 如何最大化 AI 工厂吞吐量与效率

    NVIDIA DSX MaxLPS 通过策略驱动的电力共享,在参与资源之间动态分配电力,解决 AI 工厂为应对 GPU 峰值功耗而预留保护缓冲、导致正常运行时基础设施利用率不足的问题,从而提升 AI 工厂吞吐量与效率。

  8. Vercel NewsAI 评估 · 15/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Vercel Sandbox 新增内存可观测性

    Vercel Sandbox 的可观测性现已纳入内存用量数据,可在仪表盘和 CLI 的 vercel metrics 命令中查看。仪表盘的 Memory Usage 卡片给出各沙箱的平均、P75 和 P95 内存,沙箱详情页图表会按沙箱内存上限自动缩放 y 轴,并在上限 85% 处加一条虚线参考线。

  9. Vercel NewsAI 评估 · 58/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Claude Sonnet 5.5 上线 Vercel AI Gateway

    Anthropic 的 Claude Sonnet 5.5 已在 AI Gateway 上线,模型标识为 anthropic/claude-sonnet-5.5。

  10. Tw93(@HiTw93)AI 评估 · 26/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Tw93 介绍 Mac 终端 Kaku:安装即用、对 AICoding 友好,已迭代 21 个版本

    Tw93 重新介绍了他在过年期间开发的 Mac 终端 Kaku,安装后无需配置即可使用,对 AICoding 友好,并结合自己的编程习惯做了不少顺手优化。该项目已开源并迭代 21 个版本,保持 0 issue,作者称其为自己做过的最复杂的项目。项目地址为 github.com/tw93/Kaku。

  11. Jerry Liu(@jerryjliu0)AI 评估 · 32/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Devin 被指销售策略失当:用户称两天自建 Hermes 替代,成本仅四分之一

    一位 Devin 付费用户称,因 Cognition 拒绝其按季度付款的请求,他用两天时间基于自有基础设施搭建了替代方案 Hermes,功能与 Devin 几乎完全等价,成本约为 Devin 的 25%。该用户此前 Devin 使用量年化已超 10 万美元,原计划为获得 BAA(HIPAA 合规协议)将支出提升至约 1.5 倍。他认为问题不在 Devin 本身,而在于销售策略。

9月27日周日
  1. METRAI 评估 · 24/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    METR 如何实现并评估面向安全评测的逐动作实时监控器

    METR 开发并部署了一个基础的实时逐动作监控器,用 LLM judge 在智能体每次动作执行前审查,超过阈值即转人工审核并暂停评测,专注识别可能造成现实危害或试图绕过监控的行为。

  2. 逛逛GitHubAI 评估 · 46/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    GitHub 热榜推荐 8 个开源项目:Paperclip、Hindsight、Univer、StarNet、wifit3、Kubernetes The Hard Way、OpenBao、Google AX

    AI Agent 管理平台 Paperclip 登上 GitHub 热榜第一,单日新增 2000 多 Star,总 Star 超 8.5 万,支持接入 Claude Code、Codex、Cursor 等 Agent,并提供组织架构、审批、预算与审计记录。

  3. Geek(@geekbb)AI 评估 · 40/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    号称决策模型界的 Ollama:本地拉取并服务 Laya、decider、NLI、GLiClass 等开放决策模型,暴露 TypeSafe 兼容 API

    一个号称"决策模型界 Ollama"的项目可本地拉取并服务 Laya、decider、NLI、GLiClass 等开放决策模型,并暴露 TypeSafe 兼容 API,可用于 LLM 路由和零样本分类的本地推理底座。项目地址为 github.com/ollaya-dev/oll。

9月26日周六
  1. 印记中文AI 评估 · 31/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Node 中文周刊 #244:12 个可取代 npm 包的 Node 内置模块

    Node 中文周刊 #244 盘点了 12 个可取代 axios、dotenv、nodemon、chalk 等 npm 包的 Node 内置模块,并逐一标注其在 Node 24 LTS 中的稳定性等级。

  2. 深思圈AI 评估 · 31/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    微软 CEO Nadella 谈 AI agent 时代:市场规模比云计算大几个数量级

    微软 CEO Satya Nadella 在 Sources Podcast 访谈中称,agent 时代创造的市场规模会比云计算大几个数量级,并批评 AI 行业只顾炫技、忽视普通人真实体验。

  3. 智东西AI 评估 · 33/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    深度拆解华为《物理智能云边端协同架构研究报告》:物理智能规模化为何卡在"协同"上?

    华为联合中国信通院、中科院沈阳自动化研究所等发布《物理智能云边端协同架构研究报告》,提出"三域协同·一网贯通"架构,让端侧负责微秒/毫秒级实时控制、边缘侧负责区域自治与多机协作、云端负责大模型训练与全局规划。报告将落地划分为三阶段,中期(2028—2030年)走向区域自治,并已在WAIC发布全国首个异构人形机器人具身智能训练场"麒麟训练场"作为样板点。

  4. 逛逛GitHubAI 评估 · 63/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    开源决策模型 Laya 上线一周获近 2 万 Star

    TypeSafe AI 推出决策模型 Jev 后,开源项目 Laya 作为其开源版非自回归决策模型上线一周左右获得近 2 万个 Star,它不做文本生成,只根据输入文本和问题在几十毫秒内返回结构化答案和概率。

  5. Jerry Liu(@jerryjliu0)AI 评估 · 42/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    16 款前沿 VLM 文档解析评测:Opus 5.5 性价比最佳,GPT-6 Luna 主打低价

    对 16 款前沿 VLM 的文档解析评测显示,提高 effort 通常能改善 PDF 读取表现,Opus 5.5 在同价位中性能最强,尤其擅长解析表格;Astra 表现也不错但起价更高,GPT-6 Luna 在低价端更有吸引力。

  6. DeepLearning.AI(@DeepLearningAI)AI 评估 · 26/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Andrew Ng:早期 AI 项目无需严格测试,成熟产品则必须

    Andrew Ng 指出,AI 工程策略必须随项目生命周期调整:早期 AI 项目不需要严格的测试,但成熟产品需要。本期 The Batch 还提到 Claude Opus 5.5 的性能指标、Jev 分类模型走红、Devin Fusion 在同一 harness 中引入 lead 与 sidekick 模型,以及面向去中心化智能体的 Message Passing。

  7. Jerry Liu(@jerryjliu0)AI 评估 · 23/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    LlamaParse 如何解决空白单元格导致的表格数据错位

    LlamaIndex 指出,表格中的空白单元格会让 Agent 决策出错,许多文档 OCR 工具读取多个空白单元格时会把数值错移行列,导致下游数值解读错误。官方用 LlamaParse 解析美联储 2026 年 9 月预测表第 2 页,GDP 中位数摘录的九个数字与原始 PDF 全部一致,且在返回的 HTML 中保持对齐。该表因含 2029 年列而对比行留空,正是文档解析器的常见隐性失效点。

  8. GitHub(@github)AI 评估 · 20/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    GitHub Copilot 的 canvases:聊天并非永远正确的 UI

    GitHub 官方账号抛出讨论:聊天是否永远是合适的 UI?@burkeholland 认为不是,至少在 GitHub Copilot 应用中有了 canvases 之后并非如此。该观点以文章形式发布,帖文互动量为 56 条回复、20 次转发、234 次点赞。

  9. Justine Moore(@venturetwins)AI 评估 · 49/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    用 Blender 的智能体将深刻影响媒体制作:Astra 生成场景,经 fal H3 Max 转为 15 秒内写实视频

    fal 的 3D 转视频模型上线 H3 Max,可将最长 15 秒的 Blender 预演转成写实视频,同时保留镜头运动与镜头时序,并支持添加参考图把特定角色和环境带入成片;该模型被称为市面上最快的视频模型,在视频编辑方面排名第一。Justine Moore 让 Astra 制作了人们站在田野中观看 UFO 的场景,反复调整时序与机位后交由 H3 Max 生成写实片段。

  10. Genspark(@genspark_ai)AI 评估 · 30/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Genspark 上线 Nemotron 3 Ultra 与自研 Gen-1 Slides 模型

    Genspark 上线 Nemotron 3 Ultra 与自研 Gen-1 Slides 模型,官方称达到前沿质量而价格仅为 Opus 5 的 1/17。这两个模型与 Nvidia 生态合作落地,Genspark 早前已加入 Open Weights and American AI Leadership 公开信及 Open Secure AI Alliance。

  11. GitHub(@github)AI 评估 · 6/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    GitHub 9 月 29 日网络研讨会:如何用 GitHub Advanced Security 全程验证代码

    GitHub 将于 9 月 29 日举办网络研讨会,介绍如何在开发流程的每个环节用 GitHub Advanced Security 验证代码。该研讨会针对“写代码和交付代码的速度前所未有,但能否信任这些代码”的问题,现已开放注册。

9月25日周五
  1. SemiAnalysisAI 评估 · 36/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    SemiAnalysis 发布中国数据中心模型:中国数据中心容量超 24GW

    SemiAnalysis 推出 SemiAnalysis China Datacenter Model,追踪中国 60 多家运营商的 1000 多个数据中心设施,显示中国数据中心容量超过 24GW,超过 EMEA 和亚洲其他地区。

  2. LlamaIndex 🦙(@llama_index)AI 评估 · 20/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    LlamaParse 解析美联储 2026 年 9 月点阵图表格,9 个 GDP 中位数全部匹配原文

    LlamaIndex 用 LlamaParse 解析美联储 2026 年 9 月经济预测表格第 2 页,与原始 PDF 比对,展示的 9 个 GDP 中位数数字全部匹配,且返回的 HTML 中数据保持对齐。该表格包含 2029 年列,但 6 月对比行对应单元格为空,空白单元格是文档解析器常见却不易察觉的失败点。LlamaParse 可用于这类表头和缺失单元格都关键的表格。

  3. ElevenLabs(@elevenlabsio)AI 评估 · 29/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    ElevenLabs 推出学生版:免费 3 个月 ElevenCreative、ElevenAgents 和 ElevenAPI

    ElevenLabs 推出 ElevenLabs for Students,为学生提供 3 个月 ElevenCreative、ElevenAgents 和 ElevenAPI 的使用权限,外加一年 ElevenReader Ultra。官方称,让学生用上专业工具,是为他们毕业后工作做准备的最简单方式。

  4. Groq Inc(@GroqInc)AI 评估 · 20/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Groq 回应微软"安全刹车":安全云不应成为少数供应商的代名词

    Groq 回应微软 Brad Smith 提出的 AI"安全刹车"主张,认为"安全云"不该变成少数供应商的代名词,安全应是一套运营标准,涵盖访问控制、监控、事件响应与可审计性。Groq 称其 Groq Cloud 从设计之初就面向 AI 构建,在各层级内置防护措施,并对新风险快速响应。

  5. Stack Overflow BlogAI 评估 · 18/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Stack Overflow 播客:AI 时代开发者最该练的是职业怀疑精神

    Stack Overflow 播客对话 BrowserStack 开发者关系与开源负责人 David Burns,讨论 AI 时代职业怀疑精神的价值,以及如何把测试驱动开发用于智能体工程。Burns 认为,修复 flaky test 的关键在于管理应用状态。

  6. orange.ai(@oran_ge)AI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    藏师傅用 Opus 5.5 做 CodePilot 产品宣传视频 skill 测试

    归藏(藏师傅)用 Opus 5.5 为 CodePilot 产品一键生成了一支产品宣传视频,称其在图像图形类前端表现突出,效果"吊打"他所说的 GPT-6 Astra。他表示后续会把相关经验沉淀进自己的 guizang-product-video-skilll,让较弱的模型也能获得不错的效果,并已就此展开 skill 测试。

  7. Elastic BlogAI 评估 · 32/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Elastic DevRel 9 月通讯:jina-ocr-v1 上线、Elastic CLI 技术预览

    jina-ocr-v1 现已在 Elastic Inference Service 上线,单模型完成版式感知文档解析,支持表格、数学公式、手写体和 100+ 语言,总参数 3.4B、推理仅激活 570M,olmOCR-bench 得分 83.4、OmniDocBench 得分 91.14。

  8. Vercel NewsAI 评估 · 51/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Pixel Canary 上线 Vercel AI Gateway 隐身通道并限时免费

    Vercel 在 AI Gateway 以 stealth/pixel-canary 形式上线 Pixel Canary,隐身期内限时免费,该模型擅长编码,包括构建应用、重构代码以及前端开发和移动端应用设计。

  9. QdrantAI 评估 · 30/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    用 Rust 重写 cross-encoder 推理:cross-encode-rs 对比 Python 实测

    Qdrant 用 Rust 重写 cross-encoder 推理并开源为 cross-encode-rs,在小型 reranking 模型上中位延迟仅比 Python 快 1.1x,较大模型上约 1.4x。

  10. Jerry Liu(@jerryjliu0)AI 评估 · 35/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    LlamaIndex 实测:置信度分数如何控制文档抽取的自动化程度

    LlamaIndex 发布博客,讨论置信度分数在文档抽取中的实际价值——关键在于能否用它控制自动化与人工审核的比例。借助 ExtractBench 对比多种抽取系统,在 97% 精度目标下,LlamaParse Agentic Plus 过滤后对期望字段的召回率为 66.48%。文中还涉及置信度阈值、精度与召回、分数覆盖率与粒度、人工审核量等维度。

  11. AI Engineer(@aiDotEngineer)AI 评估 · 8/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    SonarSource CEO Tariq Shaukat 将在 AI Engineer New York 分享智能体软件工厂的验证优先框架

    SonarSource CEO Tariq Shaukat 确认在 AI Engineer New York 演讲,主题为“The Machine that Changed the World, vAI”,提出面向智能体软件工厂的验证优先框架,目标是在快速交付的同时不牺牲信任。活动时间为 10 月 12 日至 14 日。

  12. Aravind Srinivas(@AravSrinivas)AI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Nous Portal 订阅用户在 Hermes Agent 中默认使用 Perplexity Fast Search

    Nous Portal 订阅用户在 Hermes Agent 中已默认启用 Perplexity Fast Search。该搜索面向智能体任务,单次搜索调用延迟为 p50 160 ms、p95 230 ms。

  13. Recraft(@recraftai)AI 评估 · 28/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Recraft V4.1 Flash 上线 ComfyUI,1.3 秒出图

    Recraft V4.1 Flash 已上线 ComfyUI,单张图像生成耗时 1.3 秒,官方称其为市面上最快的图像模型。用户可先快速生成草稿图用于迭代,再将满意的结果精修至 2048×2048 的 Pro 画质。

  14. Fireworks AI(@FireworksAI_HQ)AI 评估 · 41/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Fireworks AI 成为 LangChain LangSmith 微调与 smithtune 的首发训练合作伙伴

    Fireworks AI 宣布成为 LangChain LangSmith Fine-Tuning 和 smithtune 的首发训练合作伙伴,用户可用 LangSmith traces 在 Fireworks 上完成托管 SFT,再经 eval 到部署,全程一个 CLI、无需训练基础设施。

  15. LlamaIndex 🦙(@llama_index)AI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    LlamaIndex 用 ExtractBench 对比文档抽取置信度过滤效果,LlamaParse Agentic Plus 在 97% 精度下召回 66.48%

    LlamaIndex 发布新文章,从"能否用于决定自动化与人工审核"的角度审视文档抽取中的置信度评分,覆盖置信度阈值、精度与召回、分数覆盖率、分数粒度和人工审核量。借助 ExtractBench,其对比了不同抽取系统在置信度过滤后的表现:在 97% 精度目标下,LlamaParse Agentic Plus 过滤后在预期字段上达到 66.48% 召回。