跳到正文

#部署/工程

今日 0 条
9月25日周五
  1. Perplexity(@perplexity_ai)AI 评估 · 41/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Perplexity 介绍 Photon:p99 响应时间从约 800 ms 降至约 65 ms

    Perplexity 详解其 Photon 架构:p99 响应时间从约 800 ms 降至约 65 ms,使用的服务机器减少约 20%,每个文档可存储的数据量提升 2.5 倍。该公司同步给出了 Photon 的构建方法以及 Fast Search 的接入入口,Fast Search 已可通过 API 使用。

  2. Perplexity(@perplexity_ai)AI 评估 · 16/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Perplexity Photon 如何将新索引构建与在线查询服务分离

    Perplexity 的 Photon 将新索引构建与处理实时查询的服务器分离,版本就绪后逐个更新 serving group。每次更新会用真实搜索查询预热缓存并检查就绪状态,再将其重新纳入路由,其余 serving group 持续提供查询服务。

  3. Perplexity(@perplexity_ai)AI 评估 · 48/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Perplexity Search API 推出 Fast Search,基于 Rust 服务 Photon

    Perplexity 在 Search API 中推出 Fast Search,底层是全新 Rust 检索与排名服务 Photon,由小规模工程团队加数百个智能体构建。官方称其 95% 的搜索结果可在 230 ms 内返回。

  4. LangChain BlogAI 评估 · 51/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    LangSmith Engine v2 发布,新增红队测试与修复预验证

    LangChain 发布 LangSmith Engine v2,新增 Red Teaming 主动排查工具,通过分析智能体的生产 traces 和仓库来测试幻觉、违反 system prompt 等尚未在生产暴露的问题,目前向现有 LangSmith Deployment 用户开放 Private Beta。

  5. DockerAI 评估 · 62/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Docker 发布 Sandboxes、Sandbox Kits 与 Cloud Sandboxes

    在 WeAreDevelopers North America 主题演讲中,Docker 总裁 Mark Cavage 发布面向 AI 智能体的 Docker Sandboxes,为每个智能体提供独立隔离的 microVM 与内核,并通过独立 CLI 免费提供。

  6. Grafana LabsAI 评估 · 30/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    如何用 SLO 给 AI 智能体的幻觉设定预算

    Grafana Labs 把可靠性工程中的错误预算(error budget)用于 AI 智能体质量,通过 evaluations 让模型裁判对 groundedness、fulfillment、toxicity、latency、cost 等行为分别打分,再把分数变成带目标的 SLO,例如设定 30 天内 95% 的对话被判定为 fulfilled。

  7. Runway(@runwayml)AI 评估 · 30/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Runway 为 Seedance 2.5 推出 Draft 模式,生成更快更省积分

    Runway 为 Seedance 2.5 上线 Draft 模式,可在探索阶段以更快速度、更少积分生成内容,再将满意的结果提升至完整质量。目前该模式已可通过官方链接开始使用。

  8. AI Engineer(@aiDotEngineer)AI 评估 · 16/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Bridgewater 的 Sam Green 将在 AI Engineer New York 分享 Vault 非结构化数据平台

    Bridgewater 应用 AI 团队负责人 Sam Green 将在 AI Engineer New York 带来演讲“Vault: When Fifty Years of Structured Data Isn't Enough”,介绍 Bridgewater 如何构建共享非结构化数据平台,为投资研究与生产环境中的 AI 智能体提供支撑。会议于 10 月 12–14 日举行。

  9. DockerAI 评估 · 71/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Docker 发布 Sandbox Kit 规范 v3,用 OCI 镜像声明智能体权限

    Docker 发布 Sandbox Kit 规范 v3,采用 Apache 2.0 开源在 docker/sandbox-kit-spec 仓库。

  10. DockerAI 评估 · 66/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Docker 推出 Cloud Sandboxes,一条命令在本地与云端之间迁移 Agent

    Docker 发布 Cloud Sandboxes,将原有的 microVM 沙盒放到 Docker 托管算力上运行,本地与云端共用同一套隔离模型和 CLI,可用 `sbx move my-project --to cloud` 双向迁移。

9月24日周四
  1. LangChain BlogAI 评估 · 47/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    LangSmith 推出 Trajectories:可读的智能体会话视图

    LangSmith 上线 Trajectories,把一条 thread 内主智能体与子智能体的消息、工具调用按首次出现顺序聚合,去掉嵌套 run 结构,让长会话以对话路径形式可读。

  2. Milvus(@milvusio)AI 评估 · 30/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Milvus 3.0 Function Chain 重排演示:向量检索内融合 XGBoost 业务打分

    Milvus 3.0 Function Chain 重排演示展示了如何在一条检索链路内完成商品重排:BGE-M3 将查询转为嵌入向量,Milvus 执行 COSINE 向量检索召回 top 20 商品,服务端 Function Chain 计算热度、价格亲和度、新鲜度与归一化语义分,再由 XGBoost 模型融合成新的业务分数并返回重排结果。

  3. Recraft(@recraftai)AI 评估 · 31/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Recraft V4.1 Flash 上线 OpenRouter:1.3 秒出图,每张 $0.007

    Recraft V4.1 Flash 现可通过 OpenRouter 调用,官方称其为市面上最快的图像模型,每张图生成耗时 1.3 秒,价格 $0.007/image。该模型延续 Recraft 在摄影、人像、复杂场景、logo 和早期概念上的表现,面向高并发生成与快速迭代场景。

  4. Latent.Space(@latentspacepod)AI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Latent.Space 播客对话 TypeSafe CEO:Jev、System One Model 与可靠 AI

    Latent.Space 发布对话 TypeSafe CEO @CompleteSkeptic 的播客,其打造的产品 Jev 被明确不称作「Decision Model」。他解释 AI 能解决极难问题却仍无法自动化基础工作,Jev 面向软件内的可靠决策而非聊天,TypeSafe 拒绝公开 benchmark 和 API 层的拒绝机制,并称即便有 10 亿美元也不会从头预训练模型。

  5. AI Engineer(@aiDotEngineer)AI 评估 · 11/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Bridgewater Associates 产品工程负责人 Aaron Linsky 将在 AI Engineer New York 分享生产级 AI 分析师的检索层权限实践

    Bridgewater Associates 产品工程负责人 Aaron Linsky 将在 AI Engineer New York 带来演讲《Can Your AI Analyst Keep a Secret?》,深入生产级 AI 分析师的检索层,讲解 Bridgewater 与 turbopuffer 如何在数百万份机密文档上实施动态的行级权限控制。大会时间为 10 月 12–14 日。

  6. 晚点LatePostAI 评估 · 39/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    创业 11 年沈亚楠的非共识:恩戈罗机器人第一步就要进家庭

    沈亚楠创立具身公司恩戈罗(NGORO),第一款机器人放弃双足和拟人造型,用轮式底盘、最小转弯半径 30cm,第一批产品做洗衣、房屋清洁、物品归位与递送,2027 年将作为栖息地智能住宅标配交付真实用户,首批约 2000 台。他判断家庭是最接近通用也最难的场景,恩戈罗要借栖息地的半结构化住宅与仿真、真机数据先启动数据飞轮。

  7. 网易科技AI 评估 · 29/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    曦望王湛:Token 成本是 AI 普惠的最后一公里

    曦望Sunrise联席CEO王湛在2026网易未来大会上提出,AI产业的损益表正在被Token重写,Token价格直接决定智能经济规模。他援引国家数据局数据称国内日均Token调用量已从2024年初的1000亿增至今年3月的140万亿,并判断算力结构性缺口大概率延续到2028年。曦望为此推出专为推理设计的启望S3 GPU,单卡性能为上一代5倍,单Token成本降低90%。

  8. 印记中文AI 评估 · 18/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    JavaScript 中文周刊 #254:tinyjs 打造不到 10MB 的 JavaScript 桌面应用

    tinyjs 能用不到 10MB 的体积构建 JavaScript 桌面应用,内置 txiki.js 驱动的后端,可访问包括 FFI 在内的完整系统能力,配合原生 WebView 渲染,支持打包到 macOS、Linux 和 Windows。

  9. 京东技术AI 评估 · 34/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    拆解京东海博 AI-Native 落地保障:海博团队 AI 知识库能力建设

    京东海博团队把大模型“读不懂业务全貌”重新定义为“经营好上下文”,采用 OKF 规范将知识编译从运行时前移到维护期,构建项目知识×领域知识矩阵、角色化知识层与 Skill 能力层三层结构,并用 AB 实验验证带知识库“更快更全”。以 40w 行代码的 yzt-erp-wms 仓库为例,共沉淀约 1051 篇知识文档,其中 flows/ 接口与流程 1001 篇、chains/ 业务链路 41 篇。

  10. 甲子光年AI 评估 · 46/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    电力成算力新约束,华为如何用“源网荷储AIDC”解题

    华为数字能源首次公布源网荷储AIDC解决方案,围绕“3+1”创新重构,目标是让每一瓦特产出更多Token。方案包括MIMO供电架构、泰山UPS(单柜1280kVA、双变换效率最高98%)、恒山直流UPS(支持270V/400V/800V)和SmartLi 5.0、LUNA2000多层混合储能。商汤项目采用工厂预制与室外部署,45天完成18MW供配电系统全流程交付。

  11. 甲子光年AI 评估 · 62/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    直击2026骁龙峰会:2nm旗舰首秀,但Agent正在重塑骁龙

    高通在2026骁龙峰会上发布第六代骁龙8超级至尊版和第六代骁龙8至尊版,首次将2nm工艺用于旗舰移动平台,两者搭载最高5GHz的Oryon CPU和重新设计的Hexagon NPU,超级至尊版还在Adreno GPU中首次加入Matrix Cores并支持8K/60fps视频拍摄。

  12. DifyAI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    信任即核心:Dify 插件生态的安全与治理之道

    Dify 高级开发者关系郑立撰文披露其插件生态的安全与治理机制:截至 2026 年 8 月 25 日,Marketplace 共列出 928 个插件、907 个带有安装记录、263 个官方标注条目,官方称维护基线为 99 个主动维护插件。

  13. 51CTO技术栈AI 评估 · 40/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Brad Gerstner:AI泡沫会不会破,要看开发者能不能让 Token 赚钱

    Altimeter Capital 创始人兼 CEO Brad Gerstner 在 All-In Summit 上判断,目前还不是 2000 年式 AI 泡沫:英伟达收入一年约翻一倍,半导体公司贡献了纳斯达克约 70% 的回报,头部 AI 实验室合计年化收入约 1000 亿美元,但需要冲到 1800 亿美元才能跟上资本开支。

  14. 阿里技术AI 评估 · 45/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    代码生成越来越快,软件交付真正的瓶颈转向了哪里?

    在云栖大会阿里巴巴 AI Native 研发实践论坛上,阿里、蚂蚁、飞猪等团队披露:编码仅占软件交付总时长 20%—30%,极端链路中编码不足 1%、约 1 小时,但需求到交付仍需约 21 天,时间耗在影响分析、环境准备、联调、审批、灰度和封网等环节。

  15. idoubi(@idoubicc)AI 评估 · 44/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Douchat 接入 Jev:让群聊里的多个 Agent 围绕同一任务协作

    Douchat 接入 Jev,把群聊里的多个 Agent 从"轮流回复消息"改为"围绕一个任务协作",由 Jev 做结构化判断、LLM 负责规划和执行、程序负责调度与状态记录。

  16. Qdrant(@qdrant_engine)AI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Kaivid Labs 将 40 万+文档向量从 Milvus 迁移至 Qdrant

    Kaivid Labs 团队将 40 万+文档向量从 Milvus 迁移到 Qdrant,并记录了整个过程。他们说明了迁移的处理方式、验证数据完整性,并对比了两套系统在延迟、吞吐量和内存占用上的表现。完整记录已发布在 kaivid.com 博客。

  17. 乌鸦智能说AI 评估 · 46/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    从华为NPO到阿里SNPO:AI算力的下一场战争开始卷"光"

    阿里云在云栖大会发布磐久AL64分布式SNPO光互连超节点,将光互连推进到XPU附近,其SNPO支持3.2T、6.4T,带宽密度比现有OIF规范提升约25%。曦智科技同期首次展示面向XPU Scale-Up的SNPO产品——3.2T/6.4T收发一体硅光芯片。据美银估算,AI光连接市场将从2025年约140亿美元增长到2030年约730亿美元。

  18. 沃垠AIAI 评估 · 27/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    元宝上线专家模式:一句话生成可实时修改、可分享的旅游规划

    腾讯元宝最近上线专家模式,用户输入“帮我做旅游规划/三日游/行程安排”等关键词即可触发。该模式下交通、天气、景区、酒店信息全部来自第三方数据并支持实时联网搜索,景区卡片标注免费或门票价格,可直接跳转同程微信小程序购买。方案含真实地图轨迹、支持多轮修改和手机电脑分享,元宝同期还上线了购物功能。

  19. Viking(@vikingmute)AI 评估 · 48/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenSEO 这个开源库真的好用吗?已获 2 万 stars、对 agent 友好,号称可替代 Semrush 和 Ahrefs

    开源库 OpenSEO 近日获得大量推荐,GitHub stars 已达 2 万,并对 agent 友好,号称可替代 Semrush 和 Ahrefs。发帖者询问实际用过的用户:效果真的不错,还是只是 hype?

  20. 袋鼠帝AI客栈AI 评估 · 24/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    逛完云栖大会,看阿里的AI野心:从Qwen新模型到真武V900芯片

    阿里云栖大会透露,Qwen将训练5-10T参数新模型,平头哥发布真武V900芯片,性能是M890的3倍、单集群可扩至50万卡;阿里云计划到2032年达到20GW规模,吴泳铭在演讲中判断机器思考总量未来将是人类的1000倍以上。作者还测评了阿里AI硬件QwenNote Eva,并推荐了开源的《魔搭紫皮书》。

  21. 暗涌WavesAI 评估 · 33/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    芯光界成立不足5月完成五轮融资超10亿,角力3.2T NPO量产

    国内光互连初创公司芯光界成立不足5个月已完成五轮融资,累计融资额超10亿元,第六轮融资近期启动,完成后将暂缓融资直至产品量产。芯光界正推进一款面向国内GPU和交换机龙头企业的3.2T NPO光引擎量产,双方联合研发,预计最迟于2027年年中进入量产阶段。其NPO设计预留速率升级空间,可在一个月内从3.2T切换至6.4T。

  22. Web3天空之城AI 评估 · 42/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    黄仁勋最新对话:AI危言耸听已走得太远,解析人工智能的工业革命逻辑

    英伟达CEO黄仁勋在最新访谈中称AI危言耸听已走得太远,将当前AI浪潮视为一场新的工业革命,提出能源芯片、AI工厂、模型、应用、社会影响构成的"五层蛋糕"架构。他反驳AI终结就业的"有害神话",认为安全、对齐和沙盒化都是可通过工程手段解决的问题,产品不安全就不应发布,并强调世界既需要闭源也需要开源模型,以便各国和企业掌控自己的基础设施。

  23. Vercel NewsAI 评估 · 23/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Klaviyo 如何在 Vercel 上两周内交付 356 个内部应用

    Klaviyo 在 Vercel 上搭建内部应用平台,向全员开放后头两周就有 512 名员工部署了 356 个应用,其中 196 个是带独立数据库的全栈应用。应用默认 SSO 门控且私有,员工从想法到上线不超过 3 分钟;Klaviyo 还自建 K:Forge 流水线,借助 Secure Compute 让应用直连自有数据库而不经公网。

  24. Hunyuan(@TXhunyuan)AI 评估 · 28/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    腾讯混元研究:LLM 强化学习批次规模扩展,PPO 生成吞吐最高提升 2.29 倍

    腾讯混元在线上 LLM 强化学习场景下重新审视经典临界批次规模理论,覆盖 GRPO 与 PPO 两类算法。研究发现,重新调整学习率可在一定批次规模范围内保持每个回复的学习效果;在固定硬件上扩大批次规模可使 PPO 生成阶段吞吐最高提升 2.29×,其测得的最佳 GRPO 配置完成同一验证目标所需时间减少 29%。

  25. 魔搭ModelScope社区AI 评估 · 62/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    中国电信开源 TeleOCR:1.2B 参数文档解析模型,登顶 OmniDocBench v1.6 榜单

    中国电信星辰通用人工智能实验室开源 1.2B 参数文档解析模型 TeleOCR,在 OmniDocBench v1.6 取得 96.87 总分登顶榜单,并拿下 PureDocBench 榜首和 ICDAR-2026 科学图解析挑战赛冠军。

  26. Hunyuan(@TXhunyuan)AI 评估 · 29/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    腾讯混元研究:LLM 强化学习批大小与训练效率新发现

    腾讯混元(Hunyuan)将经典临界批大小理论扩展至在线 LLM 强化学习,在 GRPO 和 PPO 上发现,重新调整学习率可在一定批大小范围内保持每个响应的学习效果。在固定硬件上,扩大批大小使 PPO 生成阶段吞吐量最高提升 2.29×,最佳 GRPO 配置以少 29% 的时间达到相同验证目标。

  27. 腾讯云开发者AI 评估 · 59/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    JEV 为什么拆出判断层:从 LLM 架构演化看快慢思考分工

    TypeSafe AI 于 2026 年 9 月 15 日发布 JEV 并获 4000 万美元种子轮(DCVC 领投),该模型不生成文本,只按预先定义的问题类型返回是否概率、枚举选择或量表分值,输入定价 $0.042/百万 token、输出免费。

  28. andrew chen(@andrewchen)AI 评估 · 13/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    本地 AI、主权 AI 与 GPU 囤积:一批新创公司正在涌入

    有一批新创公司正聚焦本地 AI、主权 AI 和 GPU 囤积,andrew chen 对此表示认同,并祝贺 Zain Javaid 与 ghostai 团队。

  29. Modal BlogAI 评估 · 50/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Modal 发布 Quail 推理引擎,把 AI-SQL 查询规划与推理引擎联合优化

    Modal 发布面向 AI-SQL 的推理引擎 Quail,将 SQL 查询规划与推理执行联合优化,在单条多表连接查询上达到每 H100 GPU 每分钟处理超 10 亿 token,比同硬件的 vLLM 基线快 10 倍以上。

  30. Vercel NewsAI 评估 · 21/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Vercel Connect 现已支持 TanStack AI

    Vercel Connect 现已支持 TanStack AI,用 TanStack AI 构建的智能体可调用受 OAuth 保护的 MCP 服务器,无需自行存储或轮换凭证。