跳到正文

#部署/工程

今日 0 条
9月16日周三
  1. 大淘宝技术AI 评估 · 56/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    大淘宝技术基于GEPA的提示词自进化优化方案

    淘天集团营销与交易技术团队基于ICLR 2026论文GEPA(Reflective Prompt Evolution)设计并实现了一套Prompt自进化系统,构建推理→评分→反思→选择闭环,让LLM自动分析Badcase、归因至Prompt具体规则并生成候选变体,再按帕累托前沿多目标择优。

  2. Varun Mohan(@_mohansolo)AI 评估 · 25/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Antigravity 上 Gemini 3.8 Flash 高负载报错,已修复并重置额度

    Antigravity 上的 Gemini 3.8 Flash 因高负载出现请求报错,现已修复并向所有用户重置配额。Varun Mohan 表示此前正在积极修复,问题解决后即刻重置速率限制。

  3. Harrison Chase(@hwchase17)AI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Harrison Chase:企业级 AI 与「org harness」最难的是 auth,尤其是 Slack 这类多人频道中的授权管理

    Harrison Chase 指出,「org harness」或企业级 AI(相对于个人 AI)最难的部分是 auth,以及在 Slack 这类多人频道中管理授权。他表示团队正在认真思考如何为托管的 deepagents 做好这件事。

  4. NVIDIA AI(@NVIDIAAI)AI 评估 · 28/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    NVIDIA 技术解析:30B 参数模型如何每 token 仅激活 3B 参数

    NVIDIA 发布技术解析,解释 30B 参数模型为何每 token 只激活 3B 参数却仍能调用全部模型容量。文章对比稠密模型与 MoE 模型在参数使用方式上的差异,并说明这对吞吐量、内存占用和部署复杂度的影响。

  5. Elastic BlogAI 评估 · 28/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Elastic Cloud Serverless 跨项目搜索正式 GA,单条查询跨最多 100 个项目且数据零迁移

    Elastic 宣布 Elastic Cloud Serverless 跨项目搜索(CPS)正式 GA,用户可在多个 serverless 项目间执行单条查询,覆盖所有区域、项目类型与云厂商,数据原地查询、无需迁移。

  6. Epoch AIAI 评估 · 44/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Epoch AI 扩展全球 AI 数据中心研究,覆盖全球约 44% 的 AI 算力

    Epoch AI 将其 AI Data Centers explorer 从 13 个数据中心扩展到 86 个,覆盖全球 AI 算力估计从 15% 升至 44%,2026 年已捕捉到当年新增部署算力的约 53%。页面新增 Directory 标签页,可按算力、IT 功率或成本排名,并按所有者、主要用户或国家筛选,同时提供卫星影像对比。Epoch AI 称对中国数据中心的覆盖仍偏低,为 9-31%。

  7. 硅谷101AI 评估 · 38/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    硅谷101|推理芯片之战:聊聊 Groq、Cerebras 与 OpenAI 三大路径

    推理芯片竞赛升温:英伟达以约200亿美元对 Groq 进行 acqui-hire,Cerebras 今年6月 IPO 市值达670亿美元,OpenAI 联手博通推出首款自研推理芯片 Jalapeño,从设计到流片仅用9个月。

  8. Perplexity(@perplexity_ai)AI 评估 · 47/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Perplexity 推出 CobbleDB,专为 AI 搜索的批量页面记录读取优化,并计划开源

    Perplexity 推出 CobbleDB,这是一款专为重复批量读取 prepared page records 打造的数据库,用于优化其搜索负载的性能与成本。Perplexity 计划将 CobbleDB 开源,供其他构建 AI 搜索的团队使用。

  9. Perplexity(@perplexity_ai)AI 评估 · 30/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Perplexity 公开 CobbleDB 研究:两人加数百 AI 智能体两个月建成搜索键值数据库

    Perplexity 发布研究,介绍其为搜索网页内容服务的键值数据库 CobbleDB 的构建过程,由两名工程师和数百个常驻 AI 智能体在两个月内完成核心基础设施。该数据库用于为 Perplexity 搜索提供网页内容支持。

  10. Fireworks AI(@FireworksAI_HQ)AI 评估 · 41/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Fireworks AI 实测:DeepSWE 智能体成本 99.6% 命中缓存,单任务 $0.43 对 $6.52

    Fireworks AI 在 Astra 与 DeepSeek V4.1-Flash 上运行 DeepSWE,输入 token 与输出 token 比例为 174:1,其中 99.6% 为缓存命中,缓存命中占账单的 60%。两者质量相同,但单任务成本分别为 $0.43 与 $6.52。

  11. Varun Mohan(@_mohansolo)AI 评估 · 34/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Gemini 3.8 Flash 在 Antigravity 上高负载报错,官方称正在修复并将重置速率限制

    Gemini 3.8 Flash 在 Antigravity 上遭遇高负载,出现请求报错。官方表示正在积极修复,问题解决后将重置速率限制。

  12. Greg Brockman(@gdb)AI 评估 · 65/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    ChatGPT Work 推出 Data agent,可连接 PowerBI、Tableau 等数据源

    OpenAI 在 ChatGPT Work 中推出 Data agent,用户添加 Data Plugin 并连接已有数据源后,即可把公司数据转成答案、交互式仪表盘和操作。

  13. NVIDIA Technical BlogAI 评估 · 31/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Dense 与 MoE 模型对比:激活参数、吞吐量与选型时机

    NVIDIA 技术博客解析 Dense 与 MoE 两类模型架构的差异:以 Nemotron 3.5 Lightning 为例,30B 参数模型通过 MoE 架构每个 token 仅激活 3B 参数,仍能利用更大模型的容量。文章对比两者的激活参数与吞吐量,并给出各自的选型时机。

  14. NVIDIA Technical BlogAI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    NVIDIA NVLink 6 如何为 AI 工厂提供多层弹性

    NVIDIA 详解 NVLink 6 如何为大规模 AI 工厂提供多层弹性。在超大规模 AI 训练中,集群内每块 GPU 每秒需完成数千次集合通信以同步梯度;推理阶段非计划停机则会直接减少请求处理量,压缩收入。

  15. NVIDIA Technical BlogAI 评估 · 20/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    NVIDIA Groq 3 LPX 确定性执行如何为 NVIDIA Vera Rubin 带来高能效高交互推理

    NVIDIA 详解 Groq 3 LPX 的确定性执行如何在 NVIDIA Vera Rubin 平台上驱动高能效、高交互性推理。文章指出,功耗是 AI 工厂的核心约束,衡量 AI 平台价值的关键指标是每瓦性能而非未归一化的原始吞吐量。

  16. mem0(@mem0ai)AI 评估 · 40/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    mem0 推出 Gateway:为每个 AI 智能体发放仅含授权工具的单一密钥

    mem0 推出 Gateway,为每个 AI 智能体发放一把只包含被授权工具的密钥,MCP server 与自有 API 共用同一把,任务变化时可随时调整授权,智能体始终接触不到真实凭证。该产品已进入 Beta,已有客户各通过它运行超过 95,000 次调用。

  17. LlamaIndex 🦙(@llama_index)AI 评估 · 24/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    LlamaIndex 谈用 Stainless 维护 SDK:API 一变就要更新、测试和发布

    LlamaIndex 分享了借助 Stainless 为 LlamaParse 生成并维护 SDK 的经验,指出每次 API 变更都会带来更新、测试和发布成本,而代码中暴露的不一致命名与 schema 也更难被忽视。Stainless 团队已加入 Anthropic,George He 和 Yong Park 撰文回顾了做对了什么、学到了什么,以及更换 SDK 生成器为何比预想更需谨慎。

9月15日周二
  1. Dify(@dify_ai)AI 评估 · 12/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Dify 与 TiDB、Eagle Cloud 悉尼 Tech Night:从原型到可信生产

    Dify 将于 9 月 18 日在悉尼与 TiDB、Eagle Cloud 共同举办 Tech Night,主题为“Scaling AI: From Prototype to Trusted Production”。

  2. mem0(@mem0ai)AI 评估 · 38/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    mem0 推出 Gateway,为 AI 智能体按操作粒度授权

    mem0 发布 Gateway,解决智能体 API key 权限过宽的问题:同一把 key 既能查支付也能退款、既能起草页面也能删除工作区,而 Gateway 让开发者只授予意图内的操作。查支付、起草页面可以,其余动作保持禁止。

  3. Perplexity(@perplexity_ai)AI 评估 · 31/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Perplexity 在部分 HP PC 上推出 Portable Computer,本地模型端侧跑任务

    Perplexity 在受支持的 HP PC 上推出 Portable Computer,这是 Computer 的本地优先版本,可用本地模型完全在设备端运行任务。该版本将私密数据留在用户机器上,且不消耗云额度。

  4. Perplexity(@perplexity_ai)AI 评估 · 33/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Perplexity Computer 将预装于 HP ZBook Ultra G3a

    Perplexity Computer 将预装于 HP ZBook Ultra G3a,用户可通过简单界面运行复杂的多步骤工作。Computer 智能体基于深度研究,并可连接数百种工具,其中新增 Autodesk。

  5. NVIDIA Technical BlogAI 评估 · 13/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    NVIDIA FLARE 如何跨 Docker、Kubernetes 与 Slurm 扩展联邦学习

    NVIDIA FLARE 支持在 Docker、Kubernetes 和 Slurm 上扩展联邦学习,解决项目规模扩大后 GPU 按需分配、多个研究任务相互隔离的问题,同时让每个参与机构保留对自有数据的控制权。该方案将联邦学习的挑战从运行算法转向共享基础设施的运营。

  6. 超人的电话亭AI 评估 · 27/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    岗位要求 Vibe Coding,UI 设计师为何要会“指挥 AI 编程”

    当前 UI 设计师招聘中 10 家有 6 家以上要求 AI 技能,Vibe Coding 在大厂 JD 中出现频次极高。Vibe Coding 即指挥 AI 生成代码,能让人体验产品从零到上线的完整生命周期、认识 AI 的能力边界并积累技术框架认知。入门方式是打开 Codex、Workbuddy、豆包工作等工具,从待办管理、番茄钟等自用本地小工具做起,再部署到服务器跑通。

  7. 随机小分队AI 评估 · 10/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Linkloud 沙龙第44期:Agent 如何从“能做”走向“能用”与“能卖”?

    Linkloud 沙龙第44期将于 9 月 19 日在成都举办,主题为 Agent 如何从“能做”走向“能用”与“能卖”。SandBaseAI 创始人李样兵、VMEG.AI 创始人胥彪、Deotaland 联合创始人兼 CTO 凌星炜、Crescendia 创始人王斌将围绕 Agent 工程化、FDE 角色、海外 0 到 1、AI Agent 智能硬件与 GEO 增长展开对话。

  8. 乌鸦智能说AI 评估 · 27/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    京东发布 JD JoyWork、JoyDesk 2.0、百灵数字员工与 JoyCode 四款企业级 AI 办公产品

    京东一次性发布四款企业级 AI 办公产品:JD JoyWork、JoyDesk 2.0、京东百灵数字员工和研发生产力平台 JoyCode,主打从“能干活”转向“能交付结果”。其中百灵数字员工按 KPI 验收交付,客服场景使某保险客户转人工率下降 50%。这些产品已落地北京市“京办”,并服务五粮液、荣耀、雀巢等客户。

  9. 字节跳动技术团队AI 评估 · 17/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    飞连如何为豆包工作提供数据保护与 Agent 运行安全

    飞连将安全能力融入豆包工作的使用过程,覆盖工作成果保护、Agent 运行安全和整体 AI 办公治理。飞连可识别并保护豆包工作处理、生成的文件内容,按企业策略控制敏感数据流转,并对 Skill 下载进行检测、阻断恶意 Skill、扫描隔离本地风险文件。飞连还能从终端、网络和应用行为中持续发现 AI 资产,支持对高风险 Agent、AI 工具和 AI 网站设置访问限制。

  10. idoubi(@idoubicc)AI 评估 · 37/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    协作类 agent 如何保证群组整体可用性:leader 选举、冗余备份与断点恢复

    做协作类 agent 的关键在于把 claude、codex、gemini、grok 等 10 余个 agent 拉进同一群组,在无人干预下自主分工。作者提出冗余备份分组、leader 协调监控与选举、worker 定时上报进度、checkpoint 断点恢复与幂等重入等设计,以解决 agent 罢工、leader 挂掉和任务冲突等问题,并已在 termany.sh 中实现多项策略。

  11. LangChain BlogAI 评估 · 25/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Schneider Electric、Vodafone 与 monday.com 如何在欧洲和中东规模化落地 AI 智能体

    Schneider Electric、Vodafone 和 monday.com 分享了规模化运营 AI 智能体的经验:Schneider Electric 建立 350 人内部 AI Hub,支撑 60 多个智能体,以可观测性、评估和部署为核心构建 LLMOps 体系。

  12. LangChain BlogAI 评估 · 59/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    LangChain 如何构建其付费媒体智能体

    LangChain 公开其付费媒体智能体的构建过程,该智能体常驻 Slack,每周一汇总各广告平台数据并生成报告,六个月内把付费媒体对营销管线的贡献从 0 提升到 20%,6 月至 8 月单条合格线索成本下降 30%。

  13. 硅谷科技评论AI 评估 · 38/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    模型越来越便宜,什么才开始值钱?——Imagination In Action 硅谷 AI 峰会观察

    2026 年 9 月 14 日 Imagination In Action 硅谷 AI 峰会上,嘉宾反复提到模型能力仍在变强但已不值钱,真正的门槛转向速度、路由架构、专有数据和物理供应链。

  14. 暗涌WavesAI 评估 · 33/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    芝诺机器人完成数亿元种子轮融资,押注多机协作与3B模型Zeno-1

    具身智能初创公司芝诺机器人完成总额数亿元人民币种子轮融资,投资方包括舜宇光学、沐曦股份、网新集团、赛意产业基金等。该公司自研3B参数基础模型Zeno-1与机器人Malo,采用去中心化架构实现多机协作,据称单策略可连续运行超10分钟、完成8个子任务。芝诺机器人于2025年11月展业,预计2027年上半年启动规模化进程。

  15. NVIDIA AI(@NVIDIAAI)AI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    NVIDIA 在 IBC2026 扩展 AI for Media 合集,新增 SDK、NIM 微服务与蓝图

    NVIDIA 在 IBC2026 为 AI for Media 合集新增 SDK、NIM 微服务、playbooks 和 blueprints,面向媒体生产场景,可用于核验素材是否由 AI 生成、制作更平滑的慢动作回放,以及为节目提供口型同步的配音翻译。

  16. SemiAnalysisAI 评估 · 74/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    SemiAnalysis 实测 Vera Rubin NVL72 智能体推理:每美元性能最高提升 67 倍

    SemiAnalysis 用自研 AgentX 智能体推理基准实测 NVIDIA Vera Rubin NVL72,在 Apples to Apples TRTLLM NVFP4 Dense 配置下。

  17. Fireworks AI(@FireworksAI_HQ)AI 评估 · 23/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Fireworks AI 助 Juicebox 将推理成本从 400 万美元降至 80 万美元/年,延迟降低 80%

    Fireworks AI 帮助 Juicebox 用定制专用模型,把数十万份人才档案的实时搜索延迟降低 80%,推理成本从每年 400 万美元降至 80 万美元。Juicebox 需要多个实时搜索智能体在数秒内完成检索。

  18. Augment Code(@augmentcode)AI 评估 · 8/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Augment Code 将在 TheLeadDev NYC 举办半天软件工厂构建实战工作坊

    Augment Code 将于本周四在 TheLeadDev NYC 期间举办一场半天工作坊,主题是构建你自己的软件工厂(software factory)。活动为实战性质,需通过其 luma.com 页面申请名额。

  19. NVIDIA AI(@NVIDIAAI)AI 评估 · 28/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    NVIDIA 为 Nemotron 3 Ultra NIM 优化推理,4 块 B200 上并发用户数提升 2.5 倍

    NVIDIA 工程师针对 Nemotron 3 Ultra NIM 优化了缓存、内存、并行与解码等环节,在 4 块 B200 GPU 上支持最高 2.5 倍的并发用户数,同时维持 50 TPS/user 的生成速度。官方已发布这次推理优化的工程深度解析。

  20. NVIDIA Technical BlogAI 评估 · 21/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    NVIDIA Transformer Engine 加速 JAX 中的 Dropless MoE 训练

    NVIDIA 在技术博客中介绍如何用 Transformer Engine 加速 JAX 框架下的 Dropless MoE 训练。MoE 已成为大规模 AI 模型训练的标志性架构趋势,DeepSeek、Qwen、Mixtral 等模型以远低于稠密模型的训练算力达到甚至超越其性能,其核心在于条件计算——不再共享单一稠密 FFN。

  21. SemiAnalysisAI 评估 · 36/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    大脑太大带不动:机器人推理该放在本体还是数据中心

    SemiAnalysis 分析机器人与 LLM 的硬件逻辑差异:LLM 是模型先行、硬件适配,机器人则因实时控制环路和整机成本约束,硬件固定、模型去适配 Jetson 或 H100 等可量产硬件。

  22. bolt.new(@boltdotnew)AI 评估 · 50/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Bolt 推出 Bolt Forge,联合 Arcee、Microsoft、Vercel 等加速开源权重模型

    Bolt 发布 Bolt Forge,合作方包括 Arcee、Microsoft、Vercel、Fireworks 和 DigitalOcean,目标是推动开源权重模型达到前沿水平并提供充足 token。为庆祝上线,Bolt 向 100 人赠送免费 Bolt Pro,在评论区留言"Forge"即可通过私信领取兑换码。

  23. bolt.new(@boltdotnew)AI 评估 · 20/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Bolt Lite 定价 $9/月,含 Forge 的 50x 用量

    Bolt 推出 Bolt Lite,定价 $9/月,包含 Forge 的 50x 用量,面向学生、周末开发者和值得上线的副业项目。邀请本周开始发放,报名将于 Oct 14 截止,加入后价格永久保持 $9。