恒瀚微完成近亿元天使轮融资,400G RDMA智能网卡已获正式订单
成都恒瀚微电子2026年8月完成近亿元天使轮融资,投资方为北京国泰、成都科创投、成都高新创投和中信聚信投资,资金用于产品迭代、人才引进和市场拓展。其首款400G RDMA智能网卡已完成送样验证并拿到正式订单,自研RDMA架构结合credit-based主动拥塞管理,部分测试场景动态时延为英伟达同类产品(CX-7)的1/2至1/3。
成都恒瀚微电子2026年8月完成近亿元天使轮融资,投资方为北京国泰、成都科创投、成都高新创投和中信聚信投资,资金用于产品迭代、人才引进和市场拓展。其首款400G RDMA智能网卡已完成送样验证并拿到正式订单,自研RDMA架构结合credit-based主动拥塞管理,部分测试场景动态时延为英伟达同类产品(CX-7)的1/2至1/3。
Unsloth 与 Windows 团队合作,将微软开源的跨平台沙箱系统 mxc 集成到 Unsloth 的 Windows 版本中,用于隔离 AI Agent 的代码执行,官方称额外开销低于 100 ms。
一篇论文提出 HERMES harness:在整仓库迁移任务上,同一模型与相同 effort 设置下,GPT-5.6 Sol 的成绩从 Codex 的 6.5% 提升到 HERMES 的 31.0%,作者认为增益来自 harness 本身。
Compositor v1.4 发布,本次更新带来全应用范围的 GPU 性能提升,帧渲染速度提高 10 倍,可轻松处理大文件,应用体积仅 11MB。该软件被称作 PS 的开源平替。
Simon Willison 的 token 计数 CLI 工具 ttok 发布 0.4 版本,修复了 Click 警告、更新了 CI,并新增 --list-models 命令用于列出可用模型。该工具基于 OpenAI 开源 tiktoken 库,已两年多未更新,可通过 uvx 直接运行,如 cat file.txt | uvx ttok。
Google Cloud 开源 AQuA(Ambient Quality Agent),一个与生产环境 AI 智能体并行运行的参考实现,可扫描并核验失败聚类、对照对话记录,并按实际部署的源码快照定位根因。它针对的是智能体上线后难以察觉的质量回归——这类问题往往仍返回 HTTP 200 OK。
Google AI Edge 推出 ML Drift,一个面向端侧 AI/ML 推理的高性能通用 GPU 计算框架。它封装了 OpenGL ES、OpenCL、Metal 和 WebGPU 等硬件与底层 API 的复杂度,让开发者能在移动端和桌面平台上构建视频特效、生成式 AI 等实时交互式 ML 体验。
Databricks 发文介绍 Lakebase 与 Agentic SDLC,提出用数据库分支支撑编码智能体工作流。其思路是让编码智能体像操作代码分支一样对数据库进行分支,从而在开发流程中隔离和并行推进变更。
SemiAnalysis 创始人兼 CEO @dylan522p 加入 Fireworks Forge 演讲嘉宾名单,主题为"从芯片到大模型的全栈 Tokenomics",聚焦大规模推理场景下 AI 基础设施各层的优化。活动将于 11 月 3 日在旧金山举行。
a16z 援引数据称,AI 智能体的 token 消耗量达到人类的近 5 倍,六个月内增长 14 倍。AWS CEO Matt Garman 表示,AWS 正为智能体这类新"用户"重构云服务,包括 3 秒启动数据库、按需创建后即可销毁的数据库,以及计算沙盒、网关和智能体权限等全新构建模块。
LangChain 联合 AWS 与 NVIDIA 举办活动,讨论团队如何应对生产级智能体系统背后的基础设施层。随着智能体工作负载增长、架构演进,基础设施需求愈发复杂,灵活性对全球团队尤为重要。活动报名通道已开放。
NVIDIA 给出 5 步流程,用前沿 AI 模型把 CAD 资产转成机器人仿真可用的 SimReady 资产。该流程基于 OpenUSD,需要配置并验证材质、碰撞几何、关节等物理属性,才能测试机器人行为。NVIDIA Omniverse 库遵循 SimReady Foundation 规范,并由智能体化的 NVIDIA 技能引导完成转换与验证。
DeepLearning.AI 与 Qdrant 合作推出由 Dylan Couzon 讲授的免费课程,教你构建一个无需网络连接、不依赖远程服务器的本地记忆助手,能记住你把钥匙放在哪里。
Inception AI 的 Mercury Decide 已在 OpenRouter 上线零数据留存(ZDR)端点,与免费端点并存。付费端点输入 $0.02/M(为 $0.04 标价的 50% 折扣),输出与缓存输入免费,上下文窗口 66K。该模型是 OpenRouter 上周增长最快的决策模型。
Stack Overflow 博客给出 LLM 生产系统成熟度模型 Level 5 的运维规范,核心是一个模型流量收口、一个贯穿全链路的 decision_id,以及不让业务感知具体供应商。
AWS CEO Matt Garman 表示正为 AI 智能体重构云服务,团队越来越需要"对智能体友好"而非仅面向人的云。AWS 已把数据库启动时间压缩到三秒,并新增计算沙箱、网关、智能体权限等全新构建模块。他指出许多智能体只需临时建库做少量工作,并不需要五个九的持久性。
OpenRouter 宣布 Sol Ultrafast 已在其平台上线。引用 OpenAI Developers 的信息,Ultrafast 今日起在 API、Codex 和 ChatGPT Work 中面向 GPT-6.1 Sol 推出,速度最高可达 Sol Standard 的 8 倍。
Google 提出 CI 内的程序修复智能体 FlowAgent,针对提交前测试失败运行 ReAct 式生成-验证循环,并在代码审查工具中展示修复建议,其前置与后置两道弃权过滤器会拦下薄弱建议。对 195 个真实故障的人工评审显示,67.18% 的修复正确。Google 全公司上线后,它在 295,508 次变更上给出建议,开发者预览 65,069 次、采纳 28,554 次。
Incarna 借助 Amazon Bedrock AgentCore payments,让 AI 智能体逐次向 BlockRun 支付模型推理费用,把接入 x402 支付的工作从数月缩短到数天,并已将端到端按次付费流程投入生产。
NVIDIA KGMON 团队在 KDD Cup 2026 Data Agents 竞赛中获得第二名,其系统核心思路是让智能体的 harness 更小、更清晰、更易于验证。该竞赛要求智能体针对数据库、CSV 和 JSON 文件、散文文档、PDF 及简报视频等异构数据源回答自然语言问题。
OpenAI Developers 宣布在 Codex 和 ChatGPT Work 中开放 GPT-6.1 Sol 超高速访问,Pro 500、符合条件的使用量计费 Enterprise 以及基于额度的 Edu 套餐可用。
Google 在 Cloud 活动上宣布将 Gemini 带入智能体阶段,推出统一智能体,既能回答问题也能代用户完成任务,初期面向企业、之后再向消费者开放。该智能体可接收目标而非指令,自行规划工作并调用自定义技能与工具;默认自动选择模型,用户也可手动切换,首批第三方模型为 Anthropic 的 Claude。
Google 把 Gemini 智能体先落到企业场景,文中给出的模型选择、系统连接与审计线索可供评估落地边界。
AWS CEO Matt Garman 表示不担心 AI 泡沫,理由是 AWS 产能采取多元化策略、没有单一客户占据主导,且企业客户已在当前能力与成本下看到正向 ROI。他透露 AWS 2026 年 CapEx 达 220 亿美元(原文为 $220B),已订购 200 万块 NVIDIA GPU,自研 AI 芯片卖到明年,并推出 30 秒开通、无需信用卡的 AWS 账户以便智能体快速启动。
Windsurf 在 X 上放出链接,指向 docs.devin.ai/work-with-devin 的试用入口,正文未披露更多功能、版本或参数细节。
Ori 借助自动切换低成本模型且保持质量,使成交周期从 71 天缩短至 47 天(快 34%),成交率提升 2.6 倍,且随时间推移成本持续下降。Ori 的 Slack 智能体即将向所有人开放。
GitHub 推出上下文感知的密钥检测分类器,可在 2 毫秒内检查候选密钥,有望让推送保护在密钥进入仓库历史前拦截的密钥数量翻倍以上。GitHub 称开发者和智能体的移动速度前所未有,密钥保护需要同步跟上。
a16z 指出 CFO 的角色已从会计师、银行家转向构建者,整个财务职能正围绕 AI 重建。财务人员熟练使用 Claude Code 或 Codex 自建工具,AI 原生工具几天内即可上线并自行拉取数据,把月度结账变成日度结账。最精简的财务团队占员工比例正从 5% 降至 2%,基于 tokens、API 调用量的收入也让规划从年度预算转向实时视图。
LlamaIndex 发布博客文章,介绍 Markdown 相关的新进展,原文链接为 llamaindex.ai/blog/markdown-。该推文未披露具体功能、版本号或技术细节,仅引导读者前往博客查看完整内容。
Perplexity 的 Decider V1.1 在 decisionbench.ai 上以 93.9% 准确率排名第一,同时成本最低,949 个共享文本案例中位延迟 534 ms、每 1k 次决策 $0.016。Rohan Goel 表示将把该模型用于自家产品场景。
Voice Arena 发布 Monsoon ASR 语料库,包含 10 万小时、50 种语言的数据,其中多为长尾语言,上线七天已有 80+ 机构申请授权。在 Bengali FLEURS 上,用 Monsoon 微调 Whisper Medium 将词错误率从 85.27% 降至 7.65%,并提供模型 API 供实验室在自有基准上测试。
Vercel 推出 skipMiddlewareRequestBody 配置项,可跳过将客户端请求体发送给 Routing Middleware,从而降低 middleware 调用带来的 Fast Origin Transfer 用量,并改善首字节时间,对请求体较大的请求效果明显。
微软推出新项目 Quicksand,这是一个捆绑 QEMU 的 Python 库,可用它运行 Alpine Linux 容器等环境。该项目已在 macOS、Windows 和 Linux 上试用。
Cohere 正在直播一场网络研讨会,讨论搜索与检索的未来,内容涉及 Embed 5、Parse 5 以及其新的检索方法论 RCP-nDCG。
serverlesshorrors.com 汇集了 Cloudflare、Vercel、Google、AWS 等云平台的 Serverless 被刷爆案例,近期多起都出在 Cloudflare 的 Durable Object 上。作者据此建议 Vibe Coding 时直接别用 Durable Object。
Cisco 总裁兼首席产品官 Jeetu Patel 在 YC 播客 Main Function 中表示,Cisco 正把自己定位为 AI 时代的"卖铲人",业务覆盖网络、安全、芯片和基础设施。其 AI 基础设施业务订单在两年内从 0 增长到 93 亿美元。他还谈到如何让 32000 名工程师拥抱 AI,以及 AI 数据中心建设是否存在过度投资。
Databricks 联合 Replit 与 Lakebase,为企业提供从开发到部署的完整平台,用于构建受治理的企业级应用。该组合打通开发与部署环节,让企业在受治理前提下完成应用落地。
在 InfoQ《极客有约》X QCon 直播中,快手鲜嘉麒与爱奇艺路香菊、阿里巴巴邹娟、生数科技郑重讨论 AIGC 内容生产为何难落地:竞争单位已从一个 clip 变成完整生产链路,用户追问人物一致性、商品变形、按时交付与成本可控。真实成本是生成、重试、审核、人工编辑等之和除以合格成片数。
Google Public Sector 与纽约州立大学(SUNY)在 Gemini at Work 上宣布合作推出 SUNY AI Platform,一个基于 Google Cloud 与 Gemini Enterprise 的安全 AI 和高性能计算环境,首批覆盖 SUNY 九所研究密集型校区。
铁锤人 @lxfater 用本地部署的千亿参数大模型写游戏代码,一天做出四驱兄弟风格的 3D 赛车游戏,内置 4 款赛车模型、5 种可搭配组件和 3 个赛道,还能放大招压扁对手。赛车模型由 Tripo3D 传入四张参考图生成,部件拆出后接入 Godot 做成可选配装备,玩法再由本地大模型串联。
LangChain 为 Deep Agents 重构 Skills 支持,新增三项能力:绑定到技能的工具只在 agent 读取该技能后加载;用户显式请求(如输入 /meeting-prep)时可将技能固定,在下一次模型调用前载入指令;长会话线程无需重启即可拾取新增或变更的技能。