LangSmith Engine v2 发布,新增红队测试与修复预验证
LangChain 发布 LangSmith Engine v2,新增 Red Teaming 主动排查工具,通过分析智能体的生产 traces 和仓库来测试幻觉、违反 system prompt 等尚未在生产暴露的问题,目前向现有 LangSmith Deployment 用户开放 Private Beta。
LangChain 发布 LangSmith Engine v2,新增 Red Teaming 主动排查工具,通过分析智能体的生产 traces 和仓库来测试幻觉、违反 system prompt 等尚未在生产暴露的问题,目前向现有 LangSmith Deployment 用户开放 Private Beta。
在 WeAreDevelopers North America 主题演讲中,Docker 总裁 Mark Cavage 发布面向 AI 智能体的 Docker Sandboxes,为每个智能体提供独立隔离的 microVM 与内核,并通过独立 CLI 免费提供。
Grafana Labs 把可靠性工程中的错误预算(error budget)用于 AI 智能体质量,通过 evaluations 让模型裁判对 groundedness、fulfillment、toxicity、latency、cost 等行为分别打分,再把分数变成带目标的 SLO,例如设定 30 天内 95% 的对话被判定为 fulfilled。
Seedance 2.5 支持上传参考视频与新角色图片来替换画面中的人物,只需替换一位表演者并保留其余人物的动作、表情与镜头信息。部分参考视频会被拒绝,可先用 Codex 模糊人脸后重新提交,且最好每次只处理两个角色。作者用它把《The Office》剧集里的演员依次换成 Dario、Jensen 和 Sam。
Bridgewater 应用 AI 团队负责人 Sam Green 将在 AI Engineer New York 带来演讲“Vault: When Fifty Years of Structured Data Isn't Enough”,介绍 Bridgewater 如何构建共享非结构化数据平台,为投资研究与生产环境中的 AI 智能体提供支撑。会议于 10 月 12–14 日举行。
Pika 展示 Vuvie Series 的又一个示例:由 Michael Vu 执导的动作冒险剧集第 1 集,使用 Seedance 2.5 在 Pika API 上生成。更多内容可在 vuvie.io 观看。
Meta AI 为执行任务的主智能体配备专用记忆智能体,以缓解长上下文导致的早期错误遗忘。记忆智能体记录工具使用与历史错误的结构化笔记,仅在关键时刻注入简短提醒,将 Claude Sonnet 4.5 的基准成绩从 37.6% 提升至 45.9%。
GitHub 演示了一个 Copilot 应用自动化流程,可对打开的 Dependabot pull requests 做首轮审查,按风险分组、核验 CI 状态并给出简短摘要。用户用自然语言编写指令,按团队工作方式定制流程,并可安排在工作日开始前运行,登录时即可看到结果。
Perplexity 在 Windows 版应用中上线 Portable Computer,面向所有 Consumer 和 Enterprise 的 Pro 与 Max 订阅用户开放。用户可通过 perplexity.ai/hub/products/p 入口开始使用。
Perplexity 的 Portable Computer 可跨 Slack、Gmail、Google Drive 等已连接应用及设备本地文件执行任务。该功能完全在本地运行,文件、数据和答案均留在设备上,且不消耗 Computer credits。
Portable Computer for Windows 现已在 AMD Ryzen AI Max 系列处理器上可用,可本地运行 AI 智能体,与已连接应用和本地文件协同工作。用户可发起任务或安排定时工作在设备上完全本地执行。
Contra 面向用 Lovable 开发的自由职业者和机构推出活动,提供免费 Lovable Pro 和 2.5 万美元奖池。参赛者需构建一个假设性的预约制业务,第一名奖金 8000 美元,共 10 名获奖者。
Docker 在 WeAreDevelopers 上发布 Docker Sandbox Kit Spec,以 Apache 2.0 开源,并把它交给 CNCF 中立治理。
Docker 发布 Sandbox Kit 规范 v3,采用 Apache 2.0 开源在 docker/sandbox-kit-spec 仓库。
Docker 发布 Cloud Sandboxes,将原有的 microVM 沙盒放到 Docker 托管算力上运行,本地与云端共用同一套隔离模型和 CLI,可用 `sbx move my-project --to cloud` 双向迁移。
Firecrawl 在 Claude 中推出 Alexandria,可通过其连接接入 100 多个数据提供商和 1.13 亿以上索引源。使用 Alexandria 的智能体答案质量得分比使用内置网络工具的高出 21%。用户现可通过 Firecrawl connector 开始使用。
LangSmith 上线 Trajectories,把一条 thread 内主智能体与子智能体的消息、工具调用按首次出现顺序聚合,去掉嵌套 run 结构,让长会话以对话路径形式可读。
Replit 宣布 Muse 现在可以在 Replit 里开发应用。Muse 此前的能力范围原文未作说明,官方仅给出这一句更新并附上引用推文链接。
Gemini 3.8 TTS 支持复刻用户本人声音,或通过提示词设计完全自定义的音色。流程为录制 20 秒说话音频加同意语句、通过 API 调用创建声音、再在任意请求中使用,风格参数放在 speech_metadata 中。
Latent.Space 发布对话 TypeSafe CEO @CompleteSkeptic 的播客,其打造的产品 Jev 被明确不称作「Decision Model」。他解释 AI 能解决极难问题却仍无法自动化基础工作,Jev 面向软件内的可靠决策而非聊天,TypeSafe 拒绝公开 benchmark 和 API 层的拒绝机制,并称即便有 10 亿美元也不会从头预训练模型。
Muse 现在可以在 Replit 中制作 App。该消息由 Replit 发布,附带的数据显示获得 395 个点赞、27 次转发、30 条回复和 23843 次浏览。
Antigravity SDK 现已支持用 Gemma 4 和 LiteRT 在本地执行,可在本地机器上完整运行智能体,特点是零 token 成本、数据隐私和离线可靠性。该版本还支持 OpenAI 兼容端点,可用 Ollama、llama.cpp、vLLM 等来部署 Gemma,安装命令为 pip install google-antigravity litert-lm。
Anton Osika 在播客录制中与 @siliconvalleymm 用 Lovable 搭建了一套业务工具:重做旧网站、上线品牌合作开放表单,并用 AI 按相关度给所有投稿排序的收件箱。新站点还做了 SEO 与 AI 搜索优化,便于 Google 和 AI 智能体发现;团队会在每次投稿时收到邮件通知,Lovable 还提交了一条假投稿做端到端测试,并完成深度安全扫描。
Muse 现在可以在 Replit 上构建应用。该消息由 Amjad Masad 发布,未披露模型版本、参数规模或可用范围等细节。
网易智企副总经理段毓铮在2026网易未来大会演讲中提出,企业落地AI不应以员工提效为首要目标,而应先找准经营痛点,看收入、成本、新品研发周期等指标是否改善。网易智企已推出企业级AI Agent平台"帝王蟹",并在餐饮供应链、潮玩、充电桩等客户业务中探索全链路AI落地,其中充电桩运营商可借助AI将定价决策从每周一次提升至每天甚至小时级。
GPT 6 被低估的地方在于 Computer Use——它能像人一样操作电脑,视频认为这就是普通人可用的 AGI。节目同时提到开源的果蝇神经元,并质疑硅谷热炒的 Jev:在智能与功耗的对比上,Jev 还不如一只果蝇。Grok Bot 则选择给 AI 配一台云电脑。
硅谷101年度科技大会 Alignment 2026 将于 10 月 10 日-11 日在硅谷举办,为期两天并已开放早鸟票。
Meta 的 Muse 团队公开了 Personal Agent 的产品设计与安全架构复盘,扎克伯格也在播客中谈到自己如何使用 Muse。Muse 采用持续长对话界面,跨对话保留记忆,具备文件系统、终端与完整浏览器,可后台持续推进任务,只在出现有意义进展或需要用户参与时通知。
高通在2026骁龙峰会上发布第六代骁龙8超级至尊版和第六代骁龙8至尊版,首次将2nm工艺用于旗舰移动平台,两者搭载最高5GHz的Oryon CPU和重新设计的Hexagon NPU,超级至尊版还在Adreno GPU中首次加入Matrix Cores并支持8K/60fps视频拍摄。
阿里云百炼上线 Qwen-Audio-3.1 系列语音模型,覆盖录音转写、流式识别、语音合成与实时语音交互,其中 TTS-Next 可在一次生成中组合人声、音效与环境声,播客单次最长 4 分钟。
Altimeter Capital 创始人兼 CEO Brad Gerstner 在 All-In Summit 上判断,目前还不是 2000 年式 AI 泡沫:英伟达收入一年约翻一倍,半导体公司贡献了纳斯达克约 70% 的回报,头部 AI 实验室合计年化收入约 1000 亿美元,但需要冲到 1800 亿美元才能跟上资本开支。
在云栖大会阿里巴巴 AI Native 研发实践论坛上,阿里、蚂蚁、飞猪等团队披露:编码仅占软件交付总时长 20%—30%,极端链路中编码不足 1%、约 1 小时,但需求到交付仍需约 21 天,时间耗在影响分析、环境准备、联调、审批、灰度和封网等环节。
Douchat 接入 Jev,把群聊里的多个 Agent 从"轮流回复消息"改为"围绕一个任务协作",由 Jev 做结构化判断、LLM 负责规划和执行、程序负责调度与状态记录。
Dify 在 IF Con Tokyo 2026 主题演讲中发布两项新产品:tokener.ai 提供覆盖所有模型的单一端点,免去切换账号、密钥和计费;Dify Knowledge Base 2.0 则对 Dify 使用最多的功能从零重构,消除文档与智能体之间的转移。
Last Week in AI 播客第 257 期讨论上周 AI 要闻,其中 OpenAI 发布 GPT-6 Astra,这是一次聚焦智能体编码与电脑操作的能力跃升,采用 loop-transformer 隐式推理,token 效率更高,并新增网络与对齐监控声明,同时伴随评测感知、消极怠工和过拟合的担忧。
阿里云在云栖大会发布磐久AL64分布式SNPO光互连超节点,将光互连推进到XPU附近,其SNPO支持3.2T、6.4T,带宽密度比现有OIF规范提升约25%。曦智科技同期首次展示面向XPU Scale-Up的SNPO产品——3.2T/6.4T收发一体硅光芯片。据美银估算,AI光连接市场将从2025年约140亿美元增长到2030年约730亿美元。
小米公开 MiMo-V3 的核心架构 HySparse2,面向长程多轮 Agent,引入两级 KV 共享(KV Bridging 与 KV Reuse)、token 级稀疏选择,并强制保留最近 128 个 token、从窗口外选择 1,024 个全局 token。
腾讯元宝最近上线专家模式,用户输入“帮我做旅游规划/三日游/行程安排”等关键词即可触发。该模式下交通、天气、景区、酒店信息全部来自第三方数据并支持实时联网搜索,景区卡片标注免费或门票价格,可直接跳转同程微信小程序购买。方案含真实地图轨迹、支持多轮修改和手机电脑分享,元宝同期还上线了购物功能。
开源库 OpenSEO 近日获得大量推荐,GitHub stars 已达 2 万,并对 agent 友好,号称可替代 Semrush 和 Ahrefs。发帖者询问实际用过的用户:效果真的不错,还是只是 hype?
视频克隆 skill 的地址已公布为 colaskill.com/zh/listenhub-h…。该 skill 由 xgo.ing 提供支持,原文未披露模型、参数或可用性等更多细节。