Fireworks AI 发布 RL 训练 cookbook,联合 HUD 免自建基础设施微调模型
Fireworks AI 推出新 cookbook,让开发者无需自建基础设施即可在自有任务上做 RL 训练。流程为在 HUD 中定义任务与 grader,再在 Fireworks 上采样并训练模型,同一环境同时用于训练和评估。配套文档已上线 docs.fireworks.ai。
Fireworks AI 推出新 cookbook,让开发者无需自建基础设施即可在自有任务上做 RL 训练。流程为在 HUD 中定义任务与 grader,再在 Fireworks 上采样并训练模型,同一环境同时用于训练和评估。配套文档已上线 docs.fireworks.ai。
开发者可在 X 平台上用 Grok Bot 快速构建应用,并可前往 developer.x.com/exhibit 获取灵感。该 Bot 能推荐项目创意、协助构建与测试,还能部署项目供他人使用。
Thomas Wolf 把自己的 Open Alignment 脑暴 Google Doc 交给 Opus 5.5,要求生成一段视频,结果令他意外,直言"这份文档刚才还是一份干巴巴的 Google Doc"。他随后表示希望自己写过的每一份文档都能这样生成视频。
Vercel 的 skills.sh 注册表在 7 个月内达到 100 万个 agent skills、近 2.8 亿次安装。Guillermo Rauch 称其从想法到首次发布,再到 npx skills 出现在互联网各处 README 中,并评论说过去写代码、现在写英文。Vercel 还发布了关于 skills 现状与去向的博客文章。
Replit 收购数据探索与可视化工具 Atta,Atta 的图表和报告功能现已上线 Replit。Atta 创始人 abk 表示,其 Fastview canvas POC 最初就是在 Replit 上写下的第一行代码,公司由他与 @omarshaik 共同创办。
Replit 提出数据分析正在成为工作流程中的常规环节,一次调查可以沉淀为可复用的日常例程,结论还能直接生成面向管理层汇报的幻灯片,或用于判断下一步该构建什么。
Vapi 是构建和部署语音 AI 智能体的平台,目前每年为 Amazon、Uber、Intuit 等公司处理约 10 亿通电话,用 AI 自动完成电话沟通。两位联合创始人 Jordan Dearsley 和 Nikhil 在 Founder Firesides 中回顾了十余次转型的历程:从日历应用、AI 笔记工具,到一款最终成为 Vapi 基础的 AI 心理治疗师。
LlamaIndex 用 LlamaParse 解析美联储 2026 年 9 月经济预测表格第 2 页,与原始 PDF 比对,展示的 9 个 GDP 中位数数字全部匹配,且返回的 HTML 中数据保持对齐。该表格包含 2029 年列,但 6 月对比行对应单元格为空,空白单元格是文档解析器常见却不易察觉的失败点。LlamaParse 可用于这类表头和缺失单元格都关键的表格。
在社群 tokenrank 榜单代码里,一句提示词让 Opus 5.5 结合榜单各维度数据和参与者,自主完成一条面向已付费用户的爆款视频,视频全部由它自己完成,一把出。
微软发布新版 Copilot,Satya Nadella 称其动机是智能正快速加速,需要把智能扩散到各处。Jacob Andreou 的相关内容以 Home、Code、Autopilot 三个方向呈现。
Viking 分享了 OpenClaw 自己使用的 test audit 技能(github.com/openclaw/openc…),其任务是告诉 agent 什么测试应该加、什么测试是垃圾不应该加,开始写测试时 agent 要先回答四个关于是否有必要加测试的问题,判断通过才加。
微软发布 Copilot 迄今最大更新,将其定位为覆盖所有模型、形态与任务的工作操作系统,并把四项能力整合到一起:面向企业的主动式长时运行智能体 Autopilot、可在公司租户内构建应用的 Code、将 Chat 与 Cowork 合并的 Home,以及深度嵌入 Copilot 的 Office。
微软把 Copilot 定位为覆盖全模型全场景的工作操作系统,本次更新给出四条产品线并说明企业级智能体的落地方式。
群友"神的孩子在跳舞"用 Opus 5.5 为 Mole 官网做了动态化改造,把原本静态页面的理念动态呈现出来,效果被评价为高级了不少。原帖附带一段演示视频,在 Twitter 上获得 90 个点赞、13 条回复和 28556 次浏览。
千问AI平台在云栖大会发布面向Agent的全新服务方式,通过Skills、CLI和云上部署把专业操作组织成Agent可理解和执行的工作流程,并上线技能市场、MCP商店、QwenCloud APP。
GPT 6 Astra 与 Anthropic 的 Opus 5.5 接连发布,Jev 结构化模型走红并瞄准 Computer Use 场景,Coding Agent 工作流随之升级。
Stack Overflow 播客对话 BrowserStack 开发者关系与开源负责人 David Burns,讨论 AI 时代职业怀疑精神的价值,以及如何把测试驱动开发用于智能体工程。Burns 认为,修复 flaky test 的关键在于管理应用状态。
Viking 引述 Peter Steinberger 的说法称,OpenClaw 删掉了约 40 万行自己的测试代码,代码覆盖率几乎没有变化,原因是现在的模型特别爱写没用的单元测试,为测试而测试,写十个 case 去判断常量里的字符串。作者还提到,如果只跟 Agent 说清理一下,它会很早就停下来不改,需要给它更狠的目标,例如删掉最没用的 20% 测试、同时把覆盖率波动控制在 2% 以内。
Vercel 基于 skills.sh 注册表的聚合数据发布报告,该注册表在七个月内积累 100 万个 agent skills,记录近 2.8 亿次安装。分类样本显示供给偏技术,超过一半的条目集中在软件工程、agent 工作流、数据、基础设施或安全;需求更分散,软件工程占安装量 18%,agent 工作流 15%,业务运营和写作各近 11%。
Meta 宣布向开发者开放个人 AI 智能体 Muse,并推出 Connector 机制,允许开发者把外部服务接入,由 Muse 在对话中按需调用。深思圈结合 Greg Isenberg 的分析,将这一步类比 2008 年 App Store 开放,并梳理了本地商业获客、上门维修调度、运动场地匹配、家庭晚餐规划四个创业方向。
Opus 5.5 被指能用一句话直接生成产品宣传片,且以纯代码方式完成视频制作,效果超过此前供应商报价上万的方案。叠加 computer use 能力后,它还能用画笔画肖像。有观点认为,这让许多视频 Skill/Agent 失去存在必要。
Fish Audio 开放 Drama 3(预览版)供开发者接入,调用时将模型路由至 “drama-3-preview” 即可开始构建。相关文档已上线 docs.fish.audio API 参考页。
一段用浏览器画 dario 的对比视频显示,Claude Opus 5.5 在其中的表现被 indigo 形容为"开悟了",并称这是 ego 的宣传视频,但对比效果"太残酷"。该推文被 orange.ai 转发,附带的视频在浏览器端无法播放。
LlamaIndex 等 5 家联合主办方将在旧金山 Techweek 举办智能体主题社交活动,面向 agent 产品、基础设施与开发工具领域的 300+ 创始人、创始运营者与投资人,提供 3 万美元用于对接客户、投资人、合伙人或招聘。活动由 SpaceXAI、MongoDB、daytonaio 与 arceuslegal 支持,需联系联合主办方获取邀请。
Querit 为 Dify 上线 Querit Monitors,可在 Dify 工作流内设置周期性搜索、捕获新结果并追踪内容变化,让竞品动态、行业新闻与市场趋势持续更新。该功能面向竞品追踪与新闻研究等场景,让智能体在后台持续监测。
Simon Willison 认为,coding agent 虽然能做出惊人的事,但要释放其全部潜力需要极高的纪律性和知识储备,因此软件工程反而变得更难。Gergely Orosz 回应称,自 Opus 4.6 和 GPT-5.2 及其配套 harness 出现后,这些工具写代码的能力已接近甚至超过自己最擅长的语言,但他认为非开发者短期内——甚至可能永远——不会直接推送生产代码。
百度AI借中秋节点展示三款产品:百度伐谋与南京林业大学推出全国首个"AI+松材线虫病早期防治一体化平台",相关技术已在江苏、辽宁、安徽等省份规模化应用,累计推广面积超200万亩,节约防治成本约7亿元。
jina-ocr-v1 现已在 Elastic Inference Service 上线,单模型完成版式感知文档解析,支持表格、数学公式、手写体和 100+ 语言,总参数 3.4B、推理仅激活 570M,olmOCR-bench 得分 83.4、OmniDocBench 得分 91.14。
Pika API 现已支持接入 Grok Bots,使其能通过一个 API key 调用 Seedance 2.5、Wan 3.0、GPT-image-2 等 120+ 模型生成图像、视频和音频。该消息由 Pika 官方账号发布。
LlamaIndex 发布博客,讨论置信度分数在文档抽取中的实际价值——关键在于能否用它控制自动化与人工审核的比例。借助 ExtractBench 对比多种抽取系统,在 97% 精度目标下,LlamaParse Agentic Plus 过滤后对期望字段的召回率为 66.48%。文中还涉及置信度阈值、精度与召回、分数覆盖率与粒度、人工审核量等维度。
SonarSource CEO Tariq Shaukat 确认在 AI Engineer New York 演讲,主题为“The Machine that Changed the World, vAI”,提出面向智能体软件工厂的验证优先框架,目标是在快速交付的同时不牺牲信任。活动时间为 10 月 12 日至 14 日。
PureblueAI 创始人鲁扬提出 GEO 与 SEO 是两个物种:SEO 有规则可循,GEO 是黑盒,只能用一个模型去学习另一个模型。他把 GEO 拆成漏斗与因子挖掘,类比量化交易,主张研究 AI 可解释性而非文章写法。他还提出 prompt 就是 AI 时代的货架,豆包偏爱抖音视频、海外模型偏爱官网与 Reddit,酒旅品类已按 8 到 12 个点抽佣。
Nous Portal 订阅用户在 Hermes Agent 中已默认启用 Perplexity Fast Search。该搜索面向智能体任务,单次搜索调用延迟为 p50 160 ms、p95 230 ms。
小米发布一款基于 Qwen-9B 的 9B 模型,采用 MIT 许可,支持图像与文本多模态输入,面向编码和智能体任务。该模型可在 8GB 内存设备上运行,适合在笔记本等统一内存设备上本地离线使用。
JPMorgan 全球首席安全架构师 Michael A. Davis 将在 AI Engineer New York 发表演讲“Intent Based Auth”,探讨为何治理 AI 智能体不能只靠允许或拒绝的工具权限,而需依据其试图完成的任务来评估其行为。会议将于 10 月 12–14 日举行。
LlamaIndex 研究团队发布博客,讨论校准置信度分数对文档抽取和智能体决策的价值:设定置信度阈值后可自动接受高于阈值的取值、对低于阈值的做人工复核,阈值越高可保证的精度越高,例如置信度 0.7 对应 95% 精度、0.9 对应 98% 精度,代价是更多假阴性需要人工审核。
Perplexity Computer 通过接入 DocSend connector 成为安全、智能的 Deal Room,该 connector 现已面向所有用户上线。其中一个用例是让 Computer 根据 deal room 材料的最新状态维护一份动态投资论点(living thesis)。
Ramp 应用科学总监 Ryan Stevens 将在 10 月 12–14 日的 AI Engineer New York 上做题为“We gave our finance agent more context. It got worse”的分享。
Replit 在 Meta Connect 上宣布,用户只需描述应用需求,Replit 就能为 @Meta 设备构建出 VR 应用。开发者现已可通过 replit.com/partners/meta 开始构建。
Perplexity 在 Search API 中推出 Fast Search,运行在自研的 Rust 检索与排序服务 Photon 上。官方称 95% 的搜索结果在 230ms 或更短时间内返回,p95 延迟低于 250ms,同时在相关性与准确性基准上保持较高排名。Photon 由一个小型工程团队配合数百个智能体构建,作者称后续将用自动研究循环持续在帕累托前沿上优化搜索基础设施。
Perplexity 的 Windows 便携计算机(Perplexity Computer)现已支持 AMD Ryzen AI Max 系列处理器,正式加入 Perplexity Computer 本地 AI 生态。该设备可在端侧运行本地 AI 智能体,与已连接的应用和本地文件协同,并支持发起任务或安排周期性工作,全部在设备本地完成。