Replit 上涌现大量 Astra 3D 实验作品
Replit 上出现了一批用 Astra 制作的 3D 实验作品,用户 sarah li 分享了自己在长周末用 Astra 搭建的可探索 3D 童年卧室。Amjad Masad 转发了这些创作并表示很喜欢。
Replit 上出现了一批用 Astra 制作的 3D 实验作品,用户 sarah li 分享了自己在长周末用 Astra 搭建的可探索 3D 童年卧室。Amjad Masad 转发了这些创作并表示很喜欢。
阿里云于 9 月 11 日升级 Token Plan 个人版,原有价格及 Credit 额度不变,Standard 和 Pro 套餐新增 Agent Harness 工具权益与用量,覆盖搜索、网页解析、图像生成、语音处理、代码执行等 12 项能力,均通过 MCP 标准协议开放,可直接接入自有 Agent 应用。
Junyang Lin 指出,给模型架构引入过多复杂度会造成评测无法测试的未知问题,内部评测同样覆盖不到。他认为在效率收益足够大时,人们有时可以接受这些小的未知成本,因为基础模型正越来越聚焦于所谓 agentic 任务。
Browser Use 云平台现可运行 DeepSeek V4.1 Flash,其性能达 GPT 5.6 Sol xhigh 的 97%、Claude Opus 5 的 95%,智能体成本低 30 倍。新用户可用 15 美元免费额度运行 100 个复杂网页智能体任务。
OpenAI 发布 ChatGPT for Financial Services,这是一套定制的 ChatGPT Work 体验,将内置金融数据与 GPT-6 Astra 的推理能力结合。团队可用于开展研究、构建金融模型并制作定制化客户材料。
Ollama 宣布 ChatGPT Desktop(Codex 应用)现在可以配置为使用 Ollama 模型。用户需下载或更新到 Ollama 0.34 即可开始使用。
Genspark 与 Fireworks AI 合作,其 AI 幻灯片(ai_slides)每天生成 12 万份,并用到 Fireworks AI 的训练平台。目前该功能定价仅为 Opus-5 的 1/17,用户可通过 genspark.ai/ai_slides 试用。
Cognition 发布 SWE-2,称这是其目前最接近前沿的模型,在主要评测上与近期前沿模型持平,成本最高降低 70%。该模型将强化学习扩展到数万亿参数规模,使用改进后的配方同时推进能力与成本两个维度。Fireworks 表示参与了其背后的基础设施栈,并链接了自家关于 RL 的博客文章。
Genspark 品牌负责人 Kim Vo 与 @filupmolina 正在直播对话,后者是走红的「AI Lemonade stand」项目创作者。直播主题是如何让 AI 智能体在真实世界完成各种出格任务,内容可在 YouTube 观看。
Cursor 项目内的 Agents 可共享记忆和生成的产物,包括计划与演示等文件。这些文件会在你的设备和 Agents 的电脑之间自动同步。
Cursor 发布 Projects,一种新的工作方式,不再为每个任务单独创建对话,而是在单一持久线程中与一个协调智能体协作。该智能体始终在线,可主动通过子智能体管理任务,并随时间改进。
OpenAI Developers 宣布 GPT-Live-1 已在 API 中可用,可把 ChatGPT 的自然双向对话能力接入应用,构建边听边说的语音智能体。该能力支持开发者自选模型与 harness。Greg Brockman 转发了这一消息,称其用于帮助开发者创造新类型的应用。
Cognition 发布 SWE-2 模型,称在主流评测上得分与近期前沿模型相当,成本最多降低 70%。该模型通过在数万亿参数规模上做强化学习训练,在能力与成本两端同时推动帕累托曲线。Devin 付费方案用户可在接下来一个月免费使用。
Google Sheets 现在可以把任意表格变成一个应用,表格本身就充当该应用的数据库,并且不只用来展示数据,也能录入新内容。使用步骤为点击右上角的 Gemini 图标,在设置中点击 Create canvas,然后描述你想要的应用即可完成。作者称这一能力可能取代数百家做类似工具的初创公司。
LangChain 分享的案例显示,Credit Genie 的编码智能体过去只能靠猜来理解代码库,如今改为直接查询 OpenWiki。这条内容聚焦企业在实践中如何采用和使用 OpenWiki。
Genspark 与 Fireworks 发布开源模型 Gen-1 Slides,在幻灯片生成任务上对标 Claude Opus 5,输入 token 价格约为后者的 1/17。该模型基于 MiniMax M3 通过 Fireworks Lab 的长时程 RL 后训练而来,已在 Genspark AI Slides 中作为默认模型上线。
Genspark 发布其首个面向知识工作的 AI 模型 Gen-1 Slides,基于开源权重基座并与 Fireworks AI 共同训练,现已驱动 Genspark AI Slides 的 Standard 模式。官方称其生成质量对标前沿模型,价格约为 Opus 5 的 1/17。
Genspark 祝贺 OpenAI 发布 GPT-Live,并称先跑了 80 通真实餐厅预订电话:任务完成率相比上一代翻倍以上,理解准确率 92%,打断处理更顺畅,轻声的 mm-hmm 不再打断它,句中插入新问题也能无停顿切换。
Dify 推出 New Agent,可将同一个 Agent 放进 Workflow,与数据库、自定义逻辑、API 和人工审核组合使用。Agent 负责需要判断的环节,Workflow 推动流程继续运转。用户可通过 cloud.dify.ai 试用。
Genspark 发布其首个面向知识工作的模型 Gen-1 Slides,由 Genspark 与 Fireworks AI 基于开源权重底座训练,现已驱动 Genspark AI Slides 的 Standard 模式。官方称其质量达到前沿水平,价格约为 Opus 5 的 1/17,完整说明见 Genspark 博客。
HeyGen 宣布开源实时 AI 体验框架,该框架与 OpenAI 合作构建,结合 GPT-Live-1、TryLiveAvatar 和 HyperFrames。代码已发布在 GitHub 的 heygen-com/liv 仓库,官方同时展示了多个演示。
Google AI Studio 上线了面向人类和智能体的完全集成文档体验,用户可直接在 AI Studio 内使用。Logan Kilpatrick 表示这一功能是他期待了 2.5 年的成果,也是进一步重构体验的第一步。
Genspark 发布其首个面向知识工作的模型 Gen-1 Slides,基于开源权重底座并与 FireworksAI 联合训练。该模型现已用于 Genspark AI Slides 的 Standard 模式,官方称其能在约 Opus 5 的 1/17 价格下生成前沿质量的幻灯片。
三个新 skills 可给任意应用加上语音能力:/add-dictation 说话即输入文字,/add-voice 与 Grok 实时对话,/add-read-aloud 把任意回复朗读出来。这些 skills 可从 marketplace 安装。
Browser Use 引用 Gregor Zunic 的评测称,DeepSeek V4.1 Flash 在 60 个高难度浏览器操作任务上处于帕累托前沿,性能接近 Sol 和 Opus 的同时,记录到的智能体成本低 50 倍。该评测还表示,跑完整个数据集的成本低于运行 Sol 的单个任务。
OpenAI 在 ChatGPT Work 中推出新的 Data agent,用户只需提问,就能把公司数据转成答案、交互式看板并采取行动。使用方式是先在 ChatGPT Work 中添加 Data Plugin,连接已有的数据源与上下文,然后开始对话。
Training Agents 4 将讨论重点从奖励函数转向环境。该系列内容由 Hugging Face 发布,附有 x.com 直播链接,具体细节未在正文中展开。
Bolt Slides 迎来重大更新,支持在画布上直接编辑幻灯片,一键重排、复制和删除页面,并可在演示时于幻灯片上绘制标注。新增演讲者备注演示视图,支持导出 PDF 或发布到真实 URL,现已上线 bolt.new。
Mem0 在 12 次默认流程测试中每次都能保存稳定偏好(如“I prefer dark mode”),但临时工作更新(如“the migration is blocked”)只保存了 2/12 次。同一阻塞信息改为结构化字段后,保存率达到 12/12。
智能体记忆的存储方式决定产品能可靠做什么。非结构化记忆捕获快,结构化记忆便于代码查询,最好的智能体会有意同时使用两者。
Linkloud 沙龙第44期将于9月19日在成都线下举办,主题为 Agent 如何从“能做”走向“能用”与“能卖”,聚焦 Agent 从 Demo 到 Production 的工程化落地、AI 应用海外 0 到 1 及 GEO 增长。
CCF 与快手联合发布第三期"CCF-快手大模型探索者基金"并启动申报,面向全球学者发布 5 个研究方向共 18 项研究课题,每项课题提供人民币 25 万元资助,申报截止时间为 2026 年 10 月 7 日 24:00(北京时间)。
超级小爱基于 Xiaomi MiMo 模型引入 RAG-Planning 并将推理从 think 模式切换为 no-think 模式,模型耗时平均下降约 35%,端到端最快快出 3 到 6 秒。全双工升级把拒识、判停和打断统一决策,配合三级 Session 压缩体系使上下文 Token 量下降 60%—86%,支持边听边说与随时插话。小米澎程 SkyNomad 已搭载专家版超级小爱。
阿里云开发者梳理了 Agent 自进化(Self-Evolution)的技术全景:进化对象既包括 Skill、Harness、Memory 等非参数化组件,也包括通过微调、强化学习、自蒸馏将经验内化为模型权重。
DeepSeek 正式发布 DeepSeek V4.1 Flash,这是其全新模型结构系列中最小尺寸的模型,具备原生多模态视觉理解能力。该模型为 552B 参数的 MoE 模型,采用 Causal-Encoder-Decoder 非对称结构,输入激活 8B、输出激活 16B,官方称其在基准测试中超越了包括 DeepSeek V4 Pro 在内的旗舰模型。
官方给出新模型的参数结构、KV Cache 压缩与定价变化,可据此判断 Agent 类任务的成本走向。
Browser Use 的云端服务已在 cloud.browser-use.com 上线。该消息由 Browser Use 官方账号发布,未披露模型版本、价格或功能细节。
Browser Use 与 Link 合作推出面向早期用户的支付方案:智能体发起付款请求后由用户确认,Link 随即生成一次性虚拟卡,全程三步即可接入。该功能让 AI 智能体在不直接接触用户真实卡号的情况下完成支付。
Browser Use 与 Stripe 合作,让智能体可以安全使用用户的信用卡。流程为智能体发起支付请求、用户批准后由 Link 发放一次性卡号,该卡在完成一次购买后即失效。
Browser Use 宣布 cloud.browser-use.com 正式上线。原文未披露该云端服务的具体功能、定价或可用范围等信息。
真格基金 Z News 回顾 8 月被投企业动态:月之暗面开源 2.8T 参数的 K3 成为仅次于 Fable 5 和 GPT5.6 的模型,也是目前参数最大的开源模型;赛博昆仑联合智谱 GLM 5.3 发现并报告三枚影响微软企业邮件与办公系统的重大漏洞。无问芯穹携手国家中试基地、广东联通发布新一代全栈国产 AI PC,潞晨科技单日最高 Token 提供量已接近万亿。