OpenAI Decisions API 的六类开发者用法
OpenAI Developers 披露开发者使用 Decisions API 的六类场景:将请求路由到合适的模型、工具或智能体,把规模化输入转成标签、排名与分数,分析图像、比较视觉内容或识别关键视频帧,根据截图选择按钮、填写表单或确定操作,标记有风险的工具调用或需深入审查的问题,以及对大规模数据集分类以发现趋势和模式。
OpenAI Developers 披露开发者使用 Decisions API 的六类场景:将请求路由到合适的模型、工具或智能体,把规模化输入转成标签、排名与分数,分析图像、比较视觉内容或识别关键视频帧,根据截图选择按钮、填写表单或确定操作,标记有风险的工具调用或需深入审查的问题,以及对大规模数据集分类以发现趋势和模式。
一款由 GPT-6 Luna 驱动的模型支持文本和图像输入,可输出三类结果:Predicates 评估陈述为真的概率,Choices 从预设选项中带置信度选择,Scores 将输入映射到数值区间。
Perplexity 联合创始人 Aravind Srinivas 表示,更新版开源权重多模态决策模型 pplx-decider-v1.1-27b 已上线,并在 Hugging Face 新的 Decision Index 0.3 基准上得分最高。该模型价格为此前 v1 的一半,为每百万输入 token 0.02 美元。相关权重可在 Hugging Face 空间获取。
Google DeepMind 发布 EmbeddingGemma 2,基于 Gemma 4 架构、740M 参数、Apache 2.0 许可,将文本、代码、图像、视频和音频映射到统一嵌入空间。
Justine Moore 实测了 Tavus 引发热议的新模型,认为其在实时交互视频上进步明显,全程无剪辑或加速,一些举止神态真实得令人意外。
Gemini Live 的 Guided Vision 功能已在 Android 9 及以上版本的设备上线,覆盖 Gemini Live 支持的地区和语言。用户需将 Gemini app 与 Android 系统软件更新至最新版本即可使用,官方博客还介绍了日常使用场景及该功能与无障碍社区合作开发的细节。
Google Gemini App 上线 Guided Vision 视觉辅助功能,可读取小字与复杂文本、寻找并定位物体、描述物体并比对细节、探索身边环境。该功能面向老年人、识字有限者或在弱光下阅读小字的人群,用于找物、备餐、挑选衣物等需要快速视觉帮助的日常场景。
Gemini Live 开启 Guided Vision 后,Gemini 会充当对话伙伴。当摄像头抬得太高、离得太近或偏离一侧时,Gemini 会用自然语言提示你缓慢右移、向下倾斜或后退,以获取清晰视觉上下文来回答你的问题。
Google 在 Gemini Live 中推出 Guided Vision,面向盲人和低视力群体提供对话式实时视觉辅助。用户可共享摄像头,获得动态音频描述和自然的语音重构提示,以探索周围环境。该功能由 Google Gemini 与盲人和低视力社区共同打造。
Google 发布 EmbeddingGemma 2,这是其首个原生多模态嵌入模型,基于 Gemma 4 构建,采用 Apache 2.0 许可。它可将 100 多种语言以及代码、图像、音频和视频嵌入同一个向量,上下文长度 8,192,提供 740M omni、440M text+vision、570M text+audio 和 270M text-only 四种规格。
论文 OmniReasoning 提出突破音视频联合推理极限的方法,论文页面已发布在 Hugging Face。该推文获得 65 个点赞、11 条回复和 8 次转发。
Google 与 Northwestern、Jacaranda Health 合作,在肯尼亚内罗毕和芝加哥各纳入 1000 名孕妇,用机器学习模型分析未经超声培训的卫生员按预设路径完成的"盲扫"超声视频,估测妊娠龄和胎位,准确度与受训超声医师相当。卫生员仅需 8 小时即可学会操作,且全部处理在设备端完成,无需供电或 Wi-Fi,可在资源匮乏地区提供产前关键信息。
Mistral 发布 Mistral Large 4(Le Chonk),1T 参数、原生多模态、49B 激活参数,官方称其是欧美聚合基准上最好的开放权重模型,在视觉 grounding 上超过闭源前沿模型。
Google 发布新一代图像生成和编辑模型 Nano Banana 2.1,从今天起陆续上线 Gemini App、Google 搜索 AI 模式、AI Studio、Flow、Stitch、Google Ads 和 Gemini 企业平台。
有人向 cookbook 新增了五款应用,全部基于新的 SpaceXAI TypeScript SDK 构建。这五款应用分别实现:premise 转短片、图片转视频广告、截图转 React 组件、𝕏 帖子转情绪看板、链接转播客,demo 与代码均已放出。
Nano Banana 2.1(gemini-nano-banana-2.1)已上线,价格从上一代 Pro 模型的每张 0.134 美元降至 0.034 美元。
Google DeepMind 发布 EmbeddingGemma 2,参数量 740M,在多项基准上具有竞争力,甚至超过部分参数量两倍以上的专用模型。开发者可用它为应用加入多模态搜索,例如用语音备忘录在视频中定位片段,也可与 Gemma 4 搭配实现私密的端侧 RAG。该模型以 Apache 2.0 许可发布,权重已在 Hugging Face 和 Kaggle 上线。
Google DeepMind 发布 EmbeddingGemma 2,称这是其首个原生多模态的端侧嵌入开源模型。该模型在文本之外统一了代码、图像、音频和视频,把它们映射到同一个共享空间。
Google Flow Music 的 Spaces 功能现支持将自然语言定制的乐器或效果导出为 VST3/AU 插件,直接在自己的 DAW 中运行,无需编程经验。制作人 Khris Riddick-Tynes 借此做出了插件 "No Chaser",可让不同环境下录制的器乐与人声保持录音室级清晰度。
Google DeepMind 发布 EmbeddingGemma 2,一个将文本、代码、图像、视频和音频映射到统一嵌入空间的轻量多模态嵌入模型,基于 Gemma 4 架构、Apache 2.0 许可,参数量 7.4 亿。
Simon Willison 让 Opus 5.5「写一些电脑游戏音乐」,结果远超预期,他因此发问模型是从什么时候开始能创作出像样的音乐。这条帖子获得 133 条回复、310 个点赞和 38064 次浏览。
Mistral 发布 Mistral Large 4(代号 Le Chonk),1T 参数、原生多模态、49B 激活参数,官方称其是美国或欧洲聚合基准上最好的开源权重模型。
Kling AI 展示创作者使用 Kling 4.0 和 Kling 4.0 Flash 制作的作品,主打新想象、新故事与新创作方式。官方同步放出演示视频,并附上 X(Twitter)原帖链接。
Mistral AI 发布 Mistral Large 4(代号 Le Chonk),1T 参数、原生多模态,49B 激活。官方称其在美国或欧洲开源权重模型中聚合基准表现最佳,在网络安全、制造和金融等关键负载上达到 SOTA,并在视觉 grounding 上超过闭源前沿模型。该模型由欧洲端到端打造,可通过 Mistral Cloud 部署,即日起开放 API,开放权重版本将于 10 月底发布。
Mistral AI 发布 Mistral Large 4(代号 Le Chonk),1T 参数、原生多模态、49B 激活,号称是美欧聚合基准上最好的开放权重模型。该模型在网络防御、制造和金融等关键负载达到 SOTA,视觉 grounding 超过闭源前沿模型,端到端在欧洲锻造并可通过 Mistral Cloud 从欧洲部署,今日起 API 全面可用,开放权重将于十月底发布。
Mistral Large 4 以 1T 参数、49B 激活的开放权重形态发布,可对照其与闭源前沿模型的基准位置。
Mistral AI 发布 Mistral Large 4(代号 Le Chonk),1T 参数、49B 激活、原生多模态。官方称其在聚合基准上是美国或欧洲最好的开放权重模型,在网络防御、制造和金融等关键负载上达到 SOTA,视觉接地表现超过闭源前沿模型。
Mistral Large 4 的参数规模、多模态能力与开放权重时间表一并给出,可据此判断欧洲开源模型的竞争位置。
Mistral Large 4 已在 OpenRouter 上线公开预览,参数量 1T、激活 49B,原生多模态,支持 1M 上下文与最高 256K 输出。前两周价格五折,每 1M tokens 输入 $0.68、输出 $2.09,缓存 $0.07。
Mistral AI 的 Mistral Large 4(代号 Le Chonk)已上线 Arena,可在 Agent Arena 中实测,投票将影响其评估,分数稍后公布。
Mistral AI 发布 Mistral Large 4(代号 Le Chonk),1T 参数、原生多模态,激活参数 49B。官方称其在聚合基准上是美国或欧洲最好的开放权重模型,在视觉定位上超过闭源前沿模型,并在网络防御、制造和金融等关键负载上达到 SOTA。该模型已在 Mistral Cloud 上端到端于欧洲构建并可部署,即日起通过 API 向所有用户开放,开放权重计划于 10 月底发布。
Mistral Large 4 已在 OpenRouter 开启公测,采用 1T 参数(激活 49B),原生多模态,支持 512K 上下文与最高 256K 输出。前两周五折,价格为每 1M tokens 输入 $0.68、输出 $2.09,缓存输入 $0.07。
Mistral AI 发布 Mistral Large 4(代号 Le Chonk),1T 参数、原生多模态,49B 激活,官方称其在美国或欧洲的开放权重模型中聚合基准表现最好,并在网络防御、制造和金融等关键负载上达到 SOTA,视觉 grounding 超过闭源前沿模型。
Theo Triantafyllidis 获得 2026 Frieze 伦敦艺术家奖,将在 Frieze London 展出可攀爬的巨型蜘蛛雕塑与多人游戏《Feral Metaverse (Spider), 2026》。
Mistral AI 发布 Mistral Large 4(代号 Le Chonk),1T 参数、原生多模态、49B 激活参数,在自有算力上训练和推理。官方称其在聚合基准上是美国或欧洲最好的开放权重模型,在网络安全、制造和金融等关键负载上达到 SOTA,视觉 grounding 超过闭源前沿模型;由欧洲端到端打造,可通过自有 Mistral Cloud 从欧洲部署。
Mistral 联合创始人披露 Large 4 的参数量、多模态与自有算力训练细节,可据此判断欧洲开源模型的量级位置。
Mistral AI 发布 Mistral Large 4(代号 Le Chonk),1T 参数、原生多模态、49B 激活参数,称其是美欧范围内聚合基准上最好的开源权重模型。该模型在网络安全、制造和金融等关键负载上达到 SOTA,并在视觉定位上超过闭源前沿模型;今日起通过 API 提供,开源权重将于 10 月底发布,并可通过其自有 Mistral Cloud 基础设施在欧洲部署。
Mistral 官方给出新模型的参数规模、能力定位与开放节奏,可据此判断欧洲开源权重模型当前的位置。
给 Opus 5.5 一个 Airbnb 房源信息后,它抓取照片并用 Seedance 2.5 生成 UGC 视频,配音由 ElevenLabs 完成。历史素材从网上下载后用 Topaz 放大。发布者表示对结果印象深刻。
开源工具 RemoveMacAI 面向 Apple Silicon Mac,通过系统配置描述文件关闭 macOS 27 的 Apple Intelligence 并调用苹果资源管理服务删除已下载的基础模型、图像生成等模型文件,作者称无需关闭 SIP,已测试 macOS 27.0。具体回收空间取决于设备上已有的模型,删除后统计可能延迟更新,且关闭开关并不必然释放空间。
Mistral Large 4 已在 AI Gateway 上线,该开源权重模型原生支持多模态,将推理与文本、图像理解结合,适用于网络防御、制造和金融工作流。
Manus Video Editor 支持将一条视频适配成 8 种不同语言,还能直接从 Figma 与代码仓库生成产品发布视频。它也可把数小时素材剪辑成成片,并为产品批量制作 UGC 广告合集。
a16z 发布第七版 Top 100 消费级 AI 应用榜单,首次加入收入排行榜,并保留网页与移动端流量排名。ChatGPT 仍居第一,移动端月活超 1B;Claude 升至网页端第 3,月访问量近 1B。
LlamaIndex 开源负责人 Logan Markewich 撰文讨论从传统 OCR 向 agentic OCR 的转变:传统 OCR 单次扫描直接输出文本,表格被压平、图表消失、多栏排版错乱,且无人校验结果。