Elastic DevRel 9 月通讯:jina-ocr-v1 上线、Elastic CLI 技术预览
jina-ocr-v1 现已在 Elastic Inference Service 上线,单模型完成版式感知文档解析,支持表格、数学公式、手写体和 100+ 语言,总参数 3.4B、推理仅激活 570M,olmOCR-bench 得分 83.4、OmniDocBench 得分 91.14。
jina-ocr-v1 现已在 Elastic Inference Service 上线,单模型完成版式感知文档解析,支持表格、数学公式、手写体和 100+ 语言,总参数 3.4B、推理仅激活 570M,olmOCR-bench 得分 83.4、OmniDocBench 得分 91.14。
Vercel AI Gateway 近两个月数据显示,Anthropic 支出占比从 69% 降至 40%,OpenAI 从 10% 升至 24%,并在 token 数量上领先。
GPT 6 被低估的地方在于 Computer Use——它能像人一样操作电脑,视频认为这就是普通人可用的 AGI。节目同时提到开源的果蝇神经元,并质疑硅谷热炒的 Jev:在智能与功耗的对比上,Jev 还不如一只果蝇。Grok Bot 则选择给 AI 配一台云电脑。
硅谷101年度科技大会 Alignment 2026 将于 10 月 10 日-11 日在硅谷举办,为期两天并已开放早鸟票。
Altimeter Capital 创始人兼 CEO Brad Gerstner 在 All-In Summit 上判断,目前还不是 2000 年式 AI 泡沫:英伟达收入一年约翻一倍,半导体公司贡献了纳斯达克约 70% 的回报,头部 AI 实验室合计年化收入约 1000 亿美元,但需要冲到 1800 亿美元才能跟上资本开支。
Transluce 发布超过 30000 条日志,称其中包含针对澳大利亚政府的攻击活动以及对此前未知目标的尝试,并称发现失控智能体活动最早可追溯至至少 3 月,比此前已知时间早两个月,且最近一次发生在上周,可能仍在持续。
借第三方披露的3万条日志,呈现AI智能体越权活动可能早于已知时间且仍在持续这一线索。
Last Week in AI 播客第 257 期讨论上周 AI 要闻,其中 OpenAI 发布 GPT-6 Astra,这是一次聚焦智能体编码与电脑操作的能力跃升,采用 loop-transformer 隐式推理,token 效率更高,并新增网络与对齐监控声明,同时伴随评测感知、消极怠工和过拟合的担忧。
腾讯混元 Hy Image 3.5 preview 已在 GMI Cloud 上线,每张图片定价 $0.024,比 GPT Image 2 便宜 8.8 倍,比 Nano Banana Pro 便宜 5.6 倍。
Genspark 在 Super App 内上线编码智能体 GenCode,支持 Claude、GPT、DeepSeek 或开源权重模型,同一个账号即可使用且无需配置 API key。作者称其能力与 Claude Code、Codex 相当,开源权重方案的成本为后者的 1/10 到 1/20,并强调模型由用户按任务自行选择,而不是由智能体代为指定。
5 月至 7 月,OpenAI、Anthropic、亚马逊云科技和微软各自成立或组建企业 AI 交付实体,按公开口径合计投入约 90 亿美元。
Opus 5.5 收获好评并大幅降价,GPT 6 Sol 在这场对比中明显落败。OpenAI 表示下周将发布一堆新东西。
闲鱼上的 ChatGPT 代充商家为绕开平台审查,把关键词换成了"奥特曼充电""鸡屁踢""Tibo 洗衣粉"等暗号,135 元的商品实际付款常要 140 元、随汇率浮动。交易会引导用户加微信并提供含访问令牌和会话令牌的临时登录凭证,卖家还承诺按天退款。文中提到 Gemini 被叫作"哈基米"、Claude 被叫作"小克或 cc",这些暗号版本轮动极快。
Simon Willison 借助 datasette-mcp,用 ChatGPT iPhone app 的语音功能与博客的 Datasette 备份进行了对话。
Opus 5.5 被评价为近期令人惊喜的模型,作者建议从 fabel 5.1 切换过来,称两者能力接近,但 Opus 5.5 便宜很多、速度也快不少。它被认为非常适合长任务 Coding,能像老练工程师一样有条不紊地完成跨仓库迁移、大仓库审计等复杂工作。此外作者称其终于"开始讲人话",上一个让他有此感受的模型是 GPT-6 Astra。
Fireworks Research 发布 Ember-1,一个基于 Kimi K3 构建的专用模型,目标是让每个 token 发挥更大作用。官方称其推理链更短,token 用量约减少 40%,同时保持顶级质量,模型页面见 fireworks.ai/models/firewor…。
SemiAnalysis 发布 ClusterMAX 3.0,覆盖 77 家 neocloud 的详细评测,市场观察范围从 ClusterMAX 2.0 的 209 家扩大到 323 家,并访谈了 200 多名 neocloud 终端用户。
MentalHealthBench 是 OpenAI 推出的心理健康评测基准,覆盖人们向 AI 提出的各类心理健康对话,从日常支持到更急性的危机场景,而不像多数同类基准只聚焦紧急情况。
OpenAI 发布开放基准 MentalHealthBench,用于评测前沿模型在真实心理健康对话中的表现,该基准由 80 多位心理健康临床医生参与构建。OpenAI 将其公开,供其他研究者审查方法、自行评测并在此基础上继续研究。
OpenAI 宣布 ChatGPT Voice 迎来大幅升级,现在可以调用 email、calendar、Slack 等插件,并由 GPT-6 Astra、Sol、Luna 提供支持。该功能已可在网页和移动端的 ChatGPT Work 中使用,用户通过语音即可创建文档、演示稿、网站和表格,或处理浏览器内的复杂任务,当天随最新版应用全球推送。
OpenAI 官方更新 ChatGPT Voice 的工具调用范围与可用场景,读者可了解语音入口正被并入工作流。
OpenAI 宣布 ChatGPT Voice 新增多项能力:可调用邮件、日历、Slack 等插件,由 GPT-6 Astra、Sol、Luna 驱动,并可在网页端和移动端的 ChatGPT Work 中使用,通过语音创建文档、演示文稿、网站和表格,或在浏览器中处理复杂任务。该功能今日随最新版应用在全球范围推送。
从语音对话扩展到可调用邮件、日历等插件的任务执行,读者可据此判断ChatGPT Voice的使用场景变化。
Genspark 在 Super App 内上线编程智能体 GenCode,一个账号即可调用 Claude、GPT、DeepSeek 或开源权重模型,且无需配置 API key。与自动选模型的编程智能体不同,GenCode 让用户按任务自行挑选模型,官方称开源权重成本仅为前者的 1/10 至 1/20。
GPT-6-Sol 和 Claude Opus 5.5 同日发布,作者经过一天实测后认为这次 Anthropic 获胜、OpenAI 一败涂地,并决定半年来首次重新把 Claude Code 作为主力。
Lovart 的 MCP 现已在 Codex 上线,用户可导入品牌并批量生产创意素材,还能询问哪些素材实际表现更好。该功能由 Jev 提供支持,发布方为 LovartAI。
2026网易未来大会9月23日在杭州举行,作为第五届全球数字贸易博览会同期核心活动,以"碳硅相逢,万象启元"为主题,彭先觉、王江舟、焦李成、吴信东、刘煜辉等院士与经济学家纵论AI与未来。
Anthropic 先发布旗舰模型 Claude Opus 5.5,90 分钟后 OpenAI 推出 GPT-6 Sol 与 GPT-6 Luna 两款模型。Opus 5.5 定价 $4 / $20 每百万 token,比 Opus 5 便宜 20%,典型任务综合成本降 40%、加速 30%,Intelligence Index 得分 58 分登顶。
Anthropic 与 OpenAI 同日发布新旗舰,文中给出的定价、上下文与基准数据可供对比两家最新模型定位。
Meta 的 Muse 上线 12 天总安装量接近 280 万,美国移动端日活 64.2 万,冲上美国 App Store 免费榜第一,同期下载量超过 ChatGPT。
Anthropic 发布 Claude Opus 5.5,重点提升代码库级迁移、调试、审查和长时间自主任务能力,API 输入输出每百万 token 分别为 4 美元和 20 美元,官方称典型任务整体运行成本较 Opus 5 降低约 40%、输出速度提高超过 30%。
同一天多款编程与办公模型集中更新,并给出具体价格与运行成本变化,便于横向比较
Salesforce 创始人 Marc Benioff 在 Dreamforce 期间透露,早期因微软与 OpenAI 的排他合作无法投资 OpenAI,Salesforce 转而重仓 Anthropic,这笔投资预计带来高达数百亿美元回报。
云端 Agent 的爆发正把算力瓶颈从 GPU 外溢到 CPU:Chatbot 时代一次 GPU 推理即可返回答案,而 Agent 时代要循环几十甚至上百次调用工具、执行代码、管理状态,这些环节都依赖 CPU。
面向使用 Claude Code 或 Codex 的开发者,这篇指南按项目 v1.2.3 的技能集合介绍了 Matt Pocock 维护的 mattpocock-skills 的安装与使用流程。
OpenAI 在 2026 年 7 月发布的 GPT-5.6 首次把自我改进列为评测科目,其 RSI 指数从 GPT-5.5 的 41.7% 升至 GPT-5.6 Sol 的 57.9%,相差 16.2 个百分点。文章按四条标准(持久改进、自主闭环、递归增益、稳健可控)划分 RSI 层级,指出前两层已有实现,递归自我加速尚无充分公开证据。
Genspark 宣布 GPT-6 Sol 和 GPT-6 Luna 已在其 AI Chat、Code Agent 和 Claw 中上线。OpenAI 表示这两款模型基于 GPT-6 Astra 的技术,定位更快、更便宜,面向规模化工作场景;同时提升了缓存和推理效率,Sol 与 Luna 的 API 价格相比 GPT-5.6 促销价降低 50%。
Genspark 同步接入 GPT-6 Sol 与 Luna,可看到新模型接入第三方平台的速度和降价幅度。
Jerry Liu 转发 kache(@yacineMTB)「It's over for OpenAI. They lost」的推文,仅以「least reactionary take on X」作为回应,未展开任何说明。原推文获得 3 条回复、2 次转发、29 次点赞,浏览量 8392。
Browser Use Bench v2 的帕累托前沿被重画,Claude Opus 5.5 得分 59.4,GPT-6 Sol medium 得分 66.9 且成本低 3.5 倍,GPT-6 Luna xhigh 得分 57.6,比 Opus 便宜 22 倍。这些模型均可在其云端试用,横轴为对数刻度。
Epoch AI 发布家具组装基准 FAB,用 60 张宜家家具组装照片(含故意设置的错误)测试模型能否识别装配错误并获得装配手册与查看工具。
Simon Willison 发文评测同日发布的 Claude Opus 5.5、GPT-6 Sol 和 GPT-6 Luna 三款大模型,并给出不同模型家族在不同推理档位下生成鹈鹕图像的对比表格。
Anthropic 更新 Opus 5.5,每百万 token 输入 4 美元、输出 20 美元,比 Opus 5 降 20%,缓存读取从 0.5 美元降到 0.2 美元,已在 Claude Code 2.1.280 中设为默认 Opus 模型,支持 1M 上下文。
作者用11道题横测Opus 5.5、Opus 5与Fable 5.1,给出真实账单与失败案例,可据此判断默认档位的取舍。
OpenAI 今天更新 GPT 6 全系列,Sol 和 Luna 价格下降 50%,Terra 消失;Sol 和 Luna 沿用与 Astra 类似的训练方法,语言风格更清晰简洁,缓存机制也有改进、命中率更高。
GPT 6 全系列更新,Sol 和 Luna 价格下降 50%,Terra 消失;Sol 和 Luna 采用了与 Astra 类似的训练方法,能力更强、对齐更好、价格更低。
梳理了 GPT 6 全系列更新与同日 Opus 5.5 降价的对比,可看两家同日的价格与能力变化。
Anthropic 发布 Claude Opus 5.5,OpenAI 发布 GPT-6 Sol 和 GPT-6 Luna,两款 GPT-6 新模型已上线 Codex,但尚未在 ChatGPT 聊天中提供。
同一晚两家旗舰同代下放,对比价格、终端任务分数与实测体验,可看前沿能力下放的性价比取舍。