Jerry Liu 推出 DocJev:比 gpt-5.6-luna 快 6 倍的文档分类与切分开源库
Jerry Liu 发布开源库 DocJev,用于文档分类与切分,速度比 gpt-5.6-luna 快 6 倍且精度相当。用户只需给出文档和自然语言类别规则,Jev 即可预测文档类别或子文档边界,并支持 liteparse 与 LlamaParse 两种 OCR 后端。
Jerry Liu 发布开源库 DocJev,用于文档分类与切分,速度比 gpt-5.6-luna 快 6 倍且精度相当。用户只需给出文档和自然语言类别规则,Jev 即可预测文档类别或子文档边界,并支持 liteparse 与 LlamaParse 两种 OCR 后端。
Aikido 发布首个开源权重安全模型 Altar-1,具备接近前沿水平的防御能力,其基础是开源 SOTA 模型 GLM 5.3 的剪枝量化版本,轻量到可装进单个 4-H200s 节点。
Logan Kilpatrick 建议,用 AI 构建产品的团队应把超过 25% 的时间花在制作 benchmark、并推动模型实验室关注这些 benchmark 上。他称这是加速公司进展的最快路径。
NVIDIA TensorRT 推出多设备推理能力,让单个 TensorRT 网络借助 NCCL 分布式集合通信跨多 GPU 执行,同时保留 TensorRT 的推理优化。该能力自 TensorRT 11.0 起获得完整支持,并已集成进 NVIDIA Dynamo-Triton,用于简化多 GPU 模型服务。
Anton Osika 表示其团队的 harness 已针对构建 Web 应用做微调,会依据用户请求内容在 OAI 与 Anthropic 之间路由,并自动拉取全部调试数据。他邀请开发者试用该工具。
Jev 现已接入 Lovable AI Gateway,即日起至 9/27 23:59 UTC 可免费用它构建 AI 功能。Alexandre Pesant 同时发布 Jev completions API 与 Jev Playground,称可用其替换现有 LLM 做文本生成。
Cognition 宣布,为庆祝某节点,10 月 8 日前在 Devin Cloud 中免费提供 SWE-2。用户可通过 devin.ai 的博客链接了解详情并试用。
Cognition 为 Devin 推出 devin ssh,可远程接入 Devin 的开发者环境并当作自己的环境使用。用户能直接浏览和编辑代码、启动 dev server 并转发端口测试 Devin 的工作,也可通过 scp 从虚拟机取回文件,完成后用 CLI 的 /handoff 把工作交回本机。
Cognition 为 Devin 的云端计算机推出两种新用法:在 CLI 中通过 /cloud 创建、引导和恢复 Devin Cloud 会话,以及首次支持通过 SSH 登录 Devin 的专属 VM,再用 /handoff 把工作交回自己的设备。
SemiAnalysis 解析 MoE 推理的计算与数据搬运,将模型服务拆为 Prefill、Midfill、Decode attention、Decode experts 四种运行模式,各自对算力、内存和网络的需求不同。
Grok 4.7 已在 Vercel 的 AI Gateway、fx 和 eve 上线,主打快、聪明、便宜。9 月 27 日前所有调用享受 40% 折扣,用户可通过 Gateway 配合 fx.sh 或 eve 试用。
Harrison Chase 称开源决策模型 SemIf 在 JevBench 上得分 75.4,与 jev 的 74.7 十分接近,且还有多个开源替代方案。SemIf 基于 qwen3.5,LangSmith Gateway 将免费托管一周。
LangChain 用 Deep Agents 构建天气 agent,在 LangSmith 数据集上对比 TypeSafe AI 的 Jev 与 GPT-5.6 Luna、GPT-5.6 Terra、Claude Sonnet 4.6 三种 LLM 评委。
NVIDIA Earth-2 面向天气敏感行业,将能源企业的风光资产测量、应急管理团队的雷达与本地传感器数据、卫星观测等最新观测整合,用于更早地获取本地化天气变化视角并管理物理风险。该平台帮助各行业把观测数据转化为及时的气象决策,相关数据覆盖能源、应急管理与卫星等多个领域。
Runway 将于 9 月 30 日在旧金山 Masonic 举办为期一天的线下黑客松,与 Runway AI Summit 同场,参赛者需用 Runway API 构建智能体、应用或创意工作流。活动不设路演和审批流程,下午 5 点前提交可运行 demo,即有机会赢取 25K 美元和 200K credits。
Google Research 副总裁 Yossi Matias 在官方播客《The Google Research Podcast》首期访谈中表示,AI 正在终结"岗位头衔",以往需要熬 15 年才练出的判断力,如今初级员工一出道就得硬抗。
快手在第五期技术沙龙上首次系统披露 Data Agent 规模化落地数据:平台 WAU 突破 10,600,周人均对话 55 次,数据分析师与产品运营渗透率超 80%,NPS 达 73.5,单次任务提效中位数 13 倍。
Convai Innovations 开源了非自回归 System 1 决策模型 Laya,含 421M 参数,基于 ModernBERT-large 主干和 RLCD 训练概率输出,GPU 推理延迟 33~38 毫秒,采用 Apache 2.0 协议,可在本地部署。
阶跃星辰发布 Step 5 Preview,采用稀疏 MoE 架构,总参数 600B、每 Token 激活 27B,支持 100 万 Token 上下文与视觉输入,已通过阶跃产品与 API 提供,完整权重计划于 10 月 15 日发布。
开发者 Kamimoto 将 Jev 集成进 MiniMax H3,对 4step、49 层的注意力处理做稀疏化,由 Jev 逐层判定重要度并选择 1%、3%、5%、10% 的稀疏率,在 RTX4070 上把视频生成从 6 分 7 秒缩短到 3 分 34 秒,提速 41.7%。
开发者 Kamimoto 将 Jev 接入 MiniMax H3,用其对 4step、49 层的注意力做稀疏化处理,按层判定重要度并可选 1%、3%、5%、10% 稀疏率。在 RTX4070 上,视频生成时间从 6 分 7 秒缩短到 3 分 34 秒,减少 41.7%。即便生成过程中需向 Jev 云端查询,速度仍有提升。
大淘宝技术会员技术团队提出 Loop engineering 理念,工程师不再逐轮提示 agent,而是设计包含读取状态、判断任务、执行、验证、记录状态和判断停止条件的自动化循环。
SGLang-Diffusion 在 Qwen-Image 2.1 发布首日即提供支持,覆盖文生图、多图编辑和透明 RGBA 输出,单个 checkpoint 即可完成。
作者冷逸把阶跃星辰 Step 5 Preview 的 API 接入 WorkBuddy 实测,覆盖前端网页、塔防游戏、3D 互动游戏、跨平台适配和运营报告 PPT 五类任务,其中塔防游戏一次性生成且可通关,3D 游玩与关卡设计离 GPT-6 仍有差距。
Lucy 基于 Qdrant 为超 280 万份 SEC 与 DART 监管文件构建检索层,混合检索加 RRF 后 FinanceBench Recall@5 达 93.4%、Recall@10 达 94.7%。
Vercel AI Gateway 现已支持通过 TypeSafe 客户端、HTTP API 和 AI SDK 三种方式调用概率决策模型 Jev。Jev 接收状态并输出带概率的类型化答案,不生成文本,新集成以 typesafe-ai/jev 命名,支持 boolean、choice、score 三类问题,三条路径的请求均通过 AI Gateway 计费并计入用量与可观测性。
Vercel 宣布 SpaceXAI 的 Grok 4.7 已在 AI Gateway 上线,模型 ID 为 spacexai/grok-4.7,9 月 27 日前使用该 ID 的请求自动享 40% 折扣。
鹿客创始人陈彬把公司重写成 AI Native 组织,自己兼 HR 一号位,新设 HARO 统管人与 AI 资源,主张"能让 AI 做的就尽量别让人做"。业务侧改为端到端闭环的"圈子",奖金包由圈长决策,职能只剩建议权,agent builder 与 FDE 不脱产、投入 30% 到 50% 精力。
GitHub 法务团队正在用 Copilot CLI 处理更多法律相关工作,相关做法在 GitHub 官方博客的 AI 与 ML 板块公开分享。帖子未披露具体模型版本、参数或性能数字。
为让 Mac 清理工具 Mole 卸载更彻底,作者整理 300 多款 Mac 软件共约 100 多 G,分成 30 组,用最强 Extra High Fast 模型借 computer use 每次 10 个自动下载、安装、卸载并查找残留。过程补充了 13 类通用规则、90 多条精确清理路径,修正 30 多个误清点,并新增 100 多条单元测试。
LangChain 正在探索如何用 Jev 构建更好的 harness,并将于下周联合 @sydneyrunkle、@huntlovell 以及 @typesafeai 的 Allie 举办 webinar。活动报名地址为 events.langchain.com。
前 Google Kotlin 团队首位工程师 Jake Wharton 在采访中表示,他在求职时把不加入 AI 公司、不做 AI 核心产品列为第一条要求,这让他放弃了约 80% 的潜在机会。
零跑于2026年9月16日正式发布世界模型智驾系统,放弃BEV表征与激光雷达信息接入,采用图像到动作架构,激光雷达仅作安全兜底。同日朱江明宣布已售出的35万辆激光雷达车型用户可免费升级该系统。
快手电商直播技术团队将"主播说话到字幕上屏"端到端耗时从1.5~2秒压缩到400~500毫秒,字错率(CER)从7.81%降至3.51%,并支撑千万级持续并发分发。系统按"拉流—识别—对齐—分发—渲染"链路建设,用 PTS 队列统一媒体时间线,以房间事件加两级级联实现一份计算多方消费,客户端按播放器 PTS 驱动字幕渐进吐字与修正。
a16z 的 Andrew Chen 认为,AI 原生消费应用要实现普及,需月均 ARPU 高于单用户平均推理成本,但当前月 ARPU 约 2-5 美元,而 AI 重度应用的 token 成本达 20-50 美元,差距超过 10 倍。
Jon Kelley 发文详解 Devin Mac 的构建过程,团队耗时数月用 Rust 从零重建了它的磁盘、网络、资源调配、VNC 和 computer use。这是 Devin Mac 首次公开的技术细节,原文以 X 文章形式发布。
GitHub 指出,语言模型在干净 benchmark 上表现优异,仍可能在真实场景的关键 case 上失败。GitHub 分享了帮助其从有前景的原型结果走向生产的评测实践。
XMind 联合创始人 Mango 披露公司 AI 组织转型:增长和市场部门被打散、测试团队解散,职能退化为只管技能等级认证的社区,圈长必须真分钱而不只是打分。
Remix 团队成员 Brooks Lybrand 撰文质疑"Just let AI use React"的说法,认为 AI agent 不用框架会自行拼凑"土法炮制"的框架,因此需要具备更优抽象与约束的新一代框架。
高通在圣迭戈总部搭建面向5G和6G的研发测试平台,用无线信号追踪无人机并由AI分类,展示其6G愿景的连接、感知、高性能计算三大基石。高通提出"计算连续体"多层架构,并计划推出面向家庭和小企业、可承载万亿级参数模型的设备形态;同时探索把AI算力下沉到基站侧,供运营商提供"算力即服务"或"Token即服务"。