LlamaIndex 发布 Jev 模型:面向文档任务的 System one 模型基准测试领先
LlamaIndex 对 Jev 与多个开源模型(含通用分类器和文档专用模型)在方向检测、语言检测、分类、拆分等文档任务上进行基准测试,评测维度为准确率、成本和延迟,Jev 在三个维度上的多数基准中领先。相关代码已在 GitHub 开源,并附有视频讲解。
LlamaIndex 对 Jev 与多个开源模型(含通用分类器和文档专用模型)在方向检测、语言检测、分类、拆分等文档任务上进行基准测试,评测维度为准确率、成本和延迟,Jev 在三个维度上的多数基准中领先。相关代码已在 GitHub 开源,并附有视频讲解。
有开发者反映,为简单简历开发 BOSS 直聘插件时,让 ChatGPT 通过 CDP 操作 Chrome、或用 grok bot 云端操作,都会被网站直接打到空白页面。现在不少网站会记录鼠标移动轨迹和按键等操作,用来分析是否为真人,国内很多平台可能也已采取类似反自动化手段。除非能做出完全拟人的操作,否则这类自动化封锁目前没有好的解决方案。
架构师之路《AI时代的架构设计100讲》第8讲提出,进程内缓存应默认禁止、例外放行,并给出可直接复制的spec模板:模式声明、红线约束、异常与降级、验收标准四部分。原因是AI写代码时爱自作主张加本地Map“优化性能”,必须把默认禁止写进spec。仅三种场景放行:只读数据启动加载、极高峰挡流量、允许一定程度数据不一致。
Manus Flex Inference Partner Program 上线,OpenRouter、Fireworks AI 和 Modal 成为首批推理合作伙伴,用户可通过 Flex 接入更多推理服务商,并获得更丰富的模型选择。该计划将推理服务商与大型语言模型提供商并列,扩大用户可连接的范围。
Voyage AI by MongoDB 的 Rerank 3 和 Rerank 3 Lite 已在 AI Gateway 上线,两款模型在把文档传给大语言模型之前按相关性重排搜索结果。
Vercel Sandbox 现已支持 Secure Compute,可将沙箱接入团队专属网络:公网流量经该网络静态 IP 出口,沙箱还能通过 VPC peering 访问 AWS VPC 内的私有资源。
Replit 称模型持续变聪明,但 harness 不会消失,其职责从替模型做决定转为给模型提供选项。在 Replit Agent 中,主智能体决定何时更深入思考、何时把工作交给子智能体,以及子智能体应投入多少工作量。
软件架构演化被概括为单体→原始分布式→SOA→微服务→云原生,其中SOA的ESB虽是解耦一步却在故障隔离上倒退,因此互联网公司普遍弃用。文章指出解耦粒度细化与故障域隔离强化是两条主线,理念已从追求零故障转向设计容错性。AI Agent 打破云原生无状态前提,带来不确定性、状态管理、动态编排与可观测性四重挑战。
AI SDK 周下载量达到 3000 万次。作者用 fframes、fx.sh 和 Opus 一次性生成了展示 5M/10M/20M/30M 里程碑的视频,该视频用 Rust 编写并在 GPU 上渲染。
Google 把 Colab 纳入 Gemini 订阅方案,用户由此获得高端 GPU 使用权,可在浏览器里运行任意开源模型,甚至做图像、音频、视频生成,并微调大量开源模型。整个过程跑在昂贵的 Nvidia GPU 上,无需自行租赁或购买硬件。
NVIDIA TensorRT Model Connect 是一个基于 TensorRT、用 C++ 编写的开源 AI 模型参考实现集合。项目以编码智能体为核心设计,采用并行开发、模型族隔离、可回滚改动和 GPU 验证等做法,目标是让 TensorRT 推理栈的性能更易被使用。
0xSero 撰写的 DGX Spark 入门指南已在 Hugging Face 博客发布,由 Julien Chaumond 推荐。该推文附带 huggingface.co/blog/exolabs 链接,发布后获得 95 次点赞、14 次转发和 13582 次浏览。
Cognition 推出 Devin for MongoDB Modernizations,由 Devin 负责遗留代码改动,MongoDB AMP 负责数据迁移与校验。官方称客户可更快进入生产环境,让工程师腾出精力开发软件、解决难题。
NVIDIA 发布 Metropolis 视频搜索与摘要(VSS)Blueprint 3.3,用其智能体技能降低视觉 AI 智能体的构建与运行成本。该蓝图面向生产规模视频理解,整合视频接入、流处理、事件检测、检索、摘要与报告等环节,解决从能力到可维护系统的落地难题。
OpenAI 的 Codex CLI 迎来更新,新增 /usage 查看活动与用量分析、/theme 切换主题,并支持 managed worktrees。终端内可直接渲染 Mermaid 图表和 LaTeX,diff 与工具输出可折叠,还新增状态、提示和键盘快捷键的专用区域。
Codex CLI 新增 /agents 命令,可查看正在运行的任务、检查进度并在任务间跳转。另支持 /fork 将对话复制到一个 worktree,共享相同上下文并拥有独立 checkout,方便尝试其他方向。
OpenAI 对 Codex CLI 进行重大更新,带来全新全屏界面、更好的可读性,以及在终端内管理并行任务的能力,继续加码面向命令行开发者的投入。
OpenAI Developers 宣布 Codex 支持在云端启动任务,用户可在手机或另一台电脑上跟踪进度并实时调整,即使笔记本电脑处于关机状态。同时,官方把原本桌面应用的使用体验带到了网页和手机端。
OpenAI Developers 宣布 Codex cloud environments 上线,用户关闭笔记本后智能体仍会继续工作。该环境可复用,仓库、依赖、脚本和设置都已预先配置,从而减少环境搭建、加快启动速度。
v0 现已支持接入 ChatGPT 订阅,用户连接账号后即可用 ChatGPT tokens 构建项目。该功能面向 ChatGPT Plus 或 Pro 套餐用户开放。
Michele Catasta 分享了如何设计并构建 harness,以远低于常规的成本达到前沿性能。原文未披露具体模型、参数规模或 benchmark 数据。
Devin 开始支持用 ChatGPT 订阅直接登录,ChatGPT Plus 或 Pro 用户在 Devin 内调用 OpenAI 模型的消耗将从其订阅额度中扣除。该功能已在 Devin Cloud、Devin Desktop 和 Devin CLI 上线。
OpenAI 推出付费高速档位 Ultrafast,在 Codex 中 token 生成速度最高提升 8 倍达到 300 tokens per second,在 API 中最高提升 6 倍。
Cognition 发布 Devin 下载入口,用户可通过 devin.ai/download 获取试用。原帖未披露该版本的模型版本、参数规模或价格等具体信息。
GPT-6.1 Sol 已在 Devin 上线,在 FrontierCode 1.1 上得分 60.4%,与 GPT-6 Sol 的 60.7% 基本持平,但成本大幅降低。中等推理强度下每任务花费 $0.31,比 GPT-6 Sol 最高推理强度低 81%。
OpenAI 发布 GPT-6.1 Sol,官方称其以五分之一的价格提供接近 Astra 的智能水平,输入 $2 / 百万 token、输出 $10 / 百万 token。
材料给出 GPT-6.1 Sol 在编码、办公与电脑操作三类任务上的对标结果和定价,可用来比较同价位模型的取舍。
OpenAI 发布 GPT-6.1 Sol,主打更可负担的前沿智能,供开发者规模化构建和运行应用。缓存输入价格为每百万 token 0.10 美元,比标准输入定价低 95%,比 GPT-6 Sol 的缓存输入价格低 50%。
NVIDIA 发布 Nemotron Labs 内容,介绍如何在 DGX Spark 与 DGX Station 上本地运行 Nemotron 模型。该内容面向本地部署场景,展示 Nemotron 在 NVIDIA 自有硬件上的运行方式。
Perplexity 发文介绍 Perplexity Computer 中的 Automations 功能,并附上官方博客文章链接供进一步阅读。
有人搭了一条 Codex → Flux 3 流水线,能自主生成"古希腊日常生活"这类视频。该流程由 Codex 负责编排、Flux 3 负责生成画面,作者称内容基本可自动产出。
Genspark 已选择 Soniox 作为其语音转文字供应商。Soniox 提供覆盖 60+ 种语言的母语级准确率、超低延迟,并在人名、数字和 ID 上具备较强精度。语音正成为 Genspark 用户交互的关键部分,涵盖语音驱动的 AI、会议记录和自主电话呼叫。
DeepLearning.AI 推出数据工程专业证书,包含四门课程,讲授数据生成、摄取、存储、转换与服务系统的设计与构建,涵盖 AWS 上的批处理与流式管道及开源工具。课程由 AWS 合作打造,讲师为《Fundamentals of Data Engineering》合著者 Joe Reis,可免费注册。
Perplexity 宣布开源 Bumblebee,这是一个面向 macOS 和 Linux 的只读扫描器,用于检查开发机上的风险包、扩展和 AI 工具配置。接入 Computer 后,它能在出现新的供应链风险时触发更深层扫描;Computer 会复核 Bumblebee 与 Numbat 的发现并提出更优检测规则,但所有改动都须人工批准,智能体不能自行批准自己的变更。
Perplexity 称智能体治理本质是工程问题,已把安全防护机制内建到自家基础设施、harness 和工具中,并在各产品线上投入使用。该公司同时发布博客,介绍其工程化构建更安全智能体的具体做法。
Eleven v4 Turbo 已在 ElevenAgents 上线,把 Eleven v4 排名第一的语音质量带入实时对话,中位推理延迟约 100 ms。ElevenAgents 由此可在各行业支撑更具个性化、更有共情力的客户体验。
为给简单简历做 BOSS 直聘插件,用 ChatGPT 通过 CDP 操作 Chrome,或用 grok bot 云端操作,都会被网站直接打到空白页。作者称 GitHub 上的 loks666/get_jo 仓库及相关讨论让自己大开眼界,其中既有 AI 时代的各种巧思,也有针对自动化反制手段的干货讨论。
Weaviate 的 Query Agent Search Mode 新增 effort 参数,提供 medium、high、ultrahigh 三档,用于控制每次请求的检索投入程度。更高档位会在两处增加计算:查询编写阶段花更长时间拆解请求并转为结构化搜索,重排阶段对召回文档做更充分评估后再返回最终排序。官方建议按自身准确率、延迟和成本要求选择合适档位。
AWS 展示如何用 AG-UI 协议、Strands Agents SDK 的 Swarm 模式和 Amazon Nova Act 构建能随 AI 输出变化自动调整的界面。
在服务器上部署 Magpie 后,可完全替代 CLI Proxy API,把 Open WebUI 等服务统统接入其 API 进行统一管理。该方案由用户 Geek 分享,用于集中管理多个 AI 服务的 API 接入。
Vercel CLI 现可通过 vercel traces search 在终端搜索项目的 trace span,无需打开 dashboard 即可排查错误、延迟和安全问题。