LlamaIndex 提出两遍式即时 OCR:LiteParse 快速首扫,LlamaParse 按需精解
LlamaIndex 提出两遍式 just-in-time OCR 方案,替代先解析全部页面的传统管线。第一遍由免费开源的 Rust 工具 LiteParse(支持 50+ 格式)做布局感知快速扫描,输出空间文本、边界框、标题、表格及每页复杂度标记,整个数据房间 32 秒完成;第二遍由 LlamaParse 按页码只精解需要的页面,返回单元格级表格、边界框和置信度分数。
LlamaIndex 提出两遍式 just-in-time OCR 方案,替代先解析全部页面的传统管线。第一遍由免费开源的 Rust 工具 LiteParse(支持 50+ 格式)做布局感知快速扫描,输出空间文本、边界框、标题、表格及每页复杂度标记,整个数据房间 32 秒完成;第二遍由 LlamaParse 按页码只精解需要的页面,返回单元格级表格、边界框和置信度分数。
MemPalace 把项目知识按"宫殿"结构组织:wing 对应项目或知识库,room 归类相关主题,drawer 将原始内容切成可检索的小块,Milvus 在背后存储文本、嵌入向量和元数据。
Arthur Mensch 表示,企业若不把控自建并自拥 AI 模型与系统的节奏,就不会迎来属于自己的"末日"。该帖获 1033 次点赞、130 次转发,浏览量 88401。
Perplexity Windows 应用新增 Portable Computer 功能并已开放上手使用,其端侧推理要求配备 NVIDIA RTX GPU 且显存不低于 24GB。
鹿客科技创始人陈彬在公司十二周年提出"从 1 到 0",把这家做了 12 年智能锁的公司重写成 AI 原生组织,新设 HARO 统管人与 AI,一号位由百度架构师出身的技术人担任,IT 改名 AIO 负责 agent builder。
Christian Catalini 指出,当无人为未经验证的失败付出代价、责任敞口趋近 0 时,验证预算就会崩塌。此时部署者会把未监控的 AI 智能体大量投入"失控风险区"(Runaway Risk Zone),获取自动化的收益,却把灾难性风险社会化。他在分析 AGI 经济学时认为,AI 大幅降低了任何易验证事项的执行成本,其余场景的瓶颈则是验证。
百度与国际爱护动物基金会(IFAW)合作的"濒危物种AI守护官"数字平台正式发布,可识别34类濒危野生物种,覆盖活体动物及相关制品,整体识别准确率达86.5%,支持电脑端和移动端使用。
DeepSeek-V4.1-Flash 正式上线千问 AI 平台,相关 API 服务与 Token Plan 同步开放,开发者可通过 API 接入应用,也能在 Qoder、千问 APP、Codex 等工具中直接调用 Token Plan。
夕小瑶科技说实测了5款已开放体验的国产世界模型:蚂蚁 LingBot-World 2.0、阿里 HappyOyster 1.0、腾讯混元 HY-World 2.1、爱诗 R1 和 8月26日开源的 Zing-0.5,从漫游、导演、联合控制三类能力评估输入还原度、运动一致性、物理合理性与导演表现。
LangChain 为 Managed Deep Agents 推出 Connections,把 API 凭证改为 LangSmith 工作区中按 slug 命名的连接,工具在运行时通过 connections.get() 读取。
LangChain 基于 Deep Agents 构建了 GTM Agent,在 Salesforce 新线索触发后自动判断是否触达、汇集 Gong 通话记录与 LinkedIn 等上下文,并把带推理依据和来源的草稿发到 Slack 供销售审核。
Credit Genie 采用 LangChain 开源仓库文档智能体 OpenWiki,自动生成并维护代码库文档,替代此前容易过期的 Notion 页面、README 和 AGENTS.md。
Microsoft Foundry 被指为最适合在企业中运行智能体的平台,可让长时间运行的 agent 推理、行动并调用工具。其可观测性与治理能力覆盖多智能体、多模型工作流,从可访问范围、数据流向、行为可重建到成本预算控制均有对应答案,并将安全防护、可审计和 FinOps 从系统搭建之初就纳入。
「有意思小周刊」vol.171 汇总了 AI 产品经理 PRD 撰写方法:AI 产品面向概率性系统,不能沿用确定性功能的传统 PRD 思路,完整骨架含十个部分,其中场景定义与输入输出、能力与功能描述、效果要求、异常与降级设计、评测方案五块应占全文一半以上篇幅。
Modal 8 月更新为 Kimi K3、Qwen3.8-2.4T-A95B、GLM-5.3 和 GLM-5.3-Flash 四款开放权重模型提供 day-zero 支持,其中 Kimi K3 为 2.8T 参数多模态模型,支持 1M-token 上下文窗口,在智能体负载下达到 460 tokens/秒。
Fireworks AI 与阿里云合作,将 Qwen 最新旗舰模型 Qwen 3.8 Max 引入 Fireworks 平台,开发者即日起可通过 fireworks.ai 上的模型页面开始构建。双方称这一合作面向需要速度与生产级质量的开发者,可更快构建并弹性扩展。
一套本地 AI 实验的 homelab 配置:Hermes 跑在 Framework Desktop Mainboard AI Max+ 395 上,5090 eGPU 以 Qwen 3.8 27B 提供最高 150+ tok/s 的 LLM 推理。
SemiAnalysis 指出,AI 加速器的 HBM 堆叠高度趋势正在逆转:下一代 Rubin Ultra 每 GPU 仅配 192GB HBM,低于标准 Rubin 与 B300 的 288GB,8-hi 将取代 12-hi 成为新标准。
针对“过去一个月至少 5 个专用推理引擎发布”的现象,有开发者质疑为何要放弃 vLLM、SGLang 另起炉灶,认为这会碎片化生态、弊大于利。Junyang Lin 转评调侃称,原因是现在人们突然都会写 Rust 了。
Amp 用户现可通过 Amp 新增的 BYOK 模型路由使用 Ollama 云端模型。BYOK 模式不设限制也不收费,并可构建可从任意位置控制的远程智能体。Amp 在用户自带算力与模型订阅/密钥时免费使用。
在联合创立 Kepler AI 之前,Vinoo Ganesh 在 Palantir 领导 Spark 团队并打造了 Project Frontline——一个面向 Forward Deployed Engineer(FDE)的开创性项目。他在访谈中分享了 FDE 的最佳实践。
Andrew Ng 在 The Batch 最新来信中指出,最优秀的 AI 工程师不只是按规格写代码,而是塑造整个构建过程。他提出四项核心技能:驱动构建循环、做产品决策、广泛沟通、以及高主动性的主人翁意识。
pnpm 12.4 将 npm、Python 和 Cargo 依赖安装收进同一套工作区配置,一条 pnpm install 即可处理三个生态的依赖,新增的 pipeline 负责安装后的构建与验证编排。
Qwen3.8-27B 已在 Cerebras 上线运行,提供快速推理能力,用户可直接试用。该模型为开源模型,本次以“快速 + 开放”组合方式接入 Cerebras 推理平台。
Wan 3.0 现已在 Fish Creative(@FishCreativeHQ)上线,官方称其成本比 Seedance 2.5 低 79%。更低的成本意味着用户可以尝试更多不同角度,找到自己满意的画面。
云栖大会千问AI平台分论坛将于 9 月 23 日 9:50—12:00 在杭州国际博览中心一期 3F 308 举行,千问AI平台最新产品能力首次集中公开,Qwen 共创计划同步发布并开放报名。
Browser Use Cloud 支持云智能体在不登录的情况下保持认证状态:先在本地 Chrome 登录,再把本地 cookies 同步到云端,智能体全程看不到用户密码,用户也保持登录。该功能已在 Browser Use Cloud 上线。
Augment CTO 兼联合创始人 Igor Ostrovsky 指出,软件工厂能高效清空 issue 积压,关键却不在修复代码本身,修复实现是修 bug 中最不重要的环节。他认为单靠一个修 bug 智能体难以真正烧掉团队的 bug 积压。
Augment Code 的 Cosmos 用两块屏幕和一个提示词就能搭起"软件工厂":连接代码仓库、创建环境、描述你想要的工厂。Advisor 会挑专家、写配置、自动应用,遇到需要决策时再询问你。
NVIDIA 推出 TensorRT Model Connect,用于加速从视频到语音的模型构建流程。该工具以“From Video to Voice: Build Faster with TensorRT Model Connect”为主题进行直播分享。
ChatGPT 官方宣布 ChatGPT Sites 上线三个月以来用户已创建超过 500 万个站点,并发布了一批更新:可以邀请团队成员协同编辑、保存和发布共享站点,可将站点设为私有并只邀请指定人员访问,从提示词到部署的时间缩短一半,可让 ChatGPT 检查站点数据库(编辑者也能查看),并支持绑定自定义域名。
Nvidia 在 10-Q 中披露的资产负债表外担保总额已达 530B 美元,较上季度的 184B 大幅跳升。增量主要来自三项:供应与产能承诺从 119B 升至 279B(以内存为主),担保从 3.5B 升至 108.5B(涉及 SB Energy 在俄亥俄州的 4.25 GW 园区,租给 OpenAI 二十年),并首次出现 36B 的 AI 云协议和 20B 的数据中心租约。
Windsurf 宣布 Fusion 已在桌面端和 CLI 上线,用户可通过 devin.ai/download 获取。原文未披露模型版本、参数规模或价格等细节。
Cognition 在 Devin CLI 与 Devin Desktop 中推出 Fusion,官方称其为面向 Fable 与 Astra 的最高效 frontier harness,在各项编码基准上成本最高降低 39%。
AWS 展示了一套库存自动化架构:用零样本时序基础模型 Amazon Chronos2 做概率需求预测,再由 Strands Agents SDK 构建的 Supervisor、Preprocessing、Forecasting、Reporting 四个 LLM 智能体在 Amazon Bedrock AgentCore 上编排确定性工具,把预测转成可审计的采购订单。
京东零售产品经理用 PRD 四步法加 Skill 沉淀,把一批覆盖接需求、沟通、交互、文档与评审的需求从 34 个人日压缩到 15 个人日,并通过评审且质量未打折。方法分三层:Prompt 到 Context 再到 Harness,人负责判断与复核,AI 负责初稿、追问与遗漏检查。核心场景是需求文档撰写与交互设计,可复用经验沉淀为 Skill。
大淘宝技术直播技术团队开源了本地长期记忆系统 HL-Mem(Apache-2.0),对应 v1.1 系列,采用事实与经验双通道架构,用不可变 Event 加可更新 Claim 实现证据可追溯、有效时间与记录时间双时间可解释,以及记忆的修正与遗忘。系统默认仅依赖 SQLite 单文件部署,配后台异步 Worker 处理去重、冲突消解与生命周期管理,运行时独立、本地优先,并支持中文检索。
DeepSeek-V4.1-Flash 已在 Ollama 云全面上线,托管于美国与欧洲,承诺 prompts 和 responses 不记录、不用于训练。按 token 计费与 DeepSeek API 一致并含 off-peak 定价,可通过 Ollama 的 Pro、Max、Team 套餐或免费账号按量付费使用。
模型架构引入过多复杂性会带来连内部 eval 都无法测试的未知问题。但作者认为,随着基础模型越来越聚焦所谓 agentic 任务,有时可以为效率上的大幅收益接受这些小的未知成本。
Datasette 发布 1.0a39 和 0.65.4 安全版本,此前使用 Claude Fable 5.1、GPT-5.6 Sol 和 GPT-6 Astra 进行了大规模审计,并修复了多种 bug。在公开网站上运行 Datasette 实例的用户应尽快升级。