FastEmbed:Qdrant 的高效 Embedding 生成 Python 库
FastEmbed 是 Qdrant 维护的 Python 库,可在 CPU 上生成嵌入向量,无需 GPU、PyTorch 或 API key,默认模型为 BAAI/bge-small-en-v1.5,首次使用时下载量化 ONNX 文件,单条嵌入为 384 维。
FastEmbed 是 Qdrant 维护的 Python 库,可在 CPU 上生成嵌入向量,无需 GPU、PyTorch 或 API key,默认模型为 BAAI/bge-small-en-v1.5,首次使用时下载量化 ONNX 文件,单条嵌入为 384 维。
微软 CEO Satya Nadella 披露其用即将登陆新 superapp 的 Copilot code,以单条提示词加 /drill-me 技能生成计划,再用 autopilot 生成含历史、查询、场景与 what-if 分析的完整应用,并以 /rubber-duck 完成测试。
微软正在构建一种新模型系统,把 harness、上下文、记忆与行动空间同任何单一模型家族解耦,以推动成本-结果曲线的前沿。该系统已用于微软自家产品并取得良好效果,同时通过 Foundry 向客户开放。微软称每个模型都可替换,还能带来业务连续性与韧性。
Augment Code 在 Cosmos 智能体编排平台中将 OpenAI 的 GPT-5.6 Sol 设为默认模型,称其在真实长周期软件开发任务测试中是最具 token 效率且能通过质量门槛的模型。用户仍可自选其他模型,也可让 Cosmos Advisor 为任务挑选最佳模型。
Malte Ubl 在私密网络安全基准上测试 Kimi K3,认为它是网络安全任务的性价比之选,召回率、精度与价格平衡最好,GPT 5.6 召回率与精度最高但单次运行成本高出 7 倍多。
TinyFish 现已可在 Grok Build 中使用,将 Search、Fetch、Agent 和 Browser 四项能力整合进一个插件。该插件让 Grok Build 的编码智能体接入实时网络,可在终端中跨任意网站作业。
LlamaParse 在 UI 中上线批量解析功能,单次可对最多 10,000 个文件执行解析或抽取,指定文件夹即可运行,无需编写代码。该功能面向所有付费方案开放。
Hugging Face 建议开发者在网站或应用中添加「Sign-In with Hugging Face」OAuth 按钮,让社区成员可便捷地分享邮箱、创建模型或数据集仓库、在 Buckets 中存储数据,甚至启动 GPU 支持的 Jobs。相关接入文档见 huggingface.co/docs/hub/en/oauth。
腾讯开源 AngelSpec 端到端投机解码框架,同时支持训练与部署。在 Hy3-A21B 上,DFly 在 4 至 64 的并发测试区间实现 1.98–2.40× 端到端加速,吞吐量较 DFlash 高 10.5–11.8%。训练代码与 Hy3-A21B MTP/DFly drafter 权重已发布于 GitHub、Hugging Face 和 ModelScope。
Genspark 联合创始人兼 CTO Kay Zhu 在 TBS CROSS DIG with Bloomberg 采访中表示,挑选模型不该是用户的工作:便宜模型负责主要任务,前沿模型只在能带来最大价值时调用,Genspark 会自动为每个任务路由到不同模型。他称按此方式同一套幻灯片成本可降至 1/5(5x less)。
Dify 北美总经理 Andy Wang 将在拉斯维加斯 Ai4 与 A.P. Moller - Maersk 的 Mark Sear 对谈,主题为 "From Pilot to Production: A Case Study with Maersk",分享 Maersk 如何把 AI 从试点推进到全公司生产部署及其业务回报。
Agent 正成为企业里的"数字同事",但现有身份系统难以描述它:agent 同时包含人的委托和工作负载两类主体,却常用长期 API key 直接继承用户的全部权限。
Jina AI 推出 jina-reranker-v3.5,保持 0.6B 参数规模和 LBNL 列表式架构,专门解决垂直领域适配、结构化记录逻辑识别和长列表显存爆炸三大工程痛点。
Scott Wu 发帖调侃称,传闻在累计合并第 10,000 个 Devin PR 后会获得一件纪念品。该帖由 xgo.ing 统计,获得 443 次点赞、29 条回复、13 次转发和 31,429 次浏览。
一次企业级智能知识库项目的总体设计实践表明,企业级知识库的真正门槛不是支持多少文件格式或单次测试准确率,而是能否建立知识持续进入、使用、发现问题并优化的运行机制。
Weaviate 发布教程,演示跳过转录直接对音频做嵌入和检索。流程包括把原始音频切成重叠片段、用 Gemini Embedding 2 生成多模态嵌入向量、存入 Weaviate 并支持文本或音频查询检索相关片段,最后用 Gemini 3 Flash 基于检索到的音频生成回答。示例使用 Robert Frost 诗歌《Birches》的录音,同一方法可用于播客、访谈、课程和通话录音等音频集合。
Martin Fowler 发布新文章,指出 Subagents 常被"节省时间"和"并行执行"来论证价值,但 @techygarg 认为真正关键的是保护 orchestrator 的上下文。文章由 martinfowler.com/articles/orche 发布。
播客对谈百度智能云 AI 计算首席科学家王雁鹏,讨论从模型时代到 Agent 时代的底层技术演变。他认为这一代 AI Infra 与上一代不同,是以 GPU 为核心构建,需要以 CPU 消耗窥见 Agent 诞生的真实价值,并梳理 Anthropic、OpenAI、Google 的路线差异以及国内多芯适配与开源生态的两大差异。
HelloGitHub 第 124 期收录 32 个开源项目,涵盖 C、C#、C++、Go、Java、JavaScript、Python、Rust、Swift 及 AI 等分类。
vLLM社区维护者游凯超以Inferact联合创始人兼首席科学家身份受访,讲述这个伯克利校园开源项目用近3年从一篇算法论文变成开源社区、再变成公司。Inferact今年初完成1.5亿美元种子轮融资。访谈还讨论了开源项目商业化后的抉择,以及AI Infra与模型结构、Harness Engineering的联合设计。
LlamaIndex 发布 create-llama-worker,可快速脚手架生成一个 Cloudflare Worker,并配置用于 Parse、Classify 和 Extract。用户通过 `npm create @llamaindex` 生成、配置后即可部署,无需样板代码和繁琐设置。
微软研究院(MSR)牵头的 AI Foundations for Power Grids 研讨会已获 NeurIPS 2026 接收,正在征稿,截止 8 月 29 日。征稿方向包括 benchmark、模型训练、可靠性、基础模型与真实部署。
Epoch 与 METR 发布 MirrorCode 基准,用于评估 AI 完成长时程编程任务的能力,Claude Opus 4.7 用 14 小时、251 美元推理成本解决了一项 METR 和 Epoch 估计人类需 2 至 17 周完成的任务,25 个目标程序中有 8 个始终未达 100% 通过阈值。
WAIC 2026 现场超节点成展商标配,继华为 CloudMatrix 384 后今年超 10 家厂商跟进,券商称 2026 年为「国产超节点元年」。节目对比 NVL72 与 CloudMatrix 384:后者单卡算力仅 B200 约 30%,总算力却是 NVL72 的 1.7 倍,系统参数已超但 CUDA 生态未破,产能与软件生态分化或致洗牌快于自动驾驶。
Google Gemma 本周下载量突破 9 亿次,官方称即将达到 10 亿。博主 Patrick Loeber 同期发布博客,介绍如何将 Gemma 4 作为本地编程智能体运行。
Zabbix 中国官方插件市场一次性上线 14 款自研原生扩展插件,覆盖 AI 智能告警分析、网络交换机可视化、主机导入导出、性能报表、资产盘点、品牌 Logo 定制等场景,全部以 Zabbix 原生模块部署,无需修改核心源码,兼容 7.0LTS。
开源项目 pireel/pireel 是一款纯前端运行的口播视频(Talking-head)AI 编辑器,草稿与素材仅存本地浏览器(OPFS/localStorage),通过 WebCodecs 直接导出视频。
有意思小周刊 vol.170 提出面向 React Native 项目的 AI 需求开发闭环实践:把 PRD、接口文档、Figma 输入转化为可审阅的「需求规格」,并设人工门禁做需求审阅与架构确认,再依次执行代码生成、编译验证和视觉审计,形成从需求到可验证代码的人机协作流水线。
月之暗面发布 Kimi K3,一个 2.8 万亿参数的多模态模型,具备 1M token 上下文窗口和原生视觉能力。
读者可看到 2.8T 参数开源模型在发布当天上线的推理性能数据与 Moonshot 的架构取舍,理解大模型可服务性背后的工程细节。
Node.js 新版 API 文档预览已在 beta.docs.nodejs.org 上线,内容仍由 nodejs/node 仓库的同一批 Markdown 文件生成,新增内置搜索、全站统一设计、llms.txt,并支持 JavaScript 禁用与离线访问。
LiteParse v2.8.0 的图像转 PDF 功能不再依赖 ImageMagick,改用 Rust 原生实现,转换速度提升 1.2× 至 7.2×,具体取决于图像格式。此举让 LiteParse 距离完全自包含、零外部系统依赖更近一步。使用 LiteParse 的用户可升级并前往 GitHub 查看项目。
开源项目 opencodex 发布,作为通用 LLM 代理中间件,让 Codex(CLI、App、SDK)和 Claude Code 用户自由使用 Anthropic Claude、Google Gemini、xAI Grok、DeepSeek、Ollama 等任意大语言模型。
Slack 设计团队没有采用自上而下的 AI 培训,而是搭建了一个允许困惑、鼓励探索的学习社群。团队开设周五活动「会 Vibe 的设计师 & AI」,并在 2026 年推出为期三天的 Builder Days,让设计师、工程师和产品经理放下路线图,用 AI 一起动手造东西。其经验是:不要从工具赋能开始,而是先给设计师一个可以安心当新手的地方。
Qdrant 用 580 万条真实 Amazon 服饰商品搭建了 Qdrant Shopping 演示店铺,每次文本搜索都是对 Query API 的单次请求,约 40 毫秒返回排序货架,代码已开源于 GitHub。
千里智驾 CTO 杨沐在 WAIC 对话中提出,智驾的终局是物理 AI,L4 可能比 L3 更快落地。他回顾智驾从前视到 BEV 再到端到端的三代演进,并指出特斯拉在北美的第一梯队地位到中国后因数据闭环受阻而难以为继。谈及世界模型与 VLA,他认为关键不在让车"更聪明",而在于用"司机+领航员"结构应对上车后的模型幻觉。
LlamaIndex 为开发者工具包新增 Go SDK、Java SDK 和 CLI,可用几行代码或直接在终端解析文档。用户获取 API key 后即可通过 LlamaParse 开始解析。
Google Gemini 上线新代码仓库(github.com/google-gemini/…)及配套 API 文档(ai.google.dev/gemini-api/doc…),面向开发者开放。
微软正在推进 MAI 系列模型的落地,覆盖 PowerPoint、OneDrive、Bing、Dragon Copilot 等产品。PowerPoint 图像模型成本较 GPT-Image-2 下降 84%,OneDrive 保存率提升 26%、延迟降低约 25%,Bing 已将其作为默认模型。Dragon Copilot 转写模型支持 58 种语言,多语言临床转写错误率减半。
腾讯最新模型 Hy3 已在 OpenCode 上线,可在 Go text 中调用,支持 256K 上下文。该消息由 Hunyuan 官方账号发布。
Manus 推出 Plan Mode,让智能体在动手构建前先规划,把粗略想法转成清晰方案。官方称它会先研究可行性、提示用户没想到的边界情况,并能从一句话生成完整方案;方案未经确认不会进入执行,网页端和移动端均已上线。