跳到正文

#部署/工程

今日 0 条
9月15日周二
  1. LlamaIndex 🦙(@llama_index)AI 评估 · 40/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    LlamaIndex 提出两遍式即时 OCR:LiteParse 快速首扫,LlamaParse 按需精解

    LlamaIndex 提出两遍式 just-in-time OCR 方案,替代先解析全部页面的传统管线。第一遍由免费开源的 Rust 工具 LiteParse(支持 50+ 格式)做布局感知快速扫描,输出空间文本、边界框、标题、表格及每页复杂度标记,整个数据房间 32 秒完成;第二遍由 LlamaParse 按页码只精解需要的页面,返回单元格级表格、边界框和置信度分数。

9月14日周一
  1. Milvus(@milvusio)AI 评估 · 38/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Milvus 教程:用 MemPalace 为编码智能体搭建项目记忆宫殿

    MemPalace 把项目知识按"宫殿"结构组织:wing 对应项目或知识库,room 归类相关主题,drawer 将原始内容切成可检索的小块,Milvus 在背后存储文本、嵌入向量和元数据。

  2. Arthur Mensch(@arthurmensch)AI 评估 · 8/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Arthur Mensch:企业不按节奏自建自拥 AI 模型与系统,就不会有末日

    Arthur Mensch 表示,企业若不把控自建并自拥 AI 模型与系统的节奏,就不会迎来属于自己的"末日"。该帖获 1033 次点赞、130 次转发,浏览量 88401。

  3. Perplexity(@perplexity_ai)AI 评估 · 38/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Perplexity Windows 应用上线 Portable Computer,端侧推理需 NVIDIA RTX GPU 24GB 显存以上

    Perplexity Windows 应用新增 Portable Computer 功能并已开放上手使用,其端侧推理要求配备 NVIDIA RTX GPU 且显存不低于 24GB。

  4. AI炼金术AI 评估 · 37/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    鹿客陈彬:把一家 12 年的硬件公司,重写成 AI 原生组织

    鹿客科技创始人陈彬在公司十二周年提出"从 1 到 0",把这家做了 12 年智能锁的公司重写成 AI 原生组织,新设 HARO 统管人与 AI,一号位由百度架构师出身的技术人担任,IT 改名 AIO 负责 agent builder。

  5. Naval(@naval)AI 评估 · 21/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Christian Catalini:责任敞口趋近 0 时,验证预算崩塌,部署者把未监控的智能体涌入"失控风险区"

    Christian Catalini 指出,当无人为未经验证的失败付出代价、责任敞口趋近 0 时,验证预算就会崩塌。此时部署者会把未监控的 AI 智能体大量投入"失控风险区"(Runaway Risk Zone),获取自动化的收益,却把灾难性风险社会化。他在分析 AGI 经济学时认为,AI 大幅降低了任何易验证事项的执行成本,其余场景的瓶颈则是验证。

  6. 百度AIAI 评估 · 28/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    百度与IFAW"濒危物种AI守护官"数字平台发布:可识别34类物种,准确率86.5%

    百度与国际爱护动物基金会(IFAW)合作的"濒危物种AI守护官"数字平台正式发布,可识别34类濒危野生物种,覆盖活体动物及相关制品,整体识别准确率达86.5%,支持电脑端和移动端使用。

  7. 阿里云开发者AI 评估 · 63/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    DeepSeek-V4.1-Flash 上线千问 AI 平台,API 与 Token Plan 同步开放

    DeepSeek-V4.1-Flash 正式上线千问 AI 平台,相关 API 服务与 Token Plan 同步开放,开发者可通过 API 接入应用,也能在 Qoder、千问 APP、Codex 等工具中直接调用 Token Plan。

  8. 夕小瑶科技说AI 评估 · 47/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    实测5款国产世界模型:蚂蚁 LingBot-World 2.0、阿里 HappyOyster 1.0、腾讯混元 HY-World 2.1、爱诗 R1 与开源 Zing-0.5 各有什么能耐

    夕小瑶科技说实测了5款已开放体验的国产世界模型:蚂蚁 LingBot-World 2.0、阿里 HappyOyster 1.0、腾讯混元 HY-World 2.1、爱诗 R1 和 8月26日开源的 Zing-0.5,从漫游、导演、联合控制三类能力评估输入还原度、运动一致性、物理合理性与导演表现。

  9. LangChain BlogAI 评估 · 42/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    LangChain 为 Managed Deep Agents 推出 Connections:托管凭证与按调用者身份

    LangChain 为 Managed Deep Agents 推出 Connections,把 API 凭证改为 LangSmith 工作区中按 slug 命名的连接,工具在运行时通过 connections.get() 读取。

  10. LangChain BlogAI 评估 · 32/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    LangChain 如何构建 GTM Agent:线索转化率提升 250%

    LangChain 基于 Deep Agents 构建了 GTM Agent,在 Salesforce 新线索触发后自动判断是否触达、汇集 Gong 通话记录与 LinkedIn 等上下文,并把带推理依据和来源的草稿发到 Slack 供销售审核。

  11. LangChain BlogAI 评估 · 28/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Credit Genie 如何用 LangChain OpenWiki 保持代码库文档常新

    Credit Genie 采用 LangChain 开源仓库文档智能体 OpenWiki,自动生成并维护代码库文档,替代此前容易过期的 Notion 页面、README 和 AGENTS.md。

  12. Satya Nadella(@satyanadella)AI 评估 · 27/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Satya Nadella 转发演示:Microsoft Foundry 如何让长时间运行的智能体满足企业级要求

    Microsoft Foundry 被指为最适合在企业中运行智能体的平台,可让长时间运行的 agent 推理、行动并调用工具。其可观测性与治理能力覆盖多智能体、多模型工作流,从可访问范围、数据流向、行为可重建到成本预算控制均有对应答案,并将安全防护、可审计和 FinOps 从系统搭建之初就纳入。

  13. 强少来了AI 评估 · 19/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    AI产品经理的PRD怎么写|有意思小周刊vol.171

    「有意思小周刊」vol.171 汇总了 AI 产品经理 PRD 撰写方法:AI 产品面向概率性系统,不能沿用确定性功能的传统 PRD 思路,完整骨架含十个部分,其中场景定义与输入输出、能力与功能描述、效果要求、异常与降级设计、评测方案五块应占全文一半以上篇幅。

  14. Modal BlogAI 评估 · 25/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Modal 更新:Sandbox Sidecars 公测、Kimi K3 等模型支持与新版 Dashboard

    Modal 8 月更新为 Kimi K3、Qwen3.8-2.4T-A95B、GLM-5.3 和 GLM-5.3-Flash 四款开放权重模型提供 day-zero 支持,其中 Kimi K3 为 2.8T 参数多模态模型,支持 1M-token 上下文窗口,在智能体负载下达到 460 tokens/秒。

  15. Fireworks AI(@FireworksAI_HQ)AI 评估 · 29/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Fireworks AI 上线 Qwen 3.8 Max,与阿里云合作提供旗舰模型

    Fireworks AI 与阿里云合作,将 Qwen 最新旗舰模型 Qwen 3.8 Max 引入 Fireworks 平台,开发者即日起可通过 fireworks.ai 上的模型页面开始构建。双方称这一合作面向需要速度与生产级质量的开发者,可更快构建并弹性扩展。

  16. andrew chen(@andrewchen)AI 评估 · 26/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    本地 AI 实验的家用 Homelab 配置:Hermes、5090 eGPU 与 2x DGX Spark

    一套本地 AI 实验的 homelab 配置:Hermes 跑在 Framework Desktop Mainboard AI Max+ 395 上,5090 eGPU 以 Qwen 3.8 27B 提供最高 150+ tok/s 的 LLM 推理。

  17. SemiAnalysisAI 评估 · 44/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    为什么 4-hi HBM 会赢:SemiAnalysis 解析 HBM 堆叠高度趋势逆转

    SemiAnalysis 指出,AI 加速器的 HBM 堆叠高度趋势正在逆转:下一代 Rubin Ultra 每 GPU 仅配 192GB HBM,低于标准 Rubin 与 B300 的 288GB,8-hi 将取代 12-hi 成为新标准。

9月13日周日
  1. Junyang Lin(@JustinLin610)AI 评估 · 21/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    为什么人人都在做专用推理引擎?vLLM/SGLang 之外生态正在碎片化

    针对“过去一个月至少 5 个专用推理引擎发布”的现象,有开发者质疑为何要放弃 vLLM、SGLang 另起炉灶,认为这会碎片化生态、弊大于利。Junyang Lin 转评调侃称,原因是现在人们突然都会写 Rust 了。

  2. ollama(@ollama)AI 评估 · 31/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Amp 支持通过 BYOK 模型路由使用 Ollama 云端模型

    Amp 用户现可通过 Amp 新增的 BYOK 模型路由使用 Ollama 云端模型。BYOK 模式不设限制也不收费,并可构建可从任意位置控制的远程智能体。Amp 在用户自带算力与模型订阅/密钥时免费使用。

  3. Latent.Space(@latentspacepod)AI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Vinoo Ganesh 谈 Palantir Forward Deployed Engineer 的最佳实践

    在联合创立 Kepler AI 之前,Vinoo Ganesh 在 Palantir 领导 Spark 团队并打造了 Project Frontline——一个面向 Forward Deployed Engineer(FDE)的开创性项目。他在访谈中分享了 FDE 的最佳实践。

9月12日周六
  1. DeepLearning.AI(@DeepLearningAI)AI 评估 · 26/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Andrew Ng:最优秀的 AI 工程师不只是按规格写代码,而是塑造整个构建过程

    Andrew Ng 在 The Batch 最新来信中指出,最优秀的 AI 工程师不只是按规格写代码,而是塑造整个构建过程。他提出四项核心技能:驱动构建循环、做产品决策、广泛沟通、以及高主动性的主人翁意识。

  2. 浮之静AI 评估 · 32/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    pnpm 12.4:统一多语言开发工作流

    pnpm 12.4 将 npm、Python 和 Cargo 依赖安装收进同一套工作区配置,一条 pnpm install 即可处理三个生态的依赖,新增的 pipeline 负责安装后的构建与验证编排。

  3. Qwen(@Alibaba_Qwen)AI 评估 · 26/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Qwen3.8-27B 上线 Cerebras,实现快速推理

    Qwen3.8-27B 已在 Cerebras 上线运行,提供快速推理能力,用户可直接试用。该模型为开源模型,本次以“快速 + 开放”组合方式接入 Cerebras 推理平台。

  4. Fish Audio(@FishAudio)AI 评估 · 36/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Wan 3.0 上线 Fish Creative,成本比 Seedance 2.5 低 79%

    Wan 3.0 现已在 Fish Creative(@FishCreativeHQ)上线,官方称其成本比 Seedance 2.5 低 79%。更低的成本意味着用户可以尝试更多不同角度,找到自己满意的画面。

  5. 阿里云开发者AI 评估 · 17/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    云栖大会千问AI平台分论坛:重磅产品首发与 Qwen 共创计划发布

    云栖大会千问AI平台分论坛将于 9 月 23 日 9:50—12:00 在杭州国际博览中心一期 3F 308 举行,千问AI平台最新产品能力首次集中公开,Qwen 共创计划同步发布并开放报名。

  6. Browser Use(@browser_use)AI 评估 · 31/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Browser Use Cloud 云智能体免登录保持认证:同步本地 Chrome cookie,智能体看不到密码

    Browser Use Cloud 支持云智能体在不登录的情况下保持认证状态:先在本地 Chrome 登录,再把本地 cookies 同步到云端,智能体全程看不到用户密码,用户也保持登录。该功能已在 Browser Use Cloud 上线。

  7. Augment Code(@augmentcode)AI 评估 · 23/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Augment 联创 Igor Ostrovsky:修 bug 智能体为何烧不掉团队积压

    Augment CTO 兼联合创始人 Igor Ostrovsky 指出,软件工厂能高效清空 issue 积压,关键却不在修复代码本身,修复实现是修 bug 中最不重要的环节。他认为单靠一个修 bug 智能体难以真正烧掉团队的 bug 积压。

  8. Augment Code(@augmentcode)AI 评估 · 26/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Augment Code 的 Cosmos:两步一提示词搭建软件工厂

    Augment Code 的 Cosmos 用两块屏幕和一个提示词就能搭起"软件工厂":连接代码仓库、创建环境、描述你想要的工厂。Advisor 会挑专家、写配置、自动应用,遇到需要决策时再询问你。

  9. NVIDIA AI(@NVIDIAAI)AI 评估 · 15/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    NVIDIA TensorRT Model Connect:从视频到语音,更快构建

    NVIDIA 推出 TensorRT Model Connect,用于加速从视频到语音的模型构建流程。该工具以“From Video to Voice: Build Faster with TensorRT Model Connect”为主题进行直播分享。

  10. ChatGPT(@ChatGPTapp)AI 评估 · 59/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    ChatGPT Sites 上线三个月创建超 500 万站点并发布多项更新

    ChatGPT 官方宣布 ChatGPT Sites 上线三个月以来用户已创建超过 500 万个站点,并发布了一批更新:可以邀请团队成员协同编辑、保存和发布共享站点,可将站点设为私有并只邀请指定人员访问,从提示词到部署的时间缩短一半,可让 ChatGPT 检查站点数据库(编辑者也能查看),并支持绑定自定义域名。

  11. SemiAnalysisAI 评估 · 47/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Nvidia 的兜底宇宙:我赢,输的是谁?

    Nvidia 在 10-Q 中披露的资产负债表外担保总额已达 530B 美元,较上季度的 184B 大幅跳升。增量主要来自三项:供应与产能承诺从 119B 升至 279B(以内存为主),担保从 3.5B 升至 108.5B(涉及 SB Energy 在俄亥俄州的 4.25 GW 园区,租给 OpenAI 二十年),并首次出现 36B 的 AI 云协议和 20B 的数据中心租约。

  12. Windsurf(@windsurf_ai)AI 评估 · 12/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Windsurf 在桌面端和 CLI 推出 Fusion

    Windsurf 宣布 Fusion 已在桌面端和 CLI 上线,用户可通过 devin.ai/download 获取。原文未披露模型版本、参数规模或价格等细节。

  13. Windsurf(@windsurf_ai)AI 评估 · 51/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Devin Desktop 与 CLI 推出 Fusion,编码基准成本最高降低 39%

    Cognition 在 Devin CLI 与 Devin Desktop 中推出 Fusion,官方称其为面向 Fable 与 Astra 的最高效 frontier harness,在各项编码基准上成本最高降低 39%。

9月11日周五
  1. AWS Architecture BlogAI 评估 · 26/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    用 Amazon Bedrock AgentCore 把零样本预测变成采购订单

    AWS 展示了一套库存自动化架构:用零样本时序基础模型 Amazon Chronos2 做概率需求预测,再由 Strands Agents SDK 构建的 Supervisor、Preprocessing、Forecasting、Reporting 四个 LLM 智能体在 Amazon Bedrock AgentCore 上编排确定性工具,把预测转成可审计的采购订单。

  2. 京东技术AI 评估 · 24/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    京东零售产品经理实战:PRD 四步法与 Skill 沉淀,34 人日压缩到 15 人日

    京东零售产品经理用 PRD 四步法加 Skill 沉淀,把一批覆盖接需求、沟通、交互、文档与评审的需求从 34 个人日压缩到 15 个人日,并通过评审且质量未打折。方法分三层:Prompt 到 Context 再到 Harness,人负责判断与复核,AI 负责初稿、追问与遗漏检查。核心场景是需求文档撰写与交互设计,可复用经验沉淀为 Skill。

  3. 大淘宝技术AI 评估 · 41/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    让 Agent 像人一样记忆:本地长期记忆系统 HL-Mem v1.1 的设计与取舍

    大淘宝技术直播技术团队开源了本地长期记忆系统 HL-Mem(Apache-2.0),对应 v1.1 系列,采用事实与经验双通道架构,用不可变 Event 加可更新 Claim 实现证据可追溯、有效时间与记录时间双时间可解释,以及记忆的修正与遗忘。系统默认仅依赖 SQLite 单文件部署,配后台异步 Worker 处理去重、冲突消解与生命周期管理,运行时独立、本地优先,并支持中文检索。

  4. ollama(@ollama)AI 评估 · 72/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    DeepSeek-V4.1-Flash 在 Ollama 云全面上线

    DeepSeek-V4.1-Flash 已在 Ollama 云全面上线,托管于美国与欧洲,承诺 prompts 和 responses 不记录、不用于训练。按 token 计费与 DeepSeek API 一致并含 off-peak 定价,可通过 Ollama 的 Pro、Max、Team 套餐或免费账号按量付费使用。

  5. Junyang Lin(@JustinLin610)AI 评估 · 17/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    模型架构过度复杂会带来 eval 无法测出的未知问题

    模型架构引入过多复杂性会带来连内部 eval 都无法测试的未知问题。但作者认为,随着基础模型越来越聚焦所谓 agentic 任务,有时可以为效率上的大幅收益接受这些小的未知成本。

  6. Simon Willison(@simonw)AI 评估 · 27/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Datasette 1.0a39 与 0.65.4 安全版本发布

    Datasette 发布 1.0a39 和 0.65.4 安全版本,此前使用 Claude Fable 5.1、GPT-5.6 Sol 和 GPT-6 Astra 进行了大规模审计,并修复了多种 bug。在公开网站上运行 Datasette 实例的用户应尽快升级。