Mistral AI Now Summit 将于 5 月 28 日在巴黎举行,门票已开售
Mistral 的 AI Now Summit 将于 5 月 28 日在巴黎举办,门票已开售。活动内容包括技术深度分享,以及 Mistral 创始人谈大型组织的 AI 驱动转型、公司发展路线和即将发布的新产品。参会者可获得部署和扩展 AI 的实操技巧与用例洞察。
Mistral 的 AI Now Summit 将于 5 月 28 日在巴黎举办,门票已开售。活动内容包括技术深度分享,以及 Mistral 创始人谈大型组织的 AI 驱动转型、公司发展路线和即将发布的新产品。参会者可获得部署和扩展 AI 的实操技巧与用例洞察。
去哪儿酒店团队用 FFmpeg + RTMP 推流、开源流媒体服务器 SRS 搭建数字人直播底座,通过 GOP 设为 50、开启 min_latency 低延迟模式并配合前端预加载,把端到端延迟从 10 秒降到 3 秒、实现首屏秒开。SRS 单进程可扛数千路并发,Origin 节点用 forward 功能一路转推抖音、视频号、淘宝等多平台,并支持 SIGUSR2 热升级与推流端双活容灾。
Poe 平台现已上线 Z.ai 的旗舰模型 GLM-5.1,主打智能体工程,在 SWE-Bench Pro 上取得 state-of-the-art 结果,并在仓库生成和真实终端任务中表现领先。
Physical Intelligence 与 Modal 合作构建基于 QUIC/UDP 的专用传输通道,替代 TCP,实现机器人与云端 GPU 容器之间的持久双向连接,网络开销仅约 10-15ms。
MongoDB 已将预测性自动扩缩容在 MongoDB Atlas 投产,利用负载的周期与趋势模式在副本集过载前提前扩容,缩容仍由现有响应式算法负责。该能力源于 2023 年的原型研究,当时评估了哪种机器学习模型预测效果最好,并估算其对性能与客户成本的改善。
Modal 上线 NVIDIA RTX Pro 6000 Blackwell,96GB VRAM,可一行代码指定 GPU 类型,适合推理与微调。Sandbox Filesystem API 进入 Beta,支持读取 5GB 文件、任意大小写入与双向流式传输。CLI 新增历史日志拉取与 --strategy recreate 部署策略。
mem0ai 发布 mem0 CLI,让智能体在终端中完成记忆的添加、搜索与检索,并可记住智能体和开发者的偏好。该工具主打 agent-first、由 JSON schema 驱动,已开源,可通过 npm install -g @mem0/cli 安装使用。
用户可通过 llama-server -hf ggml-org/gemma-4-26b-a4b-it-GGUF:Q4_K_M 启动模型,再用 openclaw onboard --non-interactive 以 custom-api-key 方式完成接入。
Cursor 推出 Cursor 3,被描述为更简单、更强大,面向所有代码都由智能体编写的世界,同时保留开发环境的深度。该版本由 Cursor 团队在社交平台公布。
Poe 现已支持 @opencode,这是一款开源 AI 编码终端,可与 Poe 上所有主流模型配对。支持一键登录、即时访问,无需额外配置。
NVIDIA 联合 Berkeley、Stanford 和 CMU 开源了 CaP-X,采用 MIT 许可证,代码、论文与项目主页均已公开。论文编号为 arXiv:2603.22435。
Andrej Karpathy 回顾约一年前构建 menugen 的经历,指出最难的从来不是代码本身,而是把服务、支付、认证、数据库、域名等 DevOps 环节像拼 IKEA 家具一样组装起来。
Runway 与 Modal 合作,由 Modal 的 serverless 算力平台为 Runway Characters 提供实时推理支持。Characters 是 Runway 基于通用世界模型 GWM-1 打造的实时视频智能体 API,可从单张图片生成有表现力的数字人,无需微调,支持自定义声音、性格、知识和动作。
Jina AI 将于 4 月 18 日在北京 Elastic AI Tech Day 做今年首次系统公开技术分享,Jina Embeddings 已迭代至 v5 并成为 Elasticsearch 语义检索的默认向量模型,Jina Reranker v3 获 AAAI-2026 FrontierIR Workshop Best Paper。
我被时薪300的设计师兼职吸引,亲自加群试做 AI 陪练,结果一分钱没赚到、白亏了几十块。难点在于部署本地 AI 软件要在 Terminal 敲代码、配置依赖,折腾一整天才能勉强跑起来,而调用模型消耗的 Token 费用还得自己承担。作者认为这兼职可能真能赚钱,但实际时薪大概率没有300,也提醒想立即轻松赚钱的人多半会失望。
安全公司 Doppel 将大部分机器学习工作流迁移至 Modal,训练端用 map() 并行跑 K-fold 交叉验证等实验,推理端借镜像层缓存与模型权重持久卷把构建时间最多缩短 10 倍,复杂模型也能实现亚分钟级热构建。此前其 GCP 推理栈依赖 Cloud Run 单 GPU 实例,镜像构建常需 10–30 分钟,且面临冷启动与扩容延迟。
Lex Fridman 发布了对 NVIDIA CEO 黄仁勋的访谈,话题覆盖 AI 全栈工程、内存、电力与供应链(TSMC、ASML 等),以及 AI 扩展定律及其最大阻碍。对话还涉及黄仁勋的管理方式、NVIDIA 的护城河、中国与台海、太空 AI 数据中心,以及"NVIDIA 市值会到 10 万亿美元吗"、AGI 时间表、编程的未来、意识与死亡等话题。
本地智能体在未来数月将变得越来越重要,隐私始终是关键。Zach Mueller 公布 Qwen3.5 27B 使用 UnslothAI K_XL 量化的 PinchBench 结果,取 3 次最佳、开启 thinking:Q3_K_XL(14.5GB)和 Q4_K_XL(18GB)可用,Q4_K_XL 平均约 84% 表现最佳,Q3 可行,Q2 表现最低。
MiMo-V2-Pro、MiMo-V2-Omni 和 MiMo-V2-Flash 三款模型现可在 Poe 全平台 App 及 Poe API 中使用,对应入口分别为 poe.com/MiMo-V2-Pro、poe.com/MiMo-V2-Omni 与 poe.com/MiMo-V2-Flash。
小米 MiMo V2 系列模型已在 Poe 上线,包括主打快速低成本的 MiMo‑V2‑Flash、面向图文音视频混合媒体的 MiMo‑V2‑Omni,以及上下文最高 1M tokens 的 MiMo‑V2‑Pro。Pro 可读取大型代码库与长报告、规划多步智能体任务并执行深度研究,Flash 适合文档摘要、代码重构与批量工单处理等高吞吐场景。
Poe API 现已推出 API Key 管理功能,用户可为 OpenClaw、Codex、Claude Code、Open WebUI、Cherry Studio、脚本等不同工具分别创建独立密钥。同一账号即可管理多个密钥,工作流更清晰,密钥管理入口为 poe.com/api/keys。
Kuse.ai 与 Junior.so 联创兼 CTO 宇豪在访谈中复盘了如何零融资将 Kuse.ai 做到千万刀 ARR,并把「Agent as Workforce」体验封装进新产品 Junior.so。
METR 三名研究员以约 200 小时时间跨度的 AI 进行了 2 小时沙盘推演,模拟 12-18 个月后的工作方式,获得约 3-5 倍效率提升。推演中 AI 在可验证任务上表现为 200 小时达 50% 成功率、40 小时达 80% 成功率,速度为 Claude 4.6 Opus 快速模式的两倍,写作能力在有上下文时相当于 METR 初级员工。
Next.js 16.2 发布,next dev 启动速度提升约 400%,服务端组件渲染提速 25%–60%,并包含 200 多项 Turbopack 修复与改进。
基于对 Hacker News 和 Reddit 上 110+ 社区讨论的分析,多数应用会比预期更早触达 pgvector 的极限。维持 pgvector 舒适运行需同时满足六个条件:向量数据低于约 1M、不需要精确的元数据过滤、嵌入向量与关系数据紧耦合、不需要混合搜索、Postgres 已承担核心业务逻辑、团队小且 SQL 搜索逻辑可控。
37signals 将 Campfire、Writebook、Fizzy 以宽松许可证开源后,又推出名为 ONCE 的应用服务器,可在单台机器甚至笔记本上同时运行这一整套应用。该服务器提供终端界面查看 RAM、CPU 占用及访客数与每秒请求数,并支持零停机升级和定时备份,一条命令即可安装。
Manus 宣布推出桌面应用 Manus Desktop,并将 AI 智能体从云端放到用户本地机器上。核心功能名为 My Computer,定位是运行在本地的 AI 智能体。
Bassim Eledath 提出智能体工程从 Tab 补全、智能体 IDE 到上下文工程、复合工程、MCP 与技能、Harness Engineering、后台智能体直至自主智能体团队的 8 个等级路径。
Qdrant 发布一套边缘到云端视频异常检测架构,把异常检测重构为向量最近邻搜索,无需针对具体异常类型标注或重训。
播客《三五环》第 219 期单口节目讨论 OpenClaw:主播刘飞自己买了台 Mac mini 养了几只虾,把这款产品从 Clawdbot、Moltbot 到 OpenClaw 的时间线和爆红过程拆了一遍。
Citrini Research 认为 AI 光互连交易已成熟拥挤,下一个非对称机会在更底层的光子学供应链,包括光子组件、基板与资本设备,以及 CPO 成为必需品后的受益企业。其互连篮子自发布以来已涨逾三倍,年内迄今上涨 35%,领涨的是 Lumentum。超大规模厂商 2026 年资本支出预计达 6500 亿至 7000 亿美元,该机构同时建议对部分早期标的不必再追高、考虑获利了结。
Qdrant 宣布完成 5000 万美元 B 轮融资,由 AVP 领投,Bosch Ventures、Unusual Ventures、Spark Capital 和 42CAP 参投。
Hugging Face 上线 Storage Buckets,提供类 S3 的可变存储,主打快速写入、覆盖写和目录同步,由 Xet 去重驱动,使连续 checkpoint 可跳过已存在的字节。官方称该方案比 Git 更适合 AI 高吞吐场景,覆盖 checkpoint、处理后的数据、智能体 trace 和日志等,且成本更低、速度更快。
《硬地骇客》EP123 围绕“小龙虾”(OpenClaw)现象展开讨论,涉及 Karpathy 的“钢铁侠战衣”观点、CLI 与 MCP 之争、文件系统回归以及 SaaS 软件的潜在冲击。节目还探讨了 Agent 定价的虚拟员工与按席位收费思路,以及 OpenClaw Hub 技能商店的安全隐患。
Google 发布 Gemini Embedding 2 公开预览版,这是 Gemini 家族首个全多模态嵌入模型,可将文本、图像、视频、音频与 PDF 映射到统一向量空间,Qdrant 在发布首日即提供支持。
这是稀疏嵌入微调教程第二部分,使用 Amazon ESCI 数据集在 Modal 无服务器 A100 GPU 上训练 SPLADE 模型,以 Exact 和 Substitute 商品对作为正样本进行对比学习,10 万样本训练成本约 0.35 美元。
该系列第二部分展示了在 Modal 无服务器 GPU 上训练 SPLADE 稀疏嵌入模型的完整流程,训练数据为 Amazon ESCI 数据集,包含 120 万+查询-商品对及四级相关性标注。
微调稀疏嵌入在 Amazon ESCI 数据集上比 BM25 提升 28%,这是五部分系列的第一篇。SPLADE 通过 MLM 头加 log saturation 与 max pooling 生成约 30,522 维中仅 100-300 个非零值的稀疏向量,并自动扩展查询词、抑制噪声,而 BM25 只能匹配字面出现的词。
Modal Sandboxes 推出 Directory Snapshots,可单独快照指定目录并在新 Sandbox 中独立于基础镜像挂载,便于分离系统依赖与应用代码、预热 Sandbox 池并加快初始化。
Daytona 将于 2026 年 3 月 9 日在勇士主场举办首届 Daytona COMPUTE 大会,聚集 1,500 名开发者,主题是为 AI、智能体和新型云重建基础设施层。门票申请链接已在推文中给出。