Ian Goodfellow:Aisle 比 Mythos 更早用 LLM 找漏洞,小参数量开源模型加结构化搜索即可胜任
Aisle 比 Mythos 更早开始用 LLM 挖掘漏洞,其团队称用公开可得、开源衍生的模型匹配了 Mythos 在公开零日漏洞(CVE)上的表现,并可在需要时离线运行。Ian Goodfellow 指出,从工程角度看,小型开源权重模型配合结构化搜索系统在这类任务上已具备竞争力。相关方还称一项 Berkeley 研究在 8 个类别中的 3 个将其评为全球第一。
Aisle 比 Mythos 更早开始用 LLM 挖掘漏洞,其团队称用公开可得、开源衍生的模型匹配了 Mythos 在公开零日漏洞(CVE)上的表现,并可在需要时离线运行。Ian Goodfellow 指出,从工程角度看,小型开源权重模型配合结构化搜索系统在这类任务上已具备竞争力。相关方还称一项 Berkeley 研究在 8 个类别中的 3 个将其评为全球第一。
Antigravity IDE 最新版本已按此前承诺加入更清晰的配额仪表盘,用于查看额度使用情况。该消息来自 Varun Mohan 的社交媒体发布,未披露具体版本号与仪表盘细节。
字节跳动 Seed 团队正式发布 Seed2.1 系列模型,定位面向真实生产力场景的智能体,Agent 与 Coding 能力全面提升。官方称其通用 Agent 可完成项目规划、文件处理、工具调用等多步骤任务,Coding 端到端交付覆盖需求理解、功能实现、bug 修复、运行环境搭建和结果验证,多模态理解、知识、推理等基础能力也有提升。
Qdrant 发布 Qdrant Edge,把其 Rust 向量检索引擎做成嵌入式的进程内库,在本地磁盘打开 shard 即可写入和查询嵌入向量,全程离线,安装体积约 11 MB,目前处于 beta 阶段,可通过 pip install qdrant-edge-py 或 cargo add qdrant-edge 安装。
播客「牛油果烤面包」第151期与前 iOS 工程师 Shihang 一起聊 WWDC26,逐项点评 macOS Golden Gate、Liquid Glass、Spotlight、Apple Intelligence、Siri AI、App Intents、Shortcuts、Safari、照片、iCloud 以及儿童账号与屏幕使用时间等更新,并讨论了 AI 使用场景。
阿里通义团队介绍在 MNN 推理引擎中开启 Arm SME2 指令集加速,让 Qwen3-VL-4B 多模态模型在支持 SME2 的旗舰手机上实时推理。文章给出从引擎编译、模型转换量化、adb 推送到构建 Android APP 的完整流程,并附实测数据:在 vivo X300 上 Prefill 阶段提速 81%,Decode 阶段提升 13%。
苹果在 WWDC26 上宣布 Siri 的 AI 升级将接入谷歌 Gemini 而非 OpenAI,同时 iPhone 17 Pro 塞进了史无前例的 20B 端侧模型,并采用苹果自研 MoE 架构、未让谷歌插手。Siri 还新增摄像头入口与全局上下文能力,Xcode 模拟器已支持双倍宽度,被指为折叠屏硬件铺路。这很可能是库克以 CEO 身份主持的最后一场 WWDC,九月后由硬件负责人特努斯接任。
Google DeepMind 于 6 月 10 日发布实验性开源模型 DiffusionGemma,采用文本扩散方式一次性生成整块文本,在专用 GPU 上推理速度最高提升 4 倍。
Google DeepMind 发布 Gemma 4 12B,一款面向笔记本本地运行的统一无编码器多模态模型,视觉与音频输入直接进入 LLM 主干,不再依赖独立编码器。
Gemma 4 12B 用无编码器架构把多模态能力压进 16GB 显存笔记本,读者可判断本地智能体部署的可行边界。
Jina AI 推出基于 jina-v5-omni 嵌入向量的本地多模态文件搜索工具,完全离线运行,可索引文本、PDF、图片、音频和视频。
安克创新创始人兼CEO阳萌接受张小珺4小时访谈,他是1982年生人、2011年开始创业,如今掌舵一家市值超过600亿人民币的科技企业。访谈涵盖消费电子的死与生、第三类公司、端侧模型、产品方法、游戏模式,以及他在范式变化下的产品与组织方法论思考。
Google 发布 Gemma 4 12B,这是一个统一的无编码器多模态模型,采用 Apache 2.0 许可,可直接在笔记本电脑上运行。该模型定位在端侧效率与高级推理之间,Jeff Dean 称其为能力很强的开放权重模型。
DeepSeek 正以极致压缩 KV 缓存换取硬件自主:据测算,1.6T 参数的 DeepSeek V4 在 100 万上下文、8-bit KV 精度下只需 5.48 GB HBM,而 GLM5 需 60 GB、Qwen3-235B-A22B 需 89 GB。
理想汽车创始人李想做客罗永浩播客《十字路口》,介绍已完成从汽车公司向 AI 和具身智能公司的阶段性转型,并发布新一代旗舰 SUV L9 Livis。L9 Livis 搭载理想自研马赫 M100 芯片,算力达 2560 TOPS,配备全球首个完全体全线控底盘与 800V 主动式悬架系统,定位五十万元左右档位。
Adam D'Angelo 发帖表示,希望自己能直接告诉 Waymo 走 280 号公路而不是 101 号。该帖获得 2103 个赞、72 次转发和 66 条回复,浏览量约 10.15 万。
字节跳动 Seed 发布原生全双工语音大模型 Seeduplex,基于边听边说框架,实现听说同步,已在豆包 App 全量上线。官方称相比上一代半双工豆包端到端语音模型,其误回复率和误打断率减少一半、抢话比例下降 40%、判停响应快约 250ms,对话流畅度与判停 MOS 分分别提升 12% 和 8%,通话满意度绝对提升 8.34%。
本地智能体在未来数月将变得越来越重要,隐私始终是关键。Zach Mueller 公布 Qwen3.5 27B 使用 UnslothAI K_XL 量化的 PinchBench 结果,取 3 次最佳、开启 thinking:Q3_K_XL(14.5GB)和 Q4_K_XL(18GB)可用,Q4_K_XL 平均约 84% 表现最佳,Q3 可行,Q2 表现最低。
Qdrant 发布一套边缘到云端视频异常检测架构,把异常检测重构为向量最近邻搜索,无需针对具体异常类型标注或重训。
NVIDIA 团队训练了一个 42M 的 Transformer 模型 SONIC 用于控制人形机器人全身动作,并开放代码和模型检查点。该模型以人类动捕数据做逐帧监督,将运动跟踪作为全身控制的统一可扩展任务,数据本身即隐含奖励函数。
42M 模型用人类动捕数据替代手工奖励设计,并开源代码与检查点,对具身智能研究者是可复用的训练范式。
Taalas Inc. 发布公司首款产品,并演示了聊天机器人与 API 接入入口。该推文引述其官方说法称价格为每 100 万 tokens 0.0075 美元,公司规模为 24 名专职人员,开发投入 3000 万美元,强调极端专用化、速度与能效。
Jina AI 推出 Small & Nano 两款小尺寸嵌入模型,针对端侧检索、浏览器内搜索和边缘部署等受限内存场景。模型权重已在 HuggingFace 开放,包含 GGUF 和 MLX 格式,技术细节见配套博客与 arXiv 论文。
Jina AI 发布第五代嵌入模型 jina-embeddings-v5-text,面向 sub-1B 多语言嵌入推进质量与效率边界,提供 small 和 nano 两个版本。该模型已在 Elastic Inference Service、vLLM、GGUF 和 MLX 上线。
MongoDB 与 ObjectBox 达成集成,为边缘 AI 和离线优先应用提供云端与设备端的数据同步能力。ObjectBox 是专为边缘计算打造的高性能端侧数据库,内置本地向量数据库与数据同步功能,支持 C++、Swift、Flutter、Python、Go、Java 等语言,可在离线时保持多设备数据一致。
去哪儿网构建了一套分层解耦、端云协同的端智能基础设施,由引擎层、基建层、应用层组成,支持 XGBoost、LightGBM 及 RNN、CNN、Transformer 等模型端侧推理,单次推理耗时控制在毫秒级,推理成功率保持 99.9%。在用户流失预测挽留场景中,端侧模型直接利用实时微观行为特征,单次推理耗时≤10ms,预测准确率较天然不下单概率相对提升 12%。
自动驾驶长期依赖数据飞轮与端到端模型,通过挖掘海量路测数据打补丁来提升能力,但这一数据优先路径正遭遇瓶颈:长尾场景成本剧增、泛化能力受限。作者主张从自动驾驶2.0的“数据优先”转向以推理为核心的3.0,需要推理能力、常识、长时程记忆与解释交互四大支柱。英伟达2025年10月发布Alpamayo-R1,将显式因果推理与轨迹规划整合进统一VLA架构;特斯拉也计划在下一代FSD中引入推理增强。
Action&Link(动御科技)创始人戎思佳成为全网体感通关《黑神话》第一人,元旦当天其 B 站直播间冲上游戏区 Top1。他把自动驾驶中「视觉信号输入、控制信号输出」的技术迁移到游戏,用一枚 USB 实现体感操控,全球首款入门级全身体感游戏外设 Action&Link Portal 即将正式发布并已开放预约。
Mistral 推出号称全球最强的边缘模型 MiniStral,官方发布页为 mistral.ai/news/ministrau。该模型主打边缘设备部署场景,具体参数与可用性信息尚未在公布内容中披露。
本地运行的 Codestral 能实时生成 scikit-learn 和 Keras 代码,用于医学影像预测。该演示借助 Open Interpreter 新版本实现,这一工具让 LLM 在本地运行 Python、JavaScript、Shell 等代码,安装后执行 `interpreter --local` 即可在终端通过类 ChatGPT 界面调用本地 LLM。
开发者用 Raspberry Pico 加 e-ink 屏幕做了 raspberry-llm,通过调用第三方 LLM API 读取 WSJ 和 HackerNews RSS 内容并生成文本,最初用来做押韵时钟。