Contrastive Language Models 上线 Hugging Face
Contrastive Language Models 已在 Hugging Face 发布,项目主页为 huggingface.co/Contrastive-LM。该发布帖获得 549 点赞、49 次转发和 17 条回复,浏览量约 57860。
Contrastive Language Models 已在 Hugging Face 发布,项目主页为 huggingface.co/Contrastive-LM。该发布帖获得 549 点赞、49 次转发和 17 条回复,浏览量约 57860。
NVIDIA 发布 NV-Reason-CT,一款面向放射科医生链式推理的开源 3D CT 视觉语言模型。当前通用前沿模型在 3D CT 这类体成像上表现不佳,多数开放医疗 AI 模型也缺乏相应能力。
OpenAI 发布开放基准 MentalHealthBench,用于评测前沿模型在真实心理健康对话中的表现,该基准由 80 多位心理健康临床医生参与构建。OpenAI 将其公开,供其他研究者审查方法、自行评测并在此基础上继续研究。
Hugging Face 推出新 JS 包 huggingface/lerobot,可在浏览器中直接读取 Hub 上的 LeRobot 数据集,无需下载。官方给出的示例是用约 600 行 JS 在该包之上实现一个自定义查看器 UI,并建议把编码智能体指向它来快速构建。
Jina AI 开源端到端文档解析模型 jina-ocr-v1,总参数 3.4B、每 Token 仅激活 570M,在 OmniDocBench v1.6 得 91.14 分、olmOCR-Bench 得 83.4 分,均刷新同级别最佳成绩。
LlamaIndex 的 LiteParse v2.14.6 成为全球最快 PDF 解析器,基于文本的 PDF 解析速度提升约 25%,实测达到 2.8ms/页,比次快的本地解析器快 1.5 倍。该工具可将 PDF 转为 Markdown,开源并支持在 Python、Node.js、Rust 或浏览器中本地运行。
Jerry Liu 发布开源库 DocJev,用于按自然语言类别规则对文档进行分类或切分子文档边界,默认完全免费且开源。作者称其比 gpt-5.6-luna 快 6 倍且准确率相当,并提供 liteparse 与 LlamaParse 两种 OCR 后端,其中 liteparse 免费开源、速度最快,LlamaParse 面向复杂文档。
Milvus 团队把 Jev 集成进 DeepSearcher、MemSearch 和 Vector Graph RAG 三个开源项目做验证。在 DeepSearcher 的 100 道多跳问题上,Jev 以 93.25% Recall@5 追平 DeepSeek V4 Flash,中位决策延迟从 2.23s 降至 0.55s,API 成本约为其七分之一。
LiteParse v2.14.6 让文本型 PDF 解析速度提升约 25%,实测处理速度达 2.8ms/页,比次快的本地解析器快 1.5 倍。该开源工具可在本地以 Python、Node.js、Rust 运行,也可直接在浏览器中使用。
mem0 发布 DolphinBench 基准测试,配套上线官网、排行榜与数据集,并开放运行与提交入口,代码仓库和论文同步公开。
Browser Use 称开源 MiMo v2.6 系列模型成为新的帕累托前沿,其中 MiMo v2.6 Flash 得分 37.6,Grok 4.7 为 39.9。其记录的智能体成本比 Grok 4.7 低 57 倍,比 DeepSeek v4.1 Flash(low)便宜 27%,每任务 $0.10 对 $5.72,两项对比各跑 60 个任务。
Transformers 与 ggml 合作,通过在 `kernels` 库中调用 GGML kernels,让 GGUF 模型加载从反量化改为直接运行,性能追平 llama.cpp。此前 Transformers 已支持加载 GGUF 文件多年,这次改动由 @_marcsun 完成。
网易有道推出语音产品"叭哥说",把语音从"转文字"推进到"转意图",用户先说完整段内容再由系统整理成可用文本,PC 端已上线并承诺语音输入场景终身免费。同期升级的 Hi Echo 转向个性化口语学习系统,并已与启元机器人合作进入机器人场景。
小米正式发布并开源 Xiaomi MiMo-V2.6 系列,包含 Pro 和 Flash 两个原生全模态模型,定位为探索 RSI(递归自我改进)路径的关键一步。
小米开源 MiMo-V2.6 系列,公开 RL 算力扩展细节与 6 天 Live 训练实测数据,可观察开源模型追赶闭源的一条路径。
作者开源了awesome-seedance项目,用真金白银复现463条AI视频提示语,蒸馏出14个覆盖各类视频的提示语模版和25个Skills。项目每条提示语都经过实测复现并打分分类,用gpt、claude、grok、deepseek四个多模态模型复测打分、聚类和起标题,每天自动收录GitHub、抖音、小红书、X上带提示语的case。
Jerry Liu 发布开源库 DocJev,用于文档分类与切分,速度比 gpt-5.6-luna 快 6 倍且精度相当。用户只需给出文档和自然语言类别规则,Jev 即可预测文档类别或子文档边界,并支持 liteparse 与 LlamaParse 两种 OCR 后端。
小米发布开源模型 MiMo-V2.6-Pro,支持文本、图像、音频、视频多模态输入,权重已上传 Hugging Face。Artificial Analysis 称其以智能指数 46 成为开源权重模型榜首,较前代 MiMo-V2.5-Pro 的 26 大幅提升,每任务成本 0.13 美元,位于智能与单任务成本帕累托前沿。
小米开源新模型以远低于同级的 token 价格进入智能成本帕累托前沿,可据价格与榜单位置观察开源与闭源的成本差距。
微软研究院在 Nature 发表逆合成模型 RetroChimera,将 Transformer 的 R-SMILES 2 与基于 GNN 的 NeuralLoc 通过可学习集成排序结合,预测结果优于任一子模型。
关停的初创公司 eidon.ai 将 1,274 小时第一人称视角机器人数据开源,包含 13,451 段人类完成日常任务的录制,作为送给机器人社区的礼物。数据已发布在 Hugging Face 上。
Convai Innovations 开源了非自回归 System 1 决策模型 Laya,含 421M 参数,基于 ModernBERT-large 主干和 RLCD 训练概率输出,GPU 推理延迟 33~38 毫秒,采用 Apache 2.0 协议,可在本地部署。
ConvAI Innovations 已在 Hugging Face 发布模型权重,并在 GitHub 提供配套代码仓库。原文未披露模型名称、参数量与具体可用范围,仅给出两个平台链接。
Eyeball 已开源,项目地址为 github.com/dvelton/eyeball。该消息由 GitHub 发布,原文未披露更多功能、参数或可用性细节。
Remix 团队成员 Brooks Lybrand 撰文质疑"Just let AI use React"的说法,认为 AI agent 不用框架会自行拼凑"土法炮制"的框架,因此需要具备更优抽象与约束的新一代框架。
Stanford AI Lab 提出 Context-Sharded Block Parallelism(CSBP),一种面向扩散 LLM 的分布式并行策略,训练加速随上下文长度增长而提升。
MiniMax Code CLI 的 v0.4.12 版本面向全球开发者开放,并以 MIT 协议开源,它是 MiniMax Code 客户端的核心组件,源码已发布在 GitHub。
browser-use 开源了 Jev,它通过将"思考"与"下一步动作"拆分,由大模型负责复杂推理,小模型只负责从页面真实按钮中挑选点击、输入、滚动等操作。该方案面向浏览器智能体、自动 QA、交易循环、Agent 路由等需要反复选择动作的场景,已有 NewMax 正在接入。
Tony Dinh 用 Jev 做了一个开源 Chrome 扩展,实时监听 YouTube 音频、检测赞助片段并自动跳过,每条视频成本约 $0.005。该项目为原型、采用 BYOK 模式,代码已发布在 GitHub。
Browser Use 创始人 Gregor Zunic 发布实测视频,展示浏览器 Agent 查询真实航班机票从打开网页到返回结果只用 7 秒,1 倍原速无快进,单次成本 0.0039 美元。
Anthropic 将全部代码发布在 GitHub(github.com/anthropics/upl…),完整结果见于其技术报告(www-cdn.anthropic.com/d8ca26d0d20570…)。原文未披露具体模型名称、参数规模或 benchmark 分数。
Browser Use 与 Jev 合作推出了一款超高速开源浏览器智能体,实测完成航班查询仅需 7 秒、成本仅 $0.0039。该智能体采用每步新动作空间与 DOM 状态空间设计,并支持小型 LLM 回退输入。
Browser Use 与 Jev 合作推出 Ultrafast 浏览器智能体,作者称其查询航班耗时 7 秒、花费仅 0.0039 美元,视频为 1 倍速播放。该智能体引入新的每步动作空间和 DOM 状态空间,并在输入环节回退到小模型,作者称已构建一个开源浏览器智能体并开放试用。
Unsloth 放出配套免费 Google Colab Notebook 与 GitHub 仓库,并提供专门文档页,供用户上手其微调流程。
Perplexity 推出 CobbleDB,这是一款专为重复批量读取 prepared page records 打造的数据库,用于优化其搜索负载的性能与成本。Perplexity 计划将 CobbleDB 开源,供其他构建 AI 搜索的团队使用。
LlamaIndex 提出两遍式 just-in-time OCR 方案,替代先解析全部页面的传统管线。第一遍由免费开源的 Rust 工具 LiteParse(支持 50+ 格式)做布局感知快速扫描,输出空间文本、边界框、标题、表格及每页复杂度标记,整个数据房间 32 秒完成;第二遍由 LlamaParse 按页码只精解需要的页面,返回单元格级表格、边界框和置信度分数。
小红书 AllSpark 团队发布 Search Agent Iris,权重与评测代码已开源,并计划陆续公布数据与训练完整配方。
Credit Genie 采用 LangChain 开源仓库文档智能体 OpenWiki,自动生成并维护代码库文档,替代此前容易过期的 Notion 页面、README 和 AGENTS.md。
Hugging Face 上出现 Qwen3 的量化版本,显存或统一内存较小的设备也能运行。该模型页面为 huggingface.co/HauhauCS/Qwen3…,适合本地部署场景。
Thomas Wolf 分享了一款新的端侧本地 AI 智能体系统,运行一个量化到 4 bit 的开源 4B 模型(MLX)。该系统的作者 Sigil Wen 称其为"on-device AI OS"Underdog,完全本地运行,起因是他对云端数据被用于训练、邮件和 iMessage 被采集以及 AI 攻击能力的担忧。
大淘宝技术直播技术团队开源了本地长期记忆系统 HL-Mem(Apache-2.0),对应 v1.1 系列,采用事实与经验双通道架构,用不可变 Event 加可更新 Claim 实现证据可追溯、有效时间与记录时间双时间可解释,以及记忆的修正与遗忘。系统默认仅依赖 SQLite 单文件部署,配后台异步 Worker 处理去重、冲突消解与生命周期管理,运行时独立、本地优先,并支持中文检索。
LangChain 分享的案例显示,Credit Genie 的编码智能体过去只能靠猜来理解代码库,如今改为直接查询 OpenWiki。这条内容聚焦企业在实践中如何采用和使用 OpenWiki。