Qwen3.8-Flash-Next 获得 SGLang day-0 部署支持
Qwen 宣布 Qwen3.8-Flash-Next 当天即可通过 SGLang 部署,并对 SGLang 的 day-0 支持表示感谢。
Qwen 宣布 Qwen3.8-Flash-Next 当天即可通过 SGLang 部署,并对 SGLang 的 day-0 支持表示感谢。
vLLM 宣布在发布首日即支持阿里 Qwen3.8-Flash-Next,并已在 NVIDIA 和 AMD GPU 上验证。
Qwen3.8-Flash-Next 现已支持通过 SGLang 部署,SGLang 作为首日合作伙伴同步支持 Qwen4 的新架构预览。阿里 Qwen 团队对 SGLang 的首日支持表示感谢。
阿里发布 Qwen3.8-Flash 的开源权重,这是一个多模态 MoE 模型,也是 Qwen4 架构的早期预览版,生产版本将随后通过 QwenCloud API 提供,定价为输入 $0.16/1M tokens、输出 $0.47/1M tokens。
这条内容汇总了 Qwen3.8-Flash 的架构变化、激活参数与基准分数,便于对照同类开源模型的性价比路线。
阿里 Qwen 团队发布 Qwen3.8-Flash,这是一个多模态 MoE 模型,也是 Qwen4 架构的早期预览,现已开放权重。模型总参数 125B,另有 51B N-gram 嵌入,每个 token 仅激活 6B;生产版本将很快通过 QwenCloud API 提供,价格为每 1M 输入 token 0.16 美元、每 1M 输出 token 0.47 美元。
Qwen3.8-Flash 以 6B 激活参数和低价 API 给出成本效率数据,并开源权重预览 Qwen4 新架构。
腾讯混元把主打端侧的翻译模型 Hy-MT2-1.8B 通过 2-bit 与 1.25-bit 两套极低比特量化方案压缩到几百 MB,翻译质量接近无损。
Ollama 已内置网页搜索,用户可用开源模型执行研究任务,原有功能继续保持可用。该功能通过 ollama.com/blog/claude-de… 公布,官方称常见使用方式不受影响。
吴恩达团队的 OpenWorker 是不只聊天、还能在本地电脑上完成任务的开源智能体,现已发布新版本,加入多项面向安全流程的功能。新版内置三类网络安全智能体:扫描代码漏洞、扫描依赖项中的供应链注入、检查云安全配置的攻击面,让开发者在上线前完成更多安全工作。
hermes 的记忆配置推荐选 mem0,内置的 MEMORY.md 和 USER.md 默认继续与其并行运行。mem0 提供三种模式:Mem0 Cloud、通过 Docker 自托管服务器,以及用自有 LLM、embedder 和向量库的完全开源进程内方案。
IBM Granite 4.2 已在 Ollama 上线,提供 3B、8B、30B 三种参数规模的开源模型,面向企业智能体场景。模型免费使用,研究用途与商业用途均可授权。其数据整理与训练流程专门针对企业场景和定制需求设计,并纳入治理、风险与合规(GRC)评估。
Qdrant 自 v1.13 起在自托管实例支持 GPU 加速 HNSW 索引,Qdrant Cloud 也在今年 4 月将其作为托管选项上线。GPU 擅长大规模并行处理,能同时写入大量 HNSW 图的节点与边,从而缓解切换嵌入模型时全量重建索引的耗时与成本。
Milvus 宣布将 MemSearch 接入 DeepSeek Harness(DSH),为其提供持久记忆和把重复经验转化为可复用 Skill 的路径。MemSearch 保存三类记忆:跨会话发生过什么、项目与用户仍成立的事实、以及重复频率高到足以成为 Skill 的工作流。
Ollama 宣布其 token 用量正爆发式增长,并称更好的模型、更多应用与 harness 选择以及全私有化部署是推动因素。官方表示这只是一切的开始,将继续保持这一破纪录势头,并对即将到来的众多模型表示期待。
Andrew Ng 表示,Marin 项目在模型训练上展现了开放性,公开了代码、数据、配方乃至实验结果。
SemiAnalysis 发布 AgentX 1.0,称其为全球首个完全开源、100 万上下文的多轮智能体编码推理基准,Apache 2.0 许可,数据集与全栈工具投入超 300 万美元。
22 岁的 RoboParty 萝博派对创始人兼 CEO 黄一在一年内完成 5 轮融资、累计超 1 亿美元,股东包括小米、宁德等产业方。他称这段经历是"压缩的人生",把十年要吃的苦一年吃完,并认为对行业认知尚不清晰时的"愚昧之巅"反而最适合创业。
Percy Liang 宣布 Marin 535B-A23B 本周开始训练,全程开放。预训练(80%)加中期训练(20%)共 18.75T tokens,用 11 套 GB200 NVL72 跑约 3 个月,约 2.7e24 FLOPs,之后进行后训练。
Ollama 宣布与 Poolside AI 工程师合作推出开源模型,并称与 NVIDIA 团队在 Nemotron 上的合作同样令人期待。《华尔街日报》报道称,Poolside 与相关方达成一项范围广泛的协议,旨在在美国构建可与中国的重量级厂商及美国 AI 巨头竞争的开源人工智能生态。
SemiAnalysis 按早期扩展、推理、智能体三个时代分别用当时的基准和自建评测栈给模型打分,发现开源模型追上每个时代首个闭源模型所需时间逐代减半:早期从 Llama-2-70B 到 Llama-3.1-405B 历时一年多。
Jim Fan 转发 Dantong Niu 等人的 T-Rex:Tactile-Reactive Dexterous Manipulation,针对多数 Vision-Language-Action(VLA)模型忽略触觉反馈或无法响应高频接触信号的问题,给出数据与架构两方面的方案。
Jim Fan 宣布开源名为 T-Rex 的触觉方法,将触觉作为模型的一等公民:其 mixture-of-transformer 以异步双时钟运行,慢速视觉运动专家规划动作,快速触觉专家以每个视觉 tick 4 个触觉 tick 的高频修正实时细化动作。
Milvus 3.0 将全文搜索与语义检索合并进同一个引擎,可在单次查询中同时使用原生 BM25 与向量检索。Zilliz EMEA 解决方案架构师 Simon Hearne 在线上分享中演示了混合检索、分组、schema 灵活性与搜索效率等能力,并与 Elasticsearch 在相同数据集、嵌入向量、分析器和计算资源下做了对比。团队可在单一引擎内完成关键词搜索、语义检索、过滤、分组与排序。
Qdrant 1.19 支持 turbo4 数据类型,将稠密向量以每维度 4-bit 存盘,仅为 float32 存储量的八分之一。
Naval 认为前沿实验室有动机渲染恐惧,因为恐惧能为闭源路线提供道德正当性,而中国实验室则一致采取开源、对所有人有利的立场。这让小玩家陷入不得不支持中国实验室的尴尬处境。
Ollama 发文欢迎 AT&T 加入开放模型,并转引 Amir Efrati 关于开源 AI 正在发生的评论。帖文称 Anthropic 和 OpenAI 最好指望 AT&T 只是例外而非普遍趋势。
Google DeepMind 的 Gemma 模型下载量正式突破 10 亿次。Ollama 称 Gemma 是最受欢迎的开源模型之一,并表示作为紧密合作伙伴一路同行,社区已将其用于水下到太空等各类场景。
Omar Sanseviero 透露 Gemma 模型累计下载量突破 10 亿次。他表示社区将模型用于水下运行到太空运行等众多场景,这些用例令人兴奋。
Qdrant 举办 Discord Office Hours,主题为 Qdrant 1.19 的最新功能与更新,时间为中欧夏令时 17:00,随后进行开放问答和社区讨论。更多 Qdrant 1.19 细节见官方博客。
DeepSeek Harness(DSH)发布了一套可热重载的 harness,设计成适合 coding agent 自己修改和进化的形态,以本地 Web UI 为主要入口,并提供标准、PTC/Code、极简、创造四个模式。
梳理 DeepSeek Harness 的插件化三层结构与 Creator 模式,读者可对照 Anthropic 路线理解两种 harness 设计取舍。
硅谷101 这期播客讨论 Token Maxing 热潮的转折:Uber 四个月烧穿全年 AI 预算,Meta 给员工设 token 上限,嘉宾黄东旭从每天烧三四百美元转向本地开源模型底座加前沿模型的搭配,日常任务每天电费约 1 美元。
腾讯混元 Hyra 在数学领域再获四项进展:3D Blaschke–Lebesgue 常数宽度体普遍下界从 0.380799w³ 提升至 0.411040w³。
Ollama 模型库新增 Kimi K3 页面,地址为 ollama.com/library/kimi-k3。该条目已获 21 个点赞、10871 次浏览,相关数据由 xgo.ing 提供。
智谱 GLM-5.3 正式上线并开放 API,在 Artificial Analysis Intelligence Index 中取得 60 分,进入全球前沿模型能力区间,与 Claude Fable 5、GPT-5.6 Sol 处于同一水平,并与 Kimi K3 并列开源模型第一。
Next.js 16.3 于本月发布,带来 Instant Navigations,由 Cache Components 与 Partial Prefetching 驱动,让页面在点击前就把 UI 预取到浏览器,获得 SPA 般即时导航,同时保留 Server Components。
Hugging Face Hub 上的模型数量已突破 300 万。官方称社区正在加速迈向开放、分布式的未来,让开放 AI 无处不在、人人可用。
艾语智能创始人张天乐在对话中讲述公司如何服务六七十家金融机构、每月从 3000 个法院提起立案 1 到 2 万件,按回款约 30% 拿佣金,并坚持不做 AI 电话催收。
8 月 20 日(周四)在旧金山,Ollama、FriendliAI、NVIDIA 与 OpenHands 的四位工程负责人将围绕开源模型、编码智能体和 AI 基础设施展开讨论,主题是编码智能体走向生产需要什么,以及开源模型如何改变 AI 原生工程的经济性。活动含观众问答与社交环节,名额有限,需通过 RSVP 链接报名。
Qwen 3.8 27B 在 Artificial Analysis 上取得 52 分。作者指出,这是首次有能在笔记本本地运行的模型基本与最强的模型持平,本地且开放权重的模型已足以完成多数日常任务。
Nathan Lambert 认为,开源语言模型(带完整训练配方)更像开源操作系统,而开放权重模型只是基于它构建的软件版本,二者不应混为一谈。Nvidia 据报投入 260 亿美元推进近乎开源的 Nemotron 等模型,目的是让无数公司都能造"token 机器",从而持续拉动其芯片需求。
Alejandro AO 对 Mem0 架构做了完整拆解,涵盖持久化记忆存储、基于 LLM 的摄入、语义与 BM25 混合检索、实体加权以及本地开源模型等环节。内容按章节形式呈现,从智能体记忆的基本概念讲到具体检索实现。