Gemini 3.5 Flash-Lite 演示处理 100 万+ 图片的视觉任务
Google 用 Gemini 3.5 Flash-Lite 演示大规模重复性视觉任务,在 100 万+ 张商品目录图片上批量提取原始特征并转化为干净的结构化数据。该模型以低延迟和 token 效率满足大规模工作流需求。
Google 用 Gemini 3.5 Flash-Lite 演示大规模重复性视觉任务,在 100 万+ 张商品目录图片上批量提取原始特征并转化为干净的结构化数据。该模型以低延迟和 token 效率满足大规模工作流需求。
月之暗面在 Kimi K3 开放日发布 Kimi K3 模型权重与技术报告,并开源支撑其训练的关键 Infra 技术 MoonEP、FlashKDA 和 AgentEnv。
月之暗面公开最强模型的权重与技术报告,并同时开源三项训练 Infra 技术,读者可据此了解其规模效率的实现路径。
月之暗面发布 Kimi K3,一个 2.8 万亿参数的多模态模型,具备 1M token 上下文窗口和原生视觉能力。
读者可看到 2.8T 参数开源模型在发布当天上线的推理性能数据与 Moonshot 的架构取舍,理解大模型可服务性背后的工程细节。
一个用 Gemini 3.6 Flash 构建的多智能体系统可实时迭代可玩游戏设计。它调用 Gemini 3.5 Flash-Lite 依据玩家实时操作来设计、构建并验证解谜关卡,在快节奏环境中兼顾速度与推理能力。
智象未来 HiDream 创始人梅涛在访谈中提出"图片是入口,视频是过程,世界模型是终局",认为语言、视频、具身终将汇聚。他 2017 年做出全球首篇文生视频论文 TGANs-C,如今带队探索取消外部 VAE 的 UiT 架构,并称架构领先只能维持六个月。他判断多模态仍处 GPT-2 阶段,"像素没有统计意义",世界模型更像一组模型家族而非单一模型。
微软正在推进 MAI 系列模型的落地,覆盖 PowerPoint、OneDrive、Bing、Dragon Copilot 等产品。PowerPoint 图像模型成本较 GPT-Image-2 下降 84%,OneDrive 保存率提升 26%、延迟降低约 25%,Bing 已将其作为默认模型。Dragon Copilot 转写模型支持 58 种语言,多语言临床转写错误率减半。
Gemini Notebook 上线 Galaxy Z 系列折叠屏手机,用户可在应用内拖放来源,一键生成播客、幻灯片、测验等内容。Galaxy Z 用户还可获赠 6 个月 Google AI Pro。
Poe 宣布 Google DeepMind 的 Gemini 3.6 Flash 和 Gemini 3.5 Flash-Lite 已在其平台上线。Gemini-3.6-Flash 被描述为 Google 的新主力模型,在编码、知识工作和多模态表现上更强,并改善了 computer use。
Google DeepMind 发布 Gemini 3.6 Flash、3.5 Flash-Lite 和 3.5 Flash Cyber,主打规模构建 AI 智能体的效率、延迟与可靠性。
阶跃星辰在 WAIC 2026 展区(H1 馆 C107)展出大模型原生智能体手机 STEPX Neo,搭载全球首个智能体原生操作系统 Step AOS,内置智能体阶跃Amoo,为首批通过《人工智能终端智能化分级》L3 级别测试的智能体手机。
通义实验室发布面向实时双工交互的端到端全模态理解与生成模型 Wan-Streamer v0.2,把听、看、说、演统一进单个 Transformer,端到端响应延迟为 550ms(200ms 模型延迟加 350ms 网络延迟)。
Thinking Machines 发布多模态模型 Inkling,可跨文本、图像和音频模态高效推理,全量权重已开放,并可在 Tinker 上微调。林俊旸(@JustinLin610)对此表示称赞,同时追问小模型为何没有开源。
Thinking Machines 推出开放权重模型 Inkling,定位为在广泛能力类别上表现扎实的基础模型,可用于实际使用与定制。Inkling 能跨文本、图像和音频模态高效推理,官方公开完整权重,并已在 Tinker 上开放微调,同时提供 Inkling Playground 供试用。
阶跃星辰将在 WAIC 2026 展出 Step 系列模型矩阵,覆盖云端与端侧、多模态理解与生成,并带来号称全球首个智能体原生操作系统的 Step AOS。获本届 WAIC“镇馆之宝”的智能体手机 STEPX Neo 首次线下公开亮相,同时联合吉利、千里科技升级汽车智能体并上线极氪 8X。展位为上海世博展览馆 H1 馆 C107。
Thinking Machines 发布通用多模态模型 Inkling,接受文本、图像和音频输入并输出文本,Modal 提供 Day 0 支持,以按 token 计费的 Managed Endpoint 形式上线。
Google AI Developers 介绍 Gemini 3.5 Live Translate,它不再逐句翻译文本,而是实时处理原始音频,从而消除延迟并保留说话者自然语音的细节。推文同时展示了开发者基于它构建多语言应用的情况。
AI Talk 创始人赵汗青以自研虚拟歌手 Yuri 尤栗为例,讲述如何用 AI 合成形象与声线,并通过「撞种子」筛选和对话叙事构建「硅基人格」,其核心资产是人格化设定而非形象本身。他认为虚拟偶像短期优势是不会塌房、成本可控,但长期价值在于「AI 味儿」这种区别于人类的表达逻辑,一旦开放实时对话则可能因缺乏底线思维而「塌房」。
TorchV 的 AIS 知识引擎把企业文档解析拆成解析引擎、解析实例、解析策略三层,策略按文件类型路由,PDF 可走 MinerU 并开启公式、表格、图片理解,Word 走 TorchV 默认解析,Excel 走 TextIn,音频走 Qwen ASR。
阶跃星辰发布面向手机、汽车等终端场景的端侧模型全家桶 Step Edge,包含 Step Edge 基础模型、Audio、GUI、Gen 四款模型。官方称其支持低至 0.1 秒的端侧本地 toolcall 执行,文本、视觉、语音等多模态信息可本地处理,并配套自研 Step Inference NPU 引擎用于推理优化。
Character.AI 推出互动动画微剧《Last Summer》,讲述六位好友在最后一个夏天追查一封匿名情书作者的故事,现已在移动端 App 及 c.ai/series 上线。该剧由 xgo.ing 提供技术支持。
Character.AI 上线 series、fm 和 reads 三项功能,用户可观看原创微短剧并与角色聊天、收听连载音频剧、逐章阅读小说。新 Library 标签页已提供超过 50 个故事,可通过 c.ai/series、c.ai/fm、c.ai/reads 访问。
Meta Superintelligence Labs 发布 Muse Spark 1.1,这是 Muse Spark 的升级版多模态推理模型,主打智能体任务,在工具使用、计算机操作、编码和多模态理解上有明显提升。
Meta 发布 Muse Spark 1.1 并开放 Meta Model API 公测,读者可了解其百万 token 上下文与多智能体编排能力。
Seedream 5.0 Pro 已上线 Replicate,支持基于区域的编辑、分镜(storyboarding)、高级多层图像分离,以及最多引用 10 张图片的图像生成。
Mistral 发布首个具身导航模型 Robostral Navigate,这是一个 8B 机器人导航模型,可引导机器人自主执行自然语言指定的任务,仅需单个 RGB 摄像头,并在 R2R-CE 上达到 SOTA。
字节跳动 Seed 发布多模态图像创作模型 Seedream 5.0 Pro,在图文匹配、结构合理性、文字渲染与画面美感上全面提升。四大核心能力包括复杂信息可视化、交互式精准编辑、真实影像与人像质感、原生多语种输入与生成,支持十余种语言的直接输入与渲染。模型已上线火山方舟体验中心,并陆续在豆包、即梦上线。
英伟达 RTX Spark 以 1 Petaflop 算力和 128GB 统一内存,让消费级 PC 本地跑 120B 至 200B 参数大模型成为可能,端侧 AI 硬件就位。
Andrej Karpathy 称赞某模型的 three.js 环境生成能力属于顶级水平,认为每一代新模型层级都会带来质的跃升和惊喜。他指出模型能仅凭互联网知识就将其理解转化为 xyz 坐标、meshes、transforms、动画、特效与交互式小故事,并对更高模型层级能创造什么感到惊叹。
Poe 宣布 Claude Fable 5 和 Gemini Omni Flash 现已上线该平台。Fable 5 是 Anthropic 最强大的模型,短暂下线后重新向公众开放;Gemini Omni Flash 支持对话式视频创作与编辑,官方将其比作 Nano Banana 的视频版,借助世界理解实现真实运动与一致性编辑。
LLM 基于对话训练导致行业把所有 AI 能力塞进聊天框,但文本输入与输出各有代价:空白输入框让用户猜能力、须把模糊想法翻译成精确提示词,长文本回复则把解读负担转嫁给用户。文章提出用任务审计和输入/输出对齐矩阵两种工具,按用户当下意图匹配模态。
一目科技创始人兼 CEO 李智强在播客中提出,机器人运动能力已接近 90 分、灵巧手 59 分,而「大脑」只有 30 分,缺的正是物理世界的触觉信息。他主张「视触觉」本质仍是触觉,靠弹性皮肤形变与光影读取力与纹理,与视觉互补;行业正从 VLA 向加入 Tactile 的 VTLA 演进,触觉数据则靠大量纯视觉预训练再叠加触觉微调。
B站大语言模型团队将在 ACL 2026 展示 FATE 系列成果 SABER 与 CASTER,并现场开放「B-UP 顶尖技术人才项目」校招与实习岗位投递。SABER 提出可切换、受 Token 预算约束的混合思考训练范式,实验显示 FastThink 模式在 MATH、GSM8K、MBPP 及逻辑推理任务上推理长度减少 65%~80% 同时保持甚至提升准确率。
Google DeepMind 发布 Nano Banana 2 Lite(gemini-3.1-flash-lite-image)和 Gemini Omni Flash(gemini-omni-flash-preview)两款模型。
官方给出两款新模型的价格、延迟与定位差异,读者可据此判断图像到视频链式工作流的成本与适用边界。
NotebookLM 推出 Short Video Overviews,可将复杂资料转成 60 秒竖屏视频,深入讲解任意概念。该功能正向 Google AI Ultra 和 Pro 订阅用户推送,覆盖移动端与网页端,免费用户后续开放。
屠龙之术播客围绕世界模型展开讨论,追问它为何在此时成为热点,并将其与大语言模型在数据层面等维度做对比。节目援引李飞飞对世界模型的分类与定义,并以即将上市的自动驾驶公司 Momenta 的三层架构 R7 世界模型为例,介绍其业务飞轮与壁垒主张。对于"是否到了 GPT 时刻",节目判断短期场景集中在自动驾驶与互动内容,终局为三线合一、不会赢家通吃,GPT 时刻尚未到来。
Meta 发布 Brain2Qwerty v2,这是可从非侵入式脑记录实时解码句子的端到端流程,实现 61% 的词准确率,而其他非侵入式方法为 8%,表现最好的受试者达到 78%。
OiiOii 创始人、前字节剪映负责人闹闹在播客中复盘了 Sora 之后视频模型的路径之争,认为 Seedance 基本是 Sora 2 的升级版,可灵则走专业领域优先路线,而 Sora 关停是生态失败而非技术失败。
Mistral 发布 OCR 4,其 API 与 Mistral AI Studio 中的 Document AI 即日起可用,并已登陆 Amazon SageMaker 和 Microsoft Foundry。Snowflake Parse Document 支持即将推出,同时支持单容器自托管,文档无需离开本地环境。
Mistral 将 OCR 4 与同类系统正面盲测,独立标注者对 600+ 份真实文档、12+ 种语言进行排名,OCR 4 在所有被测系统中胜率最高,平均胜率 72%。
Mistral AI 发布 Mistral OCR 4,可通过边界框、区块分类和内联置信度分数生成结构化输出,支持 170 种语言。
字节跳动 Seed 团队正式发布 Seed2.1 系列模型,定位面向真实生产力场景的智能体,Agent 与 Coding 能力全面提升。官方称其通用 Agent 可完成项目规划、文件处理、工具调用等多步骤任务,Coding 端到端交付覆盖需求理解、功能实现、bug 修复、运行环境搭建和结果验证,多模态理解、知识、推理等基础能力也有提升。