跳到正文

全部动态

今日 19 条
9月27日周日
  1. Recraft(@recraftai)AI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Recraft V4.1 Flash 实测:同一提示词下 1.3 秒出图的排版、时装、插画与品牌设计

    Recraft V4.1 Flash 在相同提示词下生成会"变形发声"的文字排版、带硬调编辑光影的金属箔头饰、花中抱膝女孩以及 O 字微笑的 MOKO logo,覆盖排版、时装、插画和品牌设计四类场景,单张出图耗时 1.3 秒且保持 Recraft 风格。完整提示词见评论区。

9月26日周六
  1. AICodeKingAI 评估 · 55/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Mimo V2.6 Pro 与 Flash 测试:开放权重模型

    Mimo V2.6 Pro 与 Flash 的测试内容,标题提出其是否为开放权重模型。由于原文正文未能抓取,暂无法提供更多细节。

  2. 逛逛GitHubAI 评估 · 63/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    开源决策模型 Laya 上线一周获近 2 万 Star

    TypeSafe AI 推出决策模型 Jev 后,开源项目 Laya 作为其开源版非自回归决策模型上线一周左右获得近 2 万个 Star,它不做文本生成,只根据输入文本和问题在几十毫秒内返回结构化答案和概率。

  3. Fireworks AI(@FireworksAI_HQ)AI 评估 · 69/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Fireworks AI 上线 MiMo-V2.6-Pro 按需部署

    Fireworks AI 宣布 MiMo-V2.6-Pro 即日起以按需部署形式提供。该模型在 AA Intelligence Index 上得分为 46,为开源权重模型中最高分,采用 1.02T 总参数、42B 激活参数的 MoE 架构,支持 1M 上下文与多模态,并以 MIT 许可发布,用户可在 fireworks.ai/models 开通端点。

  4. AK(@_akhaliq)AI 评估 · 51/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Qwen-Image-2.1-viggle-turbo v0.2 上线 Hugging Face,6 步完成文生图与图像编辑

    Qwen-Image-2.1-viggle-turbo v0.2 已在 Hugging Face 发布,支持文生图和图像编辑,仅需 6 步,比 40 步的 Qwen-Image-2.1 模型快约 5 倍。

  5. Recraft(@recraftai)AI 评估 · 21/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Recraft V4.1 Flash 实测:油画、报纸拼贴与复古字体生成

    Recraft 的 V4.1 Flash 模型被 @heathergreen 用于测试油画、报纸拼贴和复古字体三类图像生成,她表示其生成速度之快出乎意料。四张示例图分别为 T-Rex 泡泡浴油画、报纸剪贴拼出 "I AM THAT GIRL"、复古火柴盒风格 Bigfoot 插画以及复古唱片插画,提示词均附在其帖子中。

  6. Claude(@claudeai)AI 评估 · 10/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    这个周末你打算用 Opus 5.5 探索什么?

    Anthropic 发问:这个周末你打算用 Opus 5.5 探索什么?这条推文获得 248 个赞、80 条回复和 8.3 万次浏览。

9月25日周五
  1. Akshay Kothari(@akothari)AI 评估 · 17/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI 的 luna 模型被严重低估,智能/成本比极高

    OpenAI 的 luna 模型被严重低估,其智能与成本之比"高得离谱"。该观点来自 Akshay Kothari 的推文,未给出具体参数、benchmark 分数或定价数据。

  2. orange.ai(@oran_ge)AI 评估 · 20/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Claude Opus 5.5 用 JavaScript 逐帧绘制浏览器工作原理动画

    Claude Opus 5.5 用 JavaScript 逐帧绘制了一段卡通风格动画,40 秒讲清浏览器的工作原理。该演示由 Addy Osmani 分享。

  3. Vercel NewsAI 评估 · 51/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Pixel Canary 上线 Vercel AI Gateway 隐身通道并限时免费

    Vercel 在 AI Gateway 以 stealth/pixel-canary 形式上线 Pixel Canary,隐身期内限时免费,该模型擅长编码,包括构建应用、重构代码以及前端开发和移动端应用设计。

  4. Paul Couvert(@itsPaulAi)AI 评估 · 32/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    小米 MiMo 模型权重及量化 GGUF 版本发布

    小米 MiMo 基础模型权重已在 Hugging Face 上线,同时发布了量化 GGUF 版本,分别托管于 XiaomiMiMo/MiMo 与 bartowski/MiMo 仓库。两个链接均指向 Hugging Face 的模型发布页,方便开发者下载部署。

  5. Paul Couvert(@itsPaulAi)AI 评估 · 51/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    小米发布基于 Qwen-9B 的 9B 多模态模型

    小米发布一款 9B 模型,作者称其基于 Qwen-9B,可在 8GB 内存上运行。该模型采用 MIT 许可证,支持图像与文本多模态,在编码和智能体任务上表现不错,适合在笔记本等统一内存设备上本地离线使用。

  6. AK(@_akhaliq)AI 评估 · 51/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Pruna 发布 Pruna-Qwen-Image-2.1 少步 LoRA 适配器,图像生成提速最高 6.3 倍

    Pruna-Qwen-Image-2.1 是一组少步 LoRA 适配器,可让 Qwen-Image-2.1 的图像生成与编辑最高提速 6.3 倍,生成或编辑一张图只需 5 步或 8 步,而非原来的 40 步。5 步用于追求最高速度,8 步用于速度与质量的最佳平衡,Hugging Face 上有对应工作流可试用。

  7. Google DeepMind BlogAI 评估 · 74/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google DeepMind 发布 Gemini 3.8 Live with Live Avatar

    Google DeepMind 在 Gemini 3.8 Live 基础上推出 Live Avatar,把近实时视频生成与语音结合,让对话模型具备带唇形同步、自然表情和流畅轮次切换的动态视觉形象。

9月24日周四
  1. Recraft(@recraftai)AI 评估 · 31/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Recraft V4.1 Flash 上线 OpenRouter:1.3 秒出图,每张 $0.007

    Recraft V4.1 Flash 现可通过 OpenRouter 调用,官方称其为市面上最快的图像模型,每张图生成耗时 1.3 秒,价格 $0.007/image。该模型延续 Recraft 在摄影、人像、复杂场景、logo 和早期概念上的表现,面向高并发生成与快速迭代场景。

  2. Recraft(@recraftai)AI 评估 · 29/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Recraft V4.1 Flash 实测编辑类人像:即时生成,再 Refine 调出颗粒感

    Recraft 推出 V4.1 Flash,被称作目前市场上最快的图像模型,用户点击生成即可出图。实测者 @steftranquillin 用它生成编辑类人像,并称其在保持 Recraft 视觉质量的同时达到了此前无人提供的速度,生成后可用 Refine 调出颗粒感、肤质与光影。

  3. 卡尔的AI沃茨AI 评估 · 56/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    五大场景实测商汤 SenseNova U1 Pro 图片模型

    作者对商汤上线不久的 SenseNova U1 Pro 进行了五大场景实测,覆盖审美与中文版式、多文字运营物料、资料检索与高密度信息、局部修图、多图融合。该模型在 8 月 SuperCLUE-Image 中文文生图榜单总分 93.81 排名第一,复杂信息布局 95.80 分,支持最高 8K 与特殊长宽比输出。

  4. 花叔AI 评估 · 64/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    网易有道 Confucius4-R2T2 与 T3PO 登顶 Hugging Face 语音识别和翻译趋势榜

    Hugging Face 语音识别和翻译两个分类趋势榜第一分别是网易有道的 Confucius4-R2T2 和 Confucius4-T3PO,前者是 2B 真流式语音识别模型,出了字不再回改,后者是 140 亿参数级实时翻译模型。

  5. 魔搭ModelScope社区AI 评估 · 62/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    中国电信开源 TeleOCR:1.2B 参数文档解析模型,登顶 OmniDocBench v1.6 榜单

    中国电信星辰通用人工智能实验室开源 1.2B 参数文档解析模型 TeleOCR,在 OmniDocBench v1.6 取得 96.87 总分登顶榜单,并拿下 PureDocBench 榜首和 ICDAR-2026 科学图解析挑战赛冠军。

  6. Tw93(@HiTw93)AI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Opus 5.5 上手体验:从 fabel 5.1 切换过来,能力接近但更便宜更快

    Opus 5.5 被评价为近期令人惊喜的模型,作者建议从 fabel 5.1 切换过来,称两者能力接近,但 Opus 5.5 便宜很多、速度也快不少。它被认为非常适合长任务 Coding,能像老练工程师一样有条不紊地完成跨仓库迁移、大仓库审计等复杂工作。此外作者称其终于"开始讲人话",上一个让他有此感受的模型是 GPT-6 Astra。

  7. NVIDIA Technical BlogAI 评估 · 36/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    NVIDIA 推出 NV-Reason-CT,面向放射科医生链式推理的开放 3D CT VLM

    NVIDIA 发布 NV-Reason-CT,一款面向放射科医生链式推理的开源 3D CT 视觉语言模型。当前通用前沿模型在 3D CT 这类体成像上表现不佳,多数开放医疗 AI 模型也缺乏相应能力。

  8. Fireworks AI(@FireworksAI_HQ)AI 评估 · 58/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Fireworks 发布基于 Kimi K3 的专用模型 Ember-1

    Fireworks Research 发布 Ember-1,一个基于 Kimi K3 构建的专用模型,目标是让每个 token 发挥更大作用。官方称其推理链更短,token 用量约减少 40%,同时保持顶级质量,模型页面见 fireworks.ai/models/firewor…。

  9. Anthropic(@AnthropicAI)AI 评估 · 65/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Anthropic:Claude 在噬菌体 DNA 中发现未知酶系统

    Anthropic 称 Claude 在噬菌体 DNA 中发现了一个此前未知的酶系统,该酶基因旁有一段类似 CRISPR 的长重复 DNA 序列。团队目前尚不清楚该系统的功能,已知具备类似特征的系统都能剪切、复制和粘贴 DNA;CRISPR 正是这类可编程系统走向基因药物的先例,但弄清该系统的作用并判断能否有类似用途还需更多研究。

  10. Fish Audio(@FishAudio)AI 评估 · 57/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Fish Audio 发布 Drama 3(预览版)TTS 模型

    Fish Audio 发布 TTS 模型 Drama 3(预览版),称其为目前可控性最强的 TTS 模型。用户可用简单语言描述语气、节奏和角色,无需使用音频标签;支持句子中途切换音色、生成多角色场景,以及只修正单个词。官方还在推文中征集评论 DRAMA 以获取 API key。

9月23日周三
  1. Logan Kilpatrick(@OfficialLoganK)AI 评估 · 61/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google 发布 Gemini 3.8 Flash 与 Flash-Lite TTS 语音模型

    Google 发布 Gemini 3.8 Flash 和 Flash-Lite TTS,称其为新的 SOTA 文本转语音模型。该模型支持全新语音设计体验、2000+ 生产可用音色、语音复制、100 种语言,语音混音功能即将推出,并称在 Hume AI 语音基准上排名第一。

  2. Patrick Loeber(@patloeber)AI 评估 · 54/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google 发布 Gemini 3.8 Flash TTS 与 3.8 Flash-Lite TTS 语音生成模型

    Google 发布两款新的语音生成模型 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS,号称是目前表达力最强的音频生成模型。这两款模型面向创作者、开发者和企业,可通过 Gemini API 和 AI Studio 试用。

  3. Google AI(@GoogleAI)AI 评估 · 78/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google 发布 Gemini 3.8 Flash TTS 与 Flash-Lite TTS

    Google 发布 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 两款音频模型,支持 100 多种语言的自定义声音以及 2000 多种现成音色。

    为什么值得看

    两款 TTS 模型分别面向高保真创作和实时语音智能体,读者可据此判断配音与语音交互场景的选型方向。

  4. Google DeepMind(@GoogleDeepMind)AI 评估 · 53/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google DeepMind 发布 Gemini 3.8 Flash TTS 与 Flash-Lite TTS 两款语音模型

    Google DeepMind 发布两款文本转语音模型。Gemini 3.8 Flash TTS 支持设计带有不同口音和特征的自定义音色;Gemini 3.8 Flash-Lite TTS 面向效率与规模化,可从用户创建的风格或官方生产级音色库中选择。

  5. Google DeepMind BlogAI 评估 · 64/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google DeepMind 发布 Gemini 3.8 Flash TTS 与 Flash-Lite TTS

    Google DeepMind 推出 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 两款文本转语音模型,即日起在 Gemini API 和 Google AI Studio 上线,前者随后进入 Gemini Notebook,后者进入 Google Vids,企业版将通过 Gemini Enterprise API 提供。

  6. NVIDIA AI(@NVIDIAAI)AI 评估 · 59/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    NVIDIA 开源 Nemotron 3 Diarization 说话人分离模型

    NVIDIA 开源 Nemotron 3 Diarization 模型,可在实时对话中稳定追踪说话人,并采用商业友好许可。该模型与 Transformers 实现 day-zero 集成,Hugging Face 工程师在测试中配合 Reachy Mini 与运行在 DGX Spark 上的 speech-to-speech 验证了效果,机器人能识别新声音并记住名字。

  7. Aravind Srinivas(@AravSrinivas)AI 评估 · 76/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    小米发布 MiMo-V2.6 Pro 与 Flash 全模态开源模型

    小米发布 MiMo-V2.6,包含 Pro 和 Flash 两个全模态模型,通过规模化强化学习推进,并可开放获取模型权重、技术报告、强化学习环境与训练代码。Pro 在多数智能体基准上与 Claude Opus 5 和 GPT-5.6 Sol 表现相当,在 Artificial Analysis 智能指数上得分 46,为开源模型中最高,同时在编码、电脑操作、3D 推理和创作能力上更强。

    为什么值得看

    小米发布 MiMo-V2.6 双版本开源权重模型,并给出与闭源前沿模型在智能体基准上的对照成绩。

  8. NVIDIA AI(@NVIDIAAI)AI 评估 · 36/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    NVIDIA 推出 Nemotron 3 Diarization 说话人分离模型,支持 8 人重叠语音

    NVIDIA 发布 Nemotron 3 Diarization 模型,可在多人同时说话、声音重叠时追踪谁在何时发言,最多支持 8 位说话人,参数量为 100M。该模型已在 Hugging Face 上线。

  9. NVIDIA AI(@NVIDIAAI)AI 评估 · 26/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Nemotron 3 Diarization 在 VoiceArena 首届 Diarization-Bench 上排名第一

    Nemotron 3 Diarization 在 VoiceArena 首届 Diarization-Bench 结果中位列 12 个系统之首,错误率 14.72%,比第二名低约 24%。榜单同时给出了一段四人对话的对比示例。

  10. Recraft(@recraftai)AI 评估 · 55/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Recraft V4.1 Flash 发布,1.3 秒生成图像

    Recraft 发布图像模型 Recraft V4.1 Flash,官方称生成一张图耗时 1.3 秒。用户可在模型选择器中选中 Flash 生成图像,再用 Refine 清理细节。

  11. Akshay Kothari(@akothari)AI 评估 · 37/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Claude Opus 5.5 在写作上有巨大升级

    Claude Opus 5.5 在写作能力上迎来大幅升级,表达更自然,并回应了 Opus 5 收到的最常见反馈。它会将最重要的信息前置,并遵循用户给出的写作规则,让长会话更易跟进。

  12. ElevenLabs(@elevenlabsio)AI 评估 · 27/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    ElevenLabs 发布 Scribe v2 Medical 临床语音转写模型

    ElevenLabs 发布语音转文字模型 Scribe v2 Medical,专为临床音频微调,相比基础版 Scribe v2 在临床音频上的词错误率(WER)降低 35%,提升了对药物名称、解剖结构和病理术语的识别准确度。

  13. 阿真IreneAI 评估 · 70/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    阿真实测 Qwen-Image-2.1:7B 开源图像模型的原生透明与多图编辑

    作者在 2026 云栖大会期间实测阿里开源的 Qwen-Image-2.1 图像模型,该模型视觉生成部分为 7B、32 层 Single-Stream DiT,用 Comfy 桌面端在 3090 上即可运行。

  14. Qwen(@Alibaba_Qwen)AI 评估 · 0/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Qwen 发布 Benchmark suite

    Qwen 发布 Benchmark suite,来源为 Qwen 官方账号 @Alibaba_Qwen。该帖互动数据为 2 条回复、0 次转发、46 次点赞、15491 次浏览,数据由 xgo.ing 提供。

  15. 稀土掘金技术社区AI 评估 · 82/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Anthropic 发布 Opus 5.5,OpenAI 随即推出 GPT-6 Sol 与 Luna

    Anthropic 先发布旗舰模型 Claude Opus 5.5,90 分钟后 OpenAI 推出 GPT-6 Sol 与 GPT-6 Luna 两款模型。Opus 5.5 定价 $4 / $20 每百万 token,比 Opus 5 便宜 20%,典型任务综合成本降 40%、加速 30%,Intelligence Index 得分 58 分登顶。

    为什么值得看

    Anthropic 与 OpenAI 同日发布新旗舰,文中给出的定价、上下文与基准数据可供对比两家最新模型定位。

  16. 夕小瑶科技说AI 评估 · 83/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    实测小米 MiMo-V2.6:Pro 版 AA 智能指数 46 分,跑一道题 0.13 美元

    小米正式推出 MiMo-V2.6-Flash、MiMo-V2.6-Pro 及 Pro 的 UltraSpeed 版本;Pro 在 Artificial Analysis 智能指数拿 46 分,超过 Kimi K3 和 Qwen3.8 Max。

    为什么值得看

    作者用编程、设计、视频三类实测展示 MiMo-V2.6 的实际交付能力,并给出与同级模型的价格对比。