跳到正文

#模型发布

今日 18 条
6月3日周三
  1. Ideogram(@ideogram_ai)AI 评估 · 60/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Ideogram 4.0 发布,主打高密度文字渲染与原生 2K 分辨率

    Ideogram 发布 4.0,主打高密度且准确的文字渲染、原生 2K 分辨率、原生背景透明和精确版式控制。官方表示可编辑文字、可移动图层与完整图像编辑功能即将推出。

  2. Ideogram(@ideogram_ai)AI 评估 · 51/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Ideogram 4.0 发布,称位列 DesignArena 开源文生图模型第一

    Ideogram 发布 Ideogram 4.0,称其在 DesignArena 第三方榜单上是全球排名第一的开源权重文生图模型。官方表示其成绩仅次于 OpenAI 和 Google 的闭源模型,并强调该模型具备前沿质量、完整可定制性和数据隐私。DesignArena 为第三方评测榜单。

  3. Ideogram(@ideogram_ai)AI 评估 · 62/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Ideogram 发布 Ideogram 4.0 开放图像模型

    Ideogram 发布 Ideogram 4.0,称其为全球最好的开放图像模型,权重可下载,支持用户用自己的数据微调并在自有硬件上运行。该模型现已上线 Ideogram 全部订阅方案和 API。

  4. Varun Mohan(@_mohansolo)AI 评估 · 57/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google 在 Antigravity 中推出新版 Gemini 3.5 Flash 并重置全用户限流

    Google 在 Antigravity 中推出新版 Gemini 3.5 Flash,作者称该版本冗余更少、在更难任务上耐力更高。官方同时重置了所有用户的 Gemini 限流,用户可立即使用这一新模型。

5月29日周五
  1. Alex Albert(@alexalbert__)AI 评估 · 33/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Anthropic 为 Opus 4.8 校准思考量,邀请用户反馈过度或不足思考案例

    Anthropic 为 Opus 4.8 的思考量(thinking effort)做了大量校准工作。官方邀请用户在试用模型时,若遇到仍过度思考或思考不足的案例,向其反馈。团队成员 kipply 也同步征集 Claude 在任务中思考过多或过少的示例。

  2. cat(@_catwu)AI 评估 · 65/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Anthropic 发布 Opus 4.8,已在 Claude Code 上线

    Anthropic 发布 Opus 4.8,官方称其在诚实度上有明显提升,会承认自己不知道的内容,并在自己的代码中主动标出问题而不是掩饰。该模型被推荐用于 Claude Code 的日常使用,并已当天在 Claude Code 中上线,更多细节见所引推文。

  3. Mike Krieger(@mikeyk)AI 评估 · 28/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Claude Opus 4.8 今日发布:更诚实、能自查代码缺陷

    Claude Opus 4.8 于今日发布,Mike Krieger 试用数周后称其已成为首选模型。该模型对自己的工作更诚实、会标注不确定之处,并在交付前发现代码中的缺陷。

  4. Mike Krieger(@mikeyk)AI 评估 · 74/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Anthropic 发布 Claude Opus 4.8 并为 claude.ai 与 Cowork 加入 effort control

    Anthropic 发布 Claude Opus 4.8,在 Opus 4.7 基础上提升判断力、对自身进展的诚实度,并能比前代独立工作更长时间,今日上线且价格与 4.7 相同。同时 claude.ai 与 Cowork 在模型选择器旁新增 effort control,难题调高、快速回答调低。

  5. Alex Albert(@alexalbert__)AI 评估 · 74/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Anthropic 发布 Claude Opus 4.8

    Anthropic 发布 Claude Opus 4.8,官方称在 Opus 4.7 基础上做了多处修复,对细微差别的理解更好、对话更自然,在编码和知识工作中整体协作能力更强。该版本判断力更敏锐,对自身进展更诚实,能比前代独立工作更长时间,发布当日起以相同价格提供。

5月20日周三
  1. Demis Hassabis(@demishassabis)AI 评估 · 15/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Demis Hassabis 分享 Gemini 3.5 Flash 模型更多信息

    Demis Hassabis 在 X 上分享了 Gemini 3.5 Flash 模型的更多信息,并附上 blog.google 的链接。该帖获得 131 个点赞、13 次转发和 33890 次浏览。

  2. Demis Hassabis(@demishassabis)AI 评估 · 64/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google 发布 Gemini 3.5 Flash,编码与智能体任务优于 3.1 Pro

    Google 发布 Gemini 3.5 Flash,在编码与智能体任务上表现优于 Gemini 3.1 Pro,比其他前沿模型快 4 倍,在 antigravity 中快 12 倍,速度达 800 tokens/秒,成本常不到其他方案的一半。该模型可在 antigravity、GeminiApp 等入口试用,Pro 版本也即将推出。

  3. Poe(@poe_platform)AI 评估 · 44/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Gemini-3.5-Flash 上线 Poe,主打快速高效响应

    Google 最新 Flash 模型 Gemini-3.5-Flash 已在 Poe 上线,主打快速、高效的响应,在编码、复杂工作流和智能体任务上表现强劲。用户可通过 poe.com/Gemini-3.5-Flash 试用。

  4. Jeff Dean(@JeffDean)AI 评估 · 76/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google 发布 Gemini 3.5 Flash 模型

    Google 发布 Gemini 3.5 Flash 模型,即日起在 Antigravity 及 Google 各产品和 API 中向所有人开放。相比 Gemini 3.1 Pro,3.5 Flash 在几乎所有基准测试上表现更好,编码能力提升明显,输出速度是其他前沿模型的 4 倍 tokens/秒。

    为什么值得看

    Google 以更快的 Flash 补充 Gemini 3.5 系列,读者可了解其在速度与能力上的取舍定位。

  5. Demis Hassabis(@demishassabis)AI 评估 · 73/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Demis Hassabis 宣布 Gemini Omni:支持照片、视频与音频构建新场景

    Demis Hassabis 宣布 Gemini Omni 在世界理解与多模态编辑上实现重大跨越,可接收照片、视频和音频并构建全新场景。他表示该模型将逐步支持任意输入与任意输出,先从视频开始,用户还可输入自己的视频来迭代想法。

  6. Jeff Dean(@JeffDean)AI 评估 · 72/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Gemini 3.5 Flash 今日全球上线

    Jeff Dean 宣布 Gemini 3.5 Flash 于今日起在全球范围上线,并表示 Gemini 团队期待看到用户用这一模型做出的成果,详情见 blog.google 链接。

5月19日周二
  1. Sualeh Asif(@sualehasif996)AI 评估 · 17/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Cursor 与 SpaceXAI 合作从头训练更大模型,总算力提升 10 倍

    Cursor 宣布与 SpaceXAI 合作,从头训练一个规模显著更大的模型,总算力用量提升 10 倍。该训练依托 Colossus 2 的百万 H100 等效算力,并结合双方的数据与训练技术,官方预期这将带来模型能力的重大跃升。

5月18日周一
  1. Google DeepMind BlogAI 评估 · 78/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google DeepMind 发布 Gemini Omni Flash,支持对话式视频编辑

    Google DeepMind 发布 Omni 家族首个模型 Gemini Omni Flash,可组合图像、音频、视频和文本作为输入生成高质量视频,并通过自然语言多轮对话编辑视频内容。

    为什么值得看

    Google 把 Gemini 的推理与世界知识接入视频生成,读者可据此判断多模态创作工具的能力边界。

5月16日周六
  1. Google DeepMind BlogAI 评估 · 88/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google DeepMind 发布 Gemini 3.5 Flash,主打智能体与编码

    Google DeepMind 发布 Gemini 3.5 系列首个模型 Gemini 3.5 Flash,主打智能体与编码能力,在 Terminal-Bench 2.1、GDPval-AA、MCP Atlas 等基准上超过 Gemini 3.1 Pro,输出 token 速度是其他前沿模型的 4 倍。

    为什么值得看

    原文给出了 Gemini 3.5 Flash 的基准成绩、开放入口与 3.5 Pro 的推进节奏,可据此判断其在智能体与编码任务上的定位。

5月13日周三
  1. Jina AIAI 评估 · 41/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Jina AI 发布 jina-embeddings-v5-omni 全模态向量小模型

    Jina AI 发布 jina-embeddings-v5-omni 全模态向量模型,在 v5-text 文本能力基础上扩展到图像、音频、视频和 PDF,文本向量与 v5-text 逐字节一致,现有索引无需重建。

5月12日周二
  1. Jina AI(@JinaAI_)AI 评估 · 32/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Jina AI v5-omni:冻结 v5-text 主干,接入视觉与音频编码器

    Jina AI 发布 v5-omni,完全冻结 v5-text 主干,仅通过小型可训练投影层接入预训练视觉与音频编码器。视觉端采用 Qwen3.5 vision encoder 并做 2x2 空间合并,除最终投影层 fc_vision_2 外全部冻结,该层随机初始化并映射至文本主干隐藏维度。

  2. Jina AI(@JinaAI_)AI 评估 · 42/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Jina v5-omni 上线 Elastic Inference Service、HuggingFace 与 Jina API

    Jina v5-omni 已在 Elastic Inference Service、HuggingFace 和 Jina API 上线。相关模型可在 HuggingFace 集合页获取,技术细节见 arXiv 论文 2605.08384 与 Jina 官方博客。

  3. Jina AI(@JinaAI_)AI 评估 · 47/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Jina AI 发布 jina-embeddings-v5-omni:首个支持文本、图像、音频和视频的通用嵌入模型

    Jina AI 推出 jina-embeddings-v5-omni,这是其首个通用嵌入模型,支持文本、图像、音频和视频。模型提供 small(1.57B,1024 维,32K 上下文)和 nano(0.95B,768 维,8K 上下文)两种规格,均支持 Matryoshka 截断至 32 维。

  4. Google DeepMind BlogAI 评估 · 71/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google DeepMind 发布基于 Gemini 的多智能体科研系统 Co-Scientist

    Google DeepMind 发布基于 Gemini 的多智能体 AI 系统 Co-Scientist,并在 Nature 发表研究,通过生成、辩论、进化三个阶段迭代产出科学假设。

  5. Lilian Weng(@lilianweng)AI 评估 · 31/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Thinking Machines 发布实时人机协作 AI 模型

    Thinking Machines 公布了一款可与人实时协作的 AI 模型,能像人一样同时听说、观看、思考与协作。团队称过去几个月产出 12 个版本(含多个子版本)和 137 页训练运行日志,并表示人与人的协作对提升人机协作很重要。该博客分享了其方法、早期结果及模型实际运行演示。

5月11日周一
  1. Thinking Machines — ConnectionismAI 评估 · 73/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Thinking Machines 发布交互模型 TML-Interaction-Small 研究预览

    Thinking Machines 发布交互模型研究预览,推出名为 TML-Interaction-Small 的模型,可在音频、视频和文本上持续输入输出,在 200ms 微回合中实时思考、回应与行动,无需外部脚手架。

5月2日周六
  1. Poe(@poe_platform)AI 评估 · 2/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Grok-4.3 已上线 Poe 平台

    Grok-4.3 已在 Poe 平台上线,用户可通过 poe.com/Grok-4.3 访问。该消息由 Poe 官方账号发布,提示用户可在各平台查看体验。

4月25日周六
  1. Poe(@poe_platform)AI 评估 · 60/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Poe 上线 GPT-5.5 与 GPT-5.5 Pro

    Poe 宣布 GPT-5.5 和 GPT-5.5 Pro 已在其平台上线,并称此前以早期访问形式在复杂编码、调试和推理工作流中做了测试。在部分内部评测中,任务完成率提升 12%,复杂提示词的重试次数减少 16%,长上下文表现提升 19%。

4月24日周五
  1. Junyang Lin(@JustinLin610)AI 评估 · 82/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    DeepSeek-V4 Preview 开源发布,提供 1M 上下文

    DeepSeek-V4 Preview 正式发布并开源,主打低成本 1M 上下文。其中 DeepSeek-V4-Pro 为 1.6T 总参数、49B 激活参数,官方称性能可对标顶级闭源模型;DeepSeek-V4-Flash 为 284B 总参数、13B 激活参数,面向快速与低成本场景。

    为什么值得看

    DeepSeek-V4 两个版本公布参数规模与 1M 上下文定位,可据此对比开源与闭源模型的成本路线。

  2. Hugging Face(@huggingface)AI 评估 · 80/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    DeepSeek-V4 Preview 开源发布,支持 1M 上下文

    DeepSeek-V4 Preview 正式上线并开源,主打低成本 1M 上下文长度。其中 DeepSeek-V4-Pro 为 1.6T 总参数、49B 激活参数,官方称性能可对标顶级闭源模型;DeepSeek-V4-Flash 为 284B 总参数、13B 激活参数,定位快速高效。API 已同步更新,权重已在 Hugging Face 开放。

    为什么值得看

    DeepSeek-V4 Preview 开源并给出两个版本的参数规模与 1M 上下文定位,可据此判断开源模型的成本路线。

  3. DeepSeek(@deepseek_ai)AI 评估 · 84/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    DeepSeek 发布 deepseek-v4-pro 与 deepseek-v4-flash API

    DeepSeek 上线 deepseek-v4-pro 和 deepseek-v4-flash 的 API,用户保留原 base_url 只需更换模型名即可调用。

    为什么值得看

    DeepSeek 发布 V4 系列并公布旧模型退役时间,可用于评估现有 API 的迁移成本。

  4. DeepSeek(@deepseek_ai)AI 评估 · 68/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    DeepSeek 公布注意力结构创新,1M 上下文成为官方服务默认

    DeepSeek 公布其模型的结构创新与超高上下文效率,其中包括新的注意力机制,采用 Token 级压缩与 DSA(DeepSeek Sparse Attention),官方称在长上下文下大幅降低计算与内存开销。同时 1M 上下文已成为所有 DeepSeek 官方服务的默认配置。

  5. DeepSeek(@deepseek_ai)AI 评估 · 76/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    DeepSeek 发布 V4-Flash 模型

    DeepSeek 发布 DeepSeek-V4-Flash,官方称其推理能力接近 V4-Pro,在简单 Agent 任务上与 V4-Pro 表现相当。该模型参数规模更小、响应更快,并提供高性价比的 API 定价。

    为什么值得看

    官方给出轻量版本与旗舰版本的推理对比和定价定位,读者可据此判断成本与能力的取舍。

  6. DeepSeek(@deepseek_ai)AI 评估 · 66/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    DeepSeek 发布 DeepSeek-V4-Pro,称在智能体编码基准上取得开源 SOTA

    DeepSeek 发布 DeepSeek-V4-Pro。官方称其在智能体编码(Agentic Coding)基准上达到开源 SOTA,世界知识在所有开源模型中领先、仅次于 Gemini-3.1-Pro,在数学、STEM 与编码推理上超过所有现有开源模型,可对标头部闭源模型。

  7. DeepSeek(@deepseek_ai)AI 评估 · 86/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    DeepSeek-V4 Preview 正式发布并开源,支持 1M 上下文

    DeepSeek-V4 Preview 正式上线并开源,主打低成本 1M 上下文长度。DeepSeek-V4-Pro 总参数 1.6T、激活 49B,官方称性能对标全球顶级闭源模型;DeepSeek-V4-Flash 总参数 284B、激活 13B,定位快速、高效、经济的选项。

    为什么值得看

    DeepSeek-V4 Preview 开源并给出两个版本的参数与 1M 上下文,可据此了解其开放程度与定位。

  8. DeepSeekAI 评估 · 92/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    DeepSeek 发布并开源 DeepSeek-V4 预览版,标配 1M 上下文

    DeepSeek 上线并同步开源 DeepSeek-V4 预览版,包含 DeepSeek-V4-Pro 与 DeepSeek-V4-Flash 两个版本,1M 上下文成为其所有官方服务标配。

    为什么值得看

    官方给出 V4 双版本的开源链接、API 与 1M 上下文配置,便于判断长上下文与 Agent 能力的实际边界。

4月23日周四
  1. 字节跳动SeedAI 评估 · 53/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    字节跳动 Seed 发布 3D 生成大模型 Seed3D 2.0

    字节跳动 Seed 发布新一代 3D 生成大模型 Seed3D 2.0,几何及纹理材质生成均达 SOTA 表现,技术报告已公开,API 上线火山引擎。几何生成引入 Coarse-to-Fine 两阶段 DiT 策略,将整体结构与几何细节解耦;纹理生成简化为统一 PBR 生成模型,并采用 MoE 架构与 VLM 先验增强材质分解稳定性。

4月20日周一
  1. Hugging Face(@huggingface)AI 评估 · 81/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    月之暗面发布 Kimi K2.6,主打开源编码与长时程 Agent

    月之暗面发布 Kimi K2.6,称其在多项基准上刷新开源 SOTA,包括 HLE w/ tools 54.0、SWE-Bench Pro 58.6、SWE-bench Multilingual 76.7、BrowseComp 83.2、Toolathlon 50.0、Charxiv w/ python 86.7 和 Math Vision w/ python 93.2。

    为什么值得看

    K2.6 的多个基准分数和长时程执行、Agent 集群参数一并给出,可对照 K2.5 看开源编码模型的能力变化。

4月17日周五
  1. Kevin Weil 🇺🇸(@kevinweil)AI 评估 · 66/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI 发布首个科研前沿模型 GPT-Rosalind

    OpenAI 发布 GPT-Rosalind,称其为首个面向生物学、药物发现和转化医学等科学研究的前沿模型,训练覆盖化学、蛋白质工程、基因组学,并内置研究者常用数据库与工具的相关知识。该模型通过可信访问部署结构向合格客户开放,以防范生物领域的滥用风险。同时 OpenAI 面向所有人推出 Codex 的生命科学插件,可搭配主线模型及 GPT-Rosalind 使用。

  2. Binyuan Hui(@huybery)AI 评估 · 8/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Opus 4.7 发布,系统卡又加了 200+ 页

    Opus 4.7 发布,附带又一份 200+ 页的系统卡,让作者直言模型发布速度已超过自己的阅读速度。此前 Mythos 的系统卡他还没读完。

  3. cat(@_catwu)AI 评估 · 63/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Opus 4.7 在 Claude Code 上线

    Claude Opus 4.7 在 Claude Code 上线。官方建议把它当作可以委派任务的工程师,而不是逐行指导的结对程序员,并给出三条配套的工作流调整建议。