Ideogram 发布开放权重的图像模型 Ideogram 4.0
Ideogram 发布 Ideogram 4.0,称其为全球最佳开放图像模型,并开放模型权重。官方表示可下载权重、在自有数据上微调并在本地硬件运行,现已上线所有 Ideogram 套餐和 API。模型与演示页面已托管在 Hugging Face。
Ideogram 发布 Ideogram 4.0,称其为全球最佳开放图像模型,并开放模型权重。官方表示可下载权重、在自有数据上微调并在本地硬件运行,现已上线所有 Ideogram 套餐和 API。模型与演示页面已托管在 Hugging Face。
Ideogram 发布图像模型 Ideogram 4.0,官方称其为全球最佳开放图像模型,并开放权重供下载。用户可在自有数据上微调并在本地硬件运行,该模型已上线 Ideogram 各订阅方案和 API。
Ideogram 宣布推出 Ideogram 4.0,并邀请开发者、研究人员和企业基于该模型进行定制,以拓展生成式媒体与设计方向。官方同步给出 GitHub 开源仓库地址(github.com/ideogram-oss/i…)与模型技术详情页面(ideogram.ai/models/4.0)。
Ideogram 4.0 在排版和平面设计上仍是最强项,涵盖 logo、海报、多字体布局、长文本以及真正融入设计的创意排版。这一评价来自 Ideogram 模型一贯的表现。
Ideogram 发布 4.0,主打高密度且准确的文字渲染、原生 2K 分辨率、原生背景透明和精确版式控制。官方表示可编辑文字、可移动图层与完整图像编辑功能即将推出。
Ideogram 发布 Ideogram 4.0,称其在 DesignArena 第三方榜单上是全球排名第一的开源权重文生图模型。官方表示其成绩仅次于 OpenAI 和 Google 的闭源模型,并强调该模型具备前沿质量、完整可定制性和数据隐私。DesignArena 为第三方评测榜单。
Ideogram 发布 Ideogram 4.0,称其为全球最好的开放图像模型,权重可下载,支持用户用自己的数据微调并在自有硬件上运行。该模型现已上线 Ideogram 全部订阅方案和 API。
Google 在 Antigravity 中推出新版 Gemini 3.5 Flash,作者称该版本冗余更少、在更难任务上耐力更高。官方同时重置了所有用户的 Gemini 限流,用户可立即使用这一新模型。
AI Explained 发布视频,梳理 Claude Opus 4.8 中可能被忽略的 15 个细节。
Poe 平台宣布 Claude Opus 4.8 已在 Poe 上线,用户可通过 poe.com/Claude-Opus-4.8 直接使用。Anthropic 这款最新旗舰模型面向企业级知识工作、代码库规模迁移、多智能体协调和长时间自主任务,并提升了判断力与诚实度。
Anthropic 为 Opus 4.8 的思考量(thinking effort)做了大量校准工作。官方邀请用户在试用模型时,若遇到仍过度思考或思考不足的案例,向其反馈。团队成员 kipply 也同步征集 Claude 在任务中思考过多或过少的示例。
Anthropic 发布 Opus 4.8,官方称其在诚实度上有明显提升,会承认自己不知道的内容,并在自己的代码中主动标出问题而不是掩饰。该模型被推荐用于 Claude Code 的日常使用,并已当天在 Claude Code 中上线,更多细节见所引推文。
Claude Opus 4.8 于今日发布,Mike Krieger 试用数周后称其已成为首选模型。该模型对自己的工作更诚实、会标注不确定之处,并在交付前发现代码中的缺陷。
Anthropic 发布 Claude Opus 4.8,官方称在 Opus 4.7 基础上做了多处修复,对细微差别的理解更好、对话更自然,在编码和知识工作中整体协作能力更强。该版本判断力更敏锐,对自身进展更诚实,能比前代独立工作更长时间,发布当日起以相同价格提供。
Demis Hassabis 在 X 上分享了 Gemini 3.5 Flash 模型的更多信息,并附上 blog.google 的链接。该帖获得 131 个点赞、13 次转发和 33890 次浏览。
Google 发布 Gemini 3.5 Flash,在编码与智能体任务上表现优于 Gemini 3.1 Pro,比其他前沿模型快 4 倍,在 antigravity 中快 12 倍,速度达 800 tokens/秒,成本常不到其他方案的一半。该模型可在 antigravity、GeminiApp 等入口试用,Pro 版本也即将推出。
Google 发布 Gemini 3.5 Flash 模型,即日起在 Antigravity 及 Google 各产品和 API 中向所有人开放。相比 Gemini 3.1 Pro,3.5 Flash 在几乎所有基准测试上表现更好,编码能力提升明显,输出速度是其他前沿模型的 4 倍 tokens/秒。
Google 以更快的 Flash 补充 Gemini 3.5 系列,读者可了解其在速度与能力上的取舍定位。
Jeff Dean 宣布 Gemini 3.5 Flash 于今日起在全球范围上线,并表示 Gemini 团队期待看到用户用这一模型做出的成果,详情见 blog.google 链接。
Cursor 宣布与 SpaceXAI 合作,从头训练一个规模显著更大的模型,总算力用量提升 10 倍。该训练依托 Colossus 2 的百万 H100 等效算力,并结合双方的数据与训练技术,官方预期这将带来模型能力的重大跃升。
Google DeepMind 发布 Omni 家族首个模型 Gemini Omni Flash,可组合图像、音频、视频和文本作为输入生成高质量视频,并通过自然语言多轮对话编辑视频内容。
Google 把 Gemini 的推理与世界知识接入视频生成,读者可据此判断多模态创作工具的能力边界。
Google DeepMind 发布 Gemini 3.5 系列首个模型 Gemini 3.5 Flash,主打智能体与编码能力,在 Terminal-Bench 2.1、GDPval-AA、MCP Atlas 等基准上超过 Gemini 3.1 Pro,输出 token 速度是其他前沿模型的 4 倍。
原文给出了 Gemini 3.5 Flash 的基准成绩、开放入口与 3.5 Pro 的推进节奏,可据此判断其在智能体与编码任务上的定位。
Jina AI 发布 jina-embeddings-v5-omni 全模态向量模型,在 v5-text 文本能力基础上扩展到图像、音频、视频和 PDF,文本向量与 v5-text 逐字节一致,现有索引无需重建。
Jina AI 发布 v5-omni,完全冻结 v5-text 主干,仅通过小型可训练投影层接入预训练视觉与音频编码器。视觉端采用 Qwen3.5 vision encoder 并做 2x2 空间合并,除最终投影层 fc_vision_2 外全部冻结,该层随机初始化并映射至文本主干隐藏维度。
Jina v5-omni 已在 Elastic Inference Service、HuggingFace 和 Jina API 上线。相关模型可在 HuggingFace 集合页获取,技术细节见 arXiv 论文 2605.08384 与 Jina 官方博客。
Jina AI 推出 jina-embeddings-v5-omni,这是其首个通用嵌入模型,支持文本、图像、音频和视频。模型提供 small(1.57B,1024 维,32K 上下文)和 nano(0.95B,768 维,8K 上下文)两种规格,均支持 Matryoshka 截断至 32 维。
Thinking Machines 公布了一款可与人实时协作的 AI 模型,能像人一样同时听说、观看、思考与协作。团队称过去几个月产出 12 个版本(含多个子版本)和 137 页训练运行日志,并表示人与人的协作对提升人机协作很重要。该博客分享了其方法、早期结果及模型实际运行演示。
Thinking Machines 发布交互模型研究预览,推出名为 TML-Interaction-Small 的模型,可在音频、视频和文本上持续输入输出,在 200ms 微回合中实时思考、回应与行动,无需外部脚手架。
Alex Albert 称,提供给 METR 的早期 Claude Mythos Preview 快照在 METR 80% 成功率基准上的时间跨度超过次优模型 2 倍。METR 表示在 2026 年 3 月的有限窗口内对该早期版本做了风险评估,在其任务套件上估计 50% 时间跨度为至少 16 小时(95% CI 8.5 至 55 小时),已接近其在无新任务情况下可测量的上限。
Grok-4.3 已在 Poe 平台上线,用户可通过 poe.com/Grok-4.3 访问。该消息由 Poe 官方账号发布,提示用户可在各平台查看体验。
Poe 宣布 GPT-5.5 和 GPT-5.5 Pro 已在其平台上线,并称此前以早期访问形式在复杂编码、调试和推理工作流中做了测试。在部分内部评测中,任务完成率提升 12%,复杂提示词的重试次数减少 16%,长上下文表现提升 19%。
DeepSeek-V4 Preview 正式发布并开源,主打低成本 1M 上下文。其中 DeepSeek-V4-Pro 为 1.6T 总参数、49B 激活参数,官方称性能可对标顶级闭源模型;DeepSeek-V4-Flash 为 284B 总参数、13B 激活参数,面向快速与低成本场景。
DeepSeek-V4 两个版本公布参数规模与 1M 上下文定位,可据此对比开源与闭源模型的成本路线。
DeepSeek-V4 Preview 正式上线并开源,主打低成本 1M 上下文长度。其中 DeepSeek-V4-Pro 为 1.6T 总参数、49B 激活参数,官方称性能可对标顶级闭源模型;DeepSeek-V4-Flash 为 284B 总参数、13B 激活参数,定位快速高效。API 已同步更新,权重已在 Hugging Face 开放。
DeepSeek-V4 Preview 开源并给出两个版本的参数规模与 1M 上下文定位,可据此判断开源模型的成本路线。
DeepSeek 上线 deepseek-v4-pro 和 deepseek-v4-flash 的 API,用户保留原 base_url 只需更换模型名即可调用。
DeepSeek 发布 V4 系列并公布旧模型退役时间,可用于评估现有 API 的迁移成本。
DeepSeek 公布其模型的结构创新与超高上下文效率,其中包括新的注意力机制,采用 Token 级压缩与 DSA(DeepSeek Sparse Attention),官方称在长上下文下大幅降低计算与内存开销。同时 1M 上下文已成为所有 DeepSeek 官方服务的默认配置。
DeepSeek 发布 DeepSeek-V4-Flash,官方称其推理能力接近 V4-Pro,在简单 Agent 任务上与 V4-Pro 表现相当。该模型参数规模更小、响应更快,并提供高性价比的 API 定价。
官方给出轻量版本与旗舰版本的推理对比和定价定位,读者可据此判断成本与能力的取舍。
DeepSeek 发布 DeepSeek-V4-Pro。官方称其在智能体编码(Agentic Coding)基准上达到开源 SOTA,世界知识在所有开源模型中领先、仅次于 Gemini-3.1-Pro,在数学、STEM 与编码推理上超过所有现有开源模型,可对标头部闭源模型。
DeepSeek-V4 Preview 正式上线并开源,主打低成本 1M 上下文长度。DeepSeek-V4-Pro 总参数 1.6T、激活 49B,官方称性能对标全球顶级闭源模型;DeepSeek-V4-Flash 总参数 284B、激活 13B,定位快速、高效、经济的选项。
DeepSeek-V4 Preview 开源并给出两个版本的参数与 1M 上下文,可据此了解其开放程度与定位。
DeepSeek 上线并同步开源 DeepSeek-V4 预览版,包含 DeepSeek-V4-Pro 与 DeepSeek-V4-Flash 两个版本,1M 上下文成为其所有官方服务标配。
官方给出 V4 双版本的开源链接、API 与 1M 上下文配置,便于判断长上下文与 Agent 能力的实际边界。
字节跳动 Seed 发布新一代 3D 生成大模型 Seed3D 2.0,几何及纹理材质生成均达 SOTA 表现,技术报告已公开,API 上线火山引擎。几何生成引入 Coarse-to-Fine 两阶段 DiT 策略,将整体结构与几何细节解耦;纹理生成简化为统一 PBR 生成模型,并采用 MoE 架构与 VLM 先验增强材质分解稳定性。
月之暗面发布 Kimi K2.6,称其在多项基准上刷新开源 SOTA,包括 HLE w/ tools 54.0、SWE-Bench Pro 58.6、SWE-bench Multilingual 76.7、BrowseComp 83.2、Toolathlon 50.0、Charxiv w/ python 86.7 和 Math Vision w/ python 93.2。
K2.6 的多个基准分数和长时程执行、Agent 集群参数一并给出,可对照 K2.5 看开源编码模型的能力变化。