Monica AI 上线 Claude 4.5 Sonnet 与 Google Nano Banana
Monica AI 新增 Claude 4.5 Sonnet,主打复杂推理与编码的自主能力,同时上线 Google Nano Banana,定位超轻量、超快速的图像编辑并保持创作一致性。两款模型现已在 monica.im 开放试用。
Monica AI 新增 Claude 4.5 Sonnet,主打复杂推理与编码的自主能力,同时上线 Google Nano Banana,定位超轻量、超快速的图像编辑并保持创作一致性。两款模型现已在 monica.im 开放试用。
Claude Sonnet 4.5 现已接入 Flowise,可用于构建复杂智能体。Flowise 称其为构建复杂 agents 的最强模型。
MongoDB Atlas 现已加入 MCP Toolbox for Databases 的支持数据库生态,这一开源 Model Context Protocol(MCP)服务器由 Anthropic 提出,可实现生成式 AI 智能体与企业数据源的无缝集成。
METR 复现并扩展了 GDM 论文第 5 节的实验,用 Claude 4 Sonnet、Claude 3.7 Sonnet 和 GPT-4o 作为 actor 模型、用 GPT-4o、GPT-4o-mini、o3、Gemini 2.0 Flash 和 Gemini 2.5 Pro 作为监控模型,发现模型即使面对比自己弱的监控模型也难以在不显著损失准确率的情况下掩盖推理。
METR 发布研究指出,LLM 的思维链(CoT)虽不总是忠实反映全部推理步骤,但在需要 CoT 才能完成的复杂推理中仍有很高信息量。
Barsee 总结了最近 AI 领域最密集的一周,Google 推出 Veo 3,Anthropic 发布 Claude 4,OpenAI 与 Jony 联合推出 IO。此外还有 Apple Glasses 与 Google Glasses、Tesla Optimus 的进展,以及 Anthropic CEO 对 2026 年 AI 的预测。
Claude Opus 4 和 Claude Sonnet 4 已在 Monica 上线,提供增强的聊天体验。Claude Opus 4 被称为目前最强模型及全球最佳编码模型,Claude Sonnet 4 相较前代在编码与推理上有显著升级。
Anthropic 的越狱防御挑战在累计约 30 万条消息、约 3,700 小时集体投入后,首次有人突破全部 8 个关卡。但组织者 Jan Leike 表示,能一次性击败所有关卡的通用越狱尚未被发现。
Jan Leike 发起的越狱挑战开赛约 48 小时,尚无人通过第 4 关,但通关第 3 关的人数明显增多。
Anthropic 推出新的越狱防御机制并发起公开挑战,共设 8 个难度等级,邀请用户尝试找出一个能击败全部 8 级防御的越狱方法。该防御与宪法 AI(Constitutional AI)相关,挑战入口位于 claude.ai。
Anthropic Fellows Program 现已开放申请,参与者将与顶尖研究者合作开展 AI 安全研究。该项目由 Anthropic 推出,聚焦于应对全球最紧迫的问题之一。
110 多名顶级 AI 公司的员工与校友联名发表公开信,支持被称为"全球最具争议 AI 法案"的 SB 1047,其中 30 多人来自反对该法案的公司。Geoffrey Hinton 表示已在这份名单上署名,并称这些签署者对 AI 未来走向的洞察胜过几乎所有人,他们的警告值得重视。
Anthropic 将在 ICML 期间于 7 月 23 日举办一场 happy hour,面向有兴趣加入 Anthropic 的人,需通过 lu.ma/c751eomf 报名。
Eugene Yan 总结提示词工程的基础做法,指出做大规模提示词优化前需要可靠的评估,并给出“标注约100条评估样本、写初版提示词、跑评估并迭代、上线前在留出测试集上验证”的流程。
Instagram 联合创始人 Mike Krieger 宣布加入 Anthropic 担任首席产品官。他表示,Claude 搭配合适的脚手架与产品功能,可帮助更多人以更快速度、更低成本创新,并称 Anthropic 正招聘产品工程等多个岗位。
作者 Eugene Yan 用 Vapi 平台和 claude-3-sonnet 搭建了一个可电话拨打的语音 AI 教练 Tara,并给出约 10 分钟的搭建指南。
为测试 LLM 的训练数据与表现,Eugene Yan 让 gpt-4、claude-v1.2、cohere-xlarge 等模型为自己写传记,结果 gpt3.5/4 整体表现最好,大意正确但细节多有错误。他指出不同模型在记忆与复述程度上差异明显,且这些模型无法联网,输出完全基于训练数据。