跳到正文

#MCP/工具调用

今日 0 条
10月8日周四
  1. AWS Machine Learning BlogAI 评估 · 67/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    AWS 上线 Claude Haiku 5.5

    AWS 宣布 Claude Haiku 5.5 已在 Amazon Bedrock 和 Claude Platform on AWS 上线。据 Anthropic 介绍,它是 Claude 5.5 家族中速度最快、效率最高的模型,面向子智能体和高并发成本敏感场景,多数任务成本比 Claude Haiku 4.5 低约 75%。

9月29日周二
  1. AI科技评论AI 评估 · 72/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    深度拆解 Claude Sonnet 5.5:半价 Opus 只是表象,Agent Runtime 才是变化核心

    Anthropic 发布 Claude Sonnet 5.5,API 单价没变、生成速度更快,Terminal-Bench、CursorBench 等 Agent benchmark 成绩明显上涨。

9月27日周日
  1. Vercel NewsAI 评估 · 56/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Fireworks 的 Ember-1 上线 Vercel AI Gateway

    Fireworks 的 Ember-1 已在 Vercel AI Gateway 上线,这是一个基于 Kimi K3 构建、面向编码与智能体工作流的研究预览版推理模型。

9月26日周六
  1. Fireworks AI(@FireworksAI_HQ)AI 评估 · 69/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Fireworks AI 上线 MiMo-V2.6-Pro 按需部署

    Fireworks AI 宣布 MiMo-V2.6-Pro 即日起以按需部署形式提供。该模型在 AA Intelligence Index 上得分为 46,为开源权重模型中最高分,采用 1.02T 总参数、42B 激活参数的 MoE 架构,支持 1M 上下文与多模态,并以 MIT 许可发布,用户可在 fireworks.ai/models 开通端点。

9月21日周一
  1. 腾讯技术工程AI 评估 · 56/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    聊聊最近爆火的 Jev 模型,到底是个啥?

    腾讯程序员实测 TypeSafe AI 于 9 月推出的决策模型 Jev,用 Codebuddy 做了一个网页小游戏 demo,一局游戏完成 6 次真实 API 调用,Jev 负责在预设动作中选择按键,地图、伤害和碰撞仍由游戏代码处理。

9月18日周五
  1. idoubi(@idoubicc)AI 评估 · 46/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Jev 决策模型上线 OpenRouter:只做布尔判断、枚举选择与候选打分

    Jev 决策模型已在 OpenRouter 上线,定位为 System One,不做长文生成,只处理布尔判断、枚举选择、候选打分三类决策任务。它不兼容 OpenAI Chat Completions 格式,需用 Decisions API 自行拼 state 与 questions。典型场景包括搜索意图识别、本地模型网关路由和多 Agent 协作中的 Bot 分派。

9月13日周日
  1. Simon Willison(@simonw)AI 评估 · 45/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    ChatGPT Work 与 GPT-6 Astra 可根据地址生成 5K/10K 环形跑步路线

    ChatGPT Work 和 GPT-6 Astra(作者用的是 "Max")能基于 OSM 数据,从给定地址生成 5K/10K 环形跑步路线。该体验由 Simon Willison 分享,称其"挺不错"。

9月7日周一
  1. Paul Couvert(@itsPaulAi)AI 评估 · 56/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenBMB 开源 2B 模型 MiniCPM5-2B,面向端侧与 Agent

    OpenBMB 开源 MiniCPM5-2B,这是一个 2B 参数语言模型,主打端侧高智能密度,可在手机上本地离线运行,面向智能体、编码与工具调用优化。

8月12日周三
  1. xAI(@xai)AI 评估 · 68/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Grok 4.6 上线 Grok Build、Cursor、Grok Bot 与 API

    Grok 4.6 今日起在 Grok Build、Cursor、Grok Bot 和 API 中上线。首周在 Cursor 和 Grok Build 内提供 2 倍使用额度,详情见 x.ai/news/grok-4-6。

7月15日周三
  1. 通义大模型AI 评估 · 71/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    阿里通义发布 Qwen-Audio-3.0-Realtime 实时语音交互模型

    阿里通义实验室将语音交互模型 Fun-Realtime-AudioChat 全面升级并更名为 Qwen-Audio-3.0-Realtime,主打高表现力与共情对话、音色克隆、声纹级背景过滤的双工交互,以及动态工具调用能力。

7月9日周四
  1. AI at Meta BlogAI 评估 · 84/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Meta 发布 Muse Spark 1.1 多模态推理模型并开放 Meta Model API 公测

    Meta Superintelligence Labs 发布 Muse Spark 1.1,这是 Muse Spark 的升级版多模态推理模型,主打智能体任务,在工具使用、计算机操作、编码和多模态理解上有明显提升。

    为什么值得看

    Meta 发布 Muse Spark 1.1 并开放 Meta Model API 公测,读者可了解其百万 token 上下文与多智能体编排能力。

7月7日周二
  1. AI at Meta BlogAI 评估 · 82/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Meta Superintelligence Labs 发布 Muse Image 并预览 Muse Video

    Meta Superintelligence Labs 发布其首个媒体生成模型 Muse Image,并预览 Muse Video。Muse Image 以智能体方式运行,调用搜索和编码工具,能自我改进并随测试时算力扩展而提升,已上线 Meta AI 应用、meta.ai、美国 Instagram Stories 及部分国家的 WhatsApp。

    为什么值得看

    Meta Superintelligence Labs 首发的图像生成模型,其智能体式工具调用与推理时算力扩展为图像生成提供了新范式。

3月25日周二
  1. DeepSeek(@deepseek_ai)AI 评估 · 78/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    DeepSeek-V3-0324 发布:推理能力提升,改用 MIT 许可开源

    DeepSeek 发布 DeepSeek-V3-0324,在推理性能、前端开发能力和工具调用能力上均有提升。官方建议非复杂推理任务直接使用 V3 并关闭 DeepThink,API 用法保持不变。该版本模型已在 Hugging Face 开源,采用与 DeepSeek-R1 相同的 MIT License。

    为什么值得看

    官方一次给出推理、前端开发与工具调用三项能力变化,并说明 API 不变、改用 MIT 许可,读者可据此判断接入成本。