跳到正文

#MCP/工具调用

今日 33 条
2月7日周六
  1. 42章经AI 评估 · 47/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    从 Clawdbot 到 26 年 AI Coding 主题大爆发|对谈 PingCAP CTO 东旭

    42章经与 PingCAP 联合创始人、CTO 东旭对谈,梳理从 Clawdbot(现名 OpenClaw)到 Claude Code、Cowork、Skills 等产品的密集爆发。东旭提出 AI 产品正从「套壳大模型」向「套壳 Coding Agent」演进,并认为 Skills 比 MCP 更适合 Agent,未来一切可能都建立在 Coding 和 Agent 之上。

2月6日周五
  1. hidecloud(@hidecloud)AI 评估 · 21/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Raycast Manus 插件通过审核

    wong2 开发的 Raycast Manus 插件已通过审核上线。该插件可通过 Raycast 调用 Manus,访问地址为 raycast.com/wong2/manus-ma。

2月5日周四
  1. David Heinemeier HanssonAI 评估 · 58/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    DHH 实测 OpenClaw 智能体零 MCP 配置完成注册与协作任务

    David Heinemeier Hansson 分享用 OpenClaw 给 AI 分配独立机器、长期记忆和持续执行能力的实验,他在 Proxmox 虚拟机上隔离部署智能体 Kef,未安装任何技能、MCP 或 API 接入,仅凭一条提示词就让其自行在 hey.com 注册邮箱、完成 Fizzy 注册并创建看板卡片,随后通过邮件邀请加入 Basecamp 并在聊天室打招呼。

1月31日周六
  1. hidecloud(@hidecloud)AI 评估 · 17/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    用一条提示词让 Manus Agent 自动注册并入驻 Moltbook

    一条约 5 分钟的“killer prompt”可让 Manus Agent 自动完成 Moltbook 注册:访问 Moltbook 按说明注册 Agent 账号,打开本地浏览器在 X 主页发帖验证并完成注册,随后分享话题或参与社区互动。该提示词还要求设置每小时定时任务,携带账号与登录信息自动参与互动并发布想法。

1月14日周三
  1. 硬地骇客AI 评估 · 35/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    从 Prompt 到 Agent Skills:Anthropic 的野心与大模型应用的终极抽象

    Anthropic 的 Agent Skills 正被推成行业默认标准,播客《硬地骇客》拆解了 Agent Skills、MCP 与 Tool Calling 的层级关系:MCP 是 Skill 的一个可选部分,Skills 描述模型能做的事情,并通过增加抽象层把领域知识从业务知识中抽离。

1月8日周四
  1. Aman Sanger(@amanrsanger)AI 评估 · 62/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Cursor 智能体采用动态上下文,多 MCP 服务器场景 token 减少 46.9%

    Cursor 的智能体已在所有模型上使用动态上下文,能更智能地填充上下文并保持相同质量,使用多个 MCP 服务器时总 token 减少 46.9%。转述者补充称,Cursor 通过将对话记录刷写到磁盘,可跨对话召回数百万 token 长的信息,更适合无限长度对话和长周期任务。

1月3日周六
  1. Taranjeet(@taranjeetio)AI 评估 · 18/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Mem0 2025 年度回顾:开源论文、OpenMemory MCP 与 24M 美元融资

    Mem0 发布 2025 年度回顾:推出首篇 Mem0 研究论文、OpenMemory MCP 和 OpenMemory Chrome 扩展,GitHub 星标超 44k,Python 包下载量超 18M,并完成 2400 万美元融资。AWS 将其选为新一代 Agent SDK 的独家记忆提供商,Mem0 还原生集成进 CrewAI、Flowise 和 Langflow 等智能体产品。

  2. hidecloud(@hidecloud)AI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    用 Manus 打造的 Mac 打字机效果应用 Typewriter

    开发者用 Manus 构建了一款名为 Typewriter 的 Mac 应用,可逐字输入文字,实现即时打字机效果,省去产品视频后期制作动态图形的麻烦。配合 Screen Studio 录制,画面跟随光标移动并持续在屏幕上打字,基本无需繁琐的后期处理。

12月19日周五
  1. Next.js BlogAI 评估 · 45/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Next.js 16.1 发布:Turbopack 文件系统缓存转正,编译提速最高 14 倍

    Next.js 16.1 发布,Turbopack 文件系统缓存 for next dev 正式稳定并默认开启,重启开发服务器后首次路由编译在 Vercel 大型内部应用上快约 14 倍、react.dev 快约 10 倍。

12月14日周日
  1. Eugene YanAI 评估 · 18/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Eugene Yan 2025 年度回顾:6 篇长文、4 个原型应用与 LLM × RecSys 专场

    Eugene Yan 发布 2025 年度回顾,全年完成 6 篇长文与 4 个原型应用,其中 AI Reading Club 已上线 Kindle iOS app。

12月1日周一
  1. DeepSeek(@deepseek_ai)AI 评估 · 62/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    DeepSeek 更新 V3.2 API:新增 Speciale 临时端点,Tool-Use 支持 Thinking

    DeepSeek 更新 V3.2 系列 API:V3.2 沿用与 V3.2-Exp 相同的使用方式;V3.2-Speciale 通过临时端点 base_url api.deepseek.com/v3.2_speciale_… 提供,定价与 V3.2 相同,不支持工具调用,可用至 2025 年 12 月 15 日 15:59(UTC)。

11月25日周二
  1. Dia(@diabrowser)AI 评估 · 20/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Dia 集成 Slack Search,不用打开 Slack 也能检索 Slack 上下文

    Dia 浏览器新增 Slack Search 功能,用户无需打开 Slack,直接在 Chat 中提问即可获取所需上下文。该功能已上线 Dia。

11月22日周六
  1. Adam D'Angelo(@adamdangelo)AI 评估 · 49/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Poe 推出 Script Bots,用 vibe coding 组合 200+ 模型与自动化工作流

    Poe 发布早期版本 Script Bots,可通过 Script Bot Creator 以 vibe coding 方式创建,组合平台上 200+ 文本、图像、视频和音频模型,以及任意其他 bot,实现模型组合与工作流自动化。该功能指向 Poe 将各家模型整合为易用体验的长期方向。

11月16日周日
  1. Fellou(@FellouAI)AI 评估 · 33/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Fellou 智能体浏览器可根据提示词追踪 20 家硅谷顶级 VC 的 AI 动态并生成网站

    Fellou 是一款可执行任务的智能体浏览器,用户输入一句提示词即可让它组织多个智能体,抓取 20 家硅谷顶级 VC 官网过去 7 天的 AI 相关更新。抓取内容涵盖新投资、最新观点/备忘录与投资组合动态,并为每条信息附上原始来源链接,最终整理成 Investments / Insights / Portfolio Updates / Source Links 分类的网站。

11月6日周四
  1. Fellou(@FellouAI)AI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Fellou 用多 AI 智能体在浏览器内规划纽约圣诞行程

    Fellou 展示了在浏览器内编排多个 AI 智能体完成纽约 3 天圣诞行程规划,涵盖酒店、活动、餐饮与 Google Maps,单人预算约 2,000 美元。用户只需输入想法,智能体即可自动完成搜索与整合。

10月30日周四
  1. 硬地骇客AI 评估 · 42/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    硬地骇客 EP116:AI 浏览器深度解析,OpenAI Atlas 与效率、隐私及市场格局

    OpenAI 传闻已久的 "Atlas" 浏览器正式发布,硬地骇客在 EP116 中解析 AI 浏览器的独特价值、与插件的差异及隐私安全问题。节目还讨论了 AI 原生浏览器的合规性与设计理念、Atlas 收购 Dia 的战略意义,以及 Chromium 开源项目对 AI 浏览器未来的影响。

10月28日周二
  1. Taranjeet(@taranjeetio)AI 评估 · 49/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    mem0ai 融资 2400 万美元,为 AI 打造通用记忆层

    mem0ai 完成 2400 万美元融资,用于构建 AI 通用记忆层,已有数千个团队在生产环境使用,累计 1400 万次下载、41K GitHub stars。

  2. Fellou(@FellouAI)AI 评估 · 20/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Fellou Agents 把 Google Sheet 账单数据变成可多维筛选的分析网站

    Fellou Agents 接下一句指令,就基于一份 Google Sheet 账单表格搭建出带多维筛选的账单分析网站,把静态表格数据转成可交互分析。用户只给出“以这份 Google Sheet 为数据源、构建账单分析网站”的任务,其余由 Fellou Agents 完成。

10月27日周一
  1. Fellou(@FellouAI)AI 评估 · 30/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Fellou 演示 AI 自动生成对冲基金级投资报告并邮件发送

    Fellou 展示了一套 AI 工作流:给出"生成机构级 VIP 投资报告(含宏观洞察、板块拆解、策略与实时数据图表)并邮件投递"的提示词后,AI 可自动完成报告撰写与发送,官方称其"远不止文本生成"。该演示由 xgo.ing 提供支持。

10月24日周五
  1. Fellou(@FellouAI)AI 评估 · 21/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Fellou 与其他 AI 浏览器相比表现如何?SlashGear 发布详细评测

    SlashGear 对 Fellou 进行了详细评测,重点考察其与其他 AI 浏览器相比的表现。评测提到 Fellou 能逐步拆解任务、集成常用工具,且资源占用保持轻量。

10月22日周三
  1. Next.js BlogAI 评估 · 52/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Next.js 16 发布:Turbopack 成为默认打包工具,新增 Devtools MCP 与 Cache Components

    Next.js 16 正式发布,Turbopack 成为所有应用的默认打包工具,官方称生产构建快 2-5 倍、Fast Refresh 快至 10 倍。新版本加入基于 PPR 和 use cache 的 Cache Components、面向 AI 辅助调试的 Next.js Devtools MCP,以及取代 middleware.ts 的 proxy.ts。

10月11日周六
  1. FlowiseAI(@FlowiseAI)AI 评估 · 25/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Flowise OpenAPI Toolkit 升级:把任意 OpenAPI 规范转成 LLM 可用的工具集

    Flowise 升级 OpenAPI Toolkit,可将任意 OpenAPI(Swagger/JSON)规范转成一组面向 LLM 的工具,效果类似 MCP。使用时只需填入一个 OpenAPI 规范链接(如 api.apis.guru/v2/specs/groun…)即可完成转换。

  2. FlowiseAI(@FlowiseAI)AI 评估 · 17/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Flowise v3.0.8 发布:新增 TTS、Gemini/Anthropic 内置联网搜索

    Flowise 发布 v3.0.8,新增基于 OpenAI 与 ElevenLabs 的 TTS 语音能力,并为 Gemini 和 Anthropic 加入内置网页搜索与抓取。该版本还带来 Teradata MCP、Oxylabs 抓取器,以及 OpenAPI Toolkit 升级。

9月22日周一
  1. MongoDB BlogAI 评估 · 24/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    MongoDB Atlas 加入 MCP Toolbox,打通 AI 智能体与企业数据源

    MongoDB Atlas 现已加入 MCP Toolbox for Databases 的支持数据库生态,这一开源 Model Context Protocol(MCP)服务器由 Anthropic 提出,可实现生成式 AI 智能体与企业数据源的无缝集成。

5月4日周日
  1. Eugene YanAI 评估 · 48/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    用 MCP、Amazon Q 和 tmux 构建每日新闻摘要智能体

    作者基于 Amazon Q CLI 与 MCP 构建了一个 news-agents,用于生成每日新闻摘要,并用 tmux 为每个子智能体单独开窗展示其工作过程。

3月25日周二
  1. DeepSeek(@deepseek_ai)AI 评估 · 78/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    DeepSeek-V3-0324 发布:推理能力提升,改用 MIT 许可开源

    DeepSeek 发布 DeepSeek-V3-0324,在推理性能、前端开发能力和工具调用能力上均有提升。官方建议非复杂推理任务直接使用 V3 并关闭 DeepThink,API 用法保持不变。该版本模型已在 Hugging Face 开源,采用与 DeepSeek-R1 相同的 MIT License。

    为什么值得看

    官方一次给出推理、前端开发与工具调用三项能力变化,并说明 API 不变、改用 MIT 许可,读者可据此判断接入成本。

1月12日周日
  1. Eugene YanAI 评估 · 28/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    AI Reading Club:Dewey 伴读功能与幕后设计

    Eugene Yan 受 Andrej Karpathy 与 Patrick Collison 讨论启发,用 Claude 辅助开发了 AI 阅读应用 AI Reading Club,其核心是 AI 阅读伴侣 Dewey。

6月7日周五
  1. OnBoard!AI 评估 · 25/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    深度对谈顶尖 AI 开源项目:通义千问 Qwen、vLLM、OpenDevin 与中国开源力量

    阿里发布通义千问 Qwen2-72B,表现全面超过 SOTA 的 Llama 3。OnBoard! 播客请到 Huggingface 工程师 Tiezhen Wang、通义千问开源负责人林俊旸、vLLM 主导人李卓翰,畅聊大模型开源生态、Agent 框架与推理基础设施。

5月26日周日
  1. Eugene YanAI 评估 · 57/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    提示词基础与有效应用方法

    Eugene Yan 总结提示词工程的基础做法,指出做大规模提示词优化前需要可靠的评估,并给出“标注约100条评估样本、写初版提示词、跑评估并迭代、上线前在留出测试集上验证”的流程。

6月23日周五
  1. Lilian Weng — Lil’LogAI 评估 · 58/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    LLM 驱动的自主智能体:规划、记忆与工具调用

    Lilian Weng 在这篇 Lil'Log 长文中梳理了 LLM 驱动的自主智能体系统的三大组件:规划、记忆与工具调用。

3月15日周三
  1. Lilian Weng — Lil’LogAI 评估 · 63/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Lilian Weng 长文梳理 Prompt Engineering:从少样本提示到 CoT 与工具调用

    Lilian Weng 在 Lil'Log 发布 Prompt Engineering 综述,将提示工程定义为在不更新模型权重的前提下通过 In-Context Prompting 引导 LLM 行为,并指出其效果因模型差异很大、需要大量实验。