跳到正文

#MCP/工具调用

今日 0 条
10月5日周一
  1. clem 🤗(@ClementDelangue)AI 评估 · 66/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Hugging Face 用代理把 Claude Code、Codex 等 10 个编码 harness 变成 RL 训练环境

    Hugging Face 的 Clement Delangue 介绍,团队在不改动 harness 和训练代码的前提下,把 Claude Code、Codex。

  2. AINLPAI 评估 · 69/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    微软与 UCSB 提出 ScholarEvolve:用论文进化 Agent Harness

    微软与加州大学圣巴巴拉分校研究者公开论文 ScholarEvolve,从已发表 Agent 研究中提取改进思路,写入运行框架 Harness,再用真实任务检验,执行任务的模型本身保持不变。

10月4日周日
  1. 机器之心AI 评估 · 50/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    南洋理工大学安波团队研究:Agent Harness 如何按模型与任务组合选择

    新加坡南洋理工大学安波教授团队发布报告《Finding the Right Fit: Model–Harness Interactions across Agent Tasks》。

9月10日周四
  1. Harrison Chase(@hwchase17)AI 评估 · 65/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Harrison Chase:智能体的改进是 harness 改进而非模型改进

    LangChain 创始人 Harrison Chase 提出,智能体改进是 harness 改进而非模型改进,值得做的干预多在工具边界,例如传入什么上下文、何时提供工具、失败如何恢复、事后衡量什么,并表示这正是 deepagents 编排逻辑加 LangSmith 衡量能力要构建的闭环。