跳到正文

#Meta

今日 1 条
今天10月10日周六
  1. elvis(@omarsar0)AI 评估 · 42/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Meta Superintelligence Labs 论文提出「agent plasticity」:用每美元学习收益衡量自我改进

    Meta Superintelligence Labs 提出用「agent plasticity」衡量自我改进智能体的学习性价比,即在模型权重冻结、每次运行从全新上下文开始的前提下,held-out 任务上的收益除以学习花费。

10月9日周五
  1. 国际大厂AI 评估 · 61/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    TouchScale 发布 500 小时人类视觉-触觉数据集,机器人真机成功率翻番

    德州农工大学、Google DeepMind、CMU 等 15 家机构联合发布 TouchScale,一个在统一传感器与采集流程下构建的 500 小时人类双手视觉-触觉数据集。

9月25日周五
  1. DeepLearning.AI(@DeepLearningAI)AI 评估 · 58/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Meta AI 用专用记忆智能体缓解长上下文遗忘,Claude Sonnet 4.5 基准从 37.6% 升至 45.9%

    Meta AI 将主行动智能体与专用记忆智能体配对,以解决长上下文导致 AI 智能体忘记早期错误的问题。记忆智能体保存关于工具和过往错误的结构化笔记,只在关键时机注入简短提醒。该方案把 Claude Sonnet 4.5 的基准从 37.6% 提升到 45.9%。

9月23日周三
  1. 字节跳动技术团队AI 评估 · 40/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    TWIST 入选 ACM CCS 2026:面向云上大模型服务的隐私保护新方案

    字节跳动安全研究团队与香港城市大学联合研究的 TWIST 被 ACM CCS 2026 接收,该方案用密钥将输入 Token 与模型权重映射到同一变换空间,使云端可沿用标准推理流程处理混淆态数据。

6月29日周一
  1. AI at Meta BlogAI 评估 · 62/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Meta 发布 Brain2Qwerty v2,非侵入式脑电实时解码词准确率达 61%

    Meta 发布 Brain2Qwerty v2,这是可从非侵入式脑记录实时解码句子的端到端流程,实现 61% 的词准确率,而其他非侵入式方法为 8%,表现最好的受试者达到 78%。

5月20日周三
  1. METRAI 评估 · 75/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    METR 发布 2026 年 2-3 月前沿 AI 风险报告:Anthropic、Google、Meta、OpenAI 参与内部智能体评估

    METR 发布 2026 年 2 月 16 日至 3 月 16 日的前沿 AI 风险评估试点报告,Anthropic、Google、Meta 和 OpenAI 参与,METR 获得了各家当时最强内部模型(含原始思维链)的访问权限。评估认为这些内部智能体很可能具备发起小规模未授权部署的手段、动机和机会,但尚不具备使其高度稳健的能力;METR 计划在 2026 年晚些时候再次开展类似评估。

5月11日周一
  1. Import AI — Jack ClarkAI 评估 · 26/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Import AI 456:RSI 与经济增长、AI 监管的"激进可选项"、以及神经计算机

    法律与 AI 研究所提出"激进可选项"监管思路:短期避免过度监管,同时快速建设信息收集权、举报人保护、政府间信息共享等制度工具以应对强大 AI 的冲击。Meta 与 KAIST 的论文提出神经计算机(NC),将计算、内存与 I/O 统一在学习到的运行时状态中。