跳到正文
原文
谷歌开发者·· 11 天前AI 评估 · 34/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

Android Bench 2.0 发布:以长周期任务拓展 AI 开发评估前沿

Android Bench 2.0: 以长周期任务拓展 AI 开发的技术前沿

AI 导读

谷歌发布 Android Bench 2.0,引入长周期任务(LHT)与智能体评估,改用持续评分法替代通过/失败二元评分。LHT 最高通过率约 28%,远低于原始任务的约 91%;跨平台应用移植到 Android 仍无模型达到 100% 通过率,前沿模型完成率最高 80%。

来源:谷歌开发者 · mp.weixin.qq.com