Lenny Rachitsky(@lennysan)· Lenny Rachitsky (@lennysan)·· 19 小时前AI 评估 · 47/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。
Surge 推出 sudo L7 基准:测试 AI 距离资深工程师还有多远,最佳智能体仅通过约 45% 任务
Sweet new benchmark from Surge looking at how close AI is getting to a staff-level software engineer...
AI 导读
Surge 发布 sudo L7 新基准,用于衡量 AI 距离 staff 级软件工程师的水平——结论是"我们走了一半"。该基准含 60 个任务,多数来自真实公司的私有生产仓库,由真正负责过这些系统的工程师编写,评分维度涵盖功能正确性、工程手艺、架构判断、协作与冗余复杂度。表现最好的智能体仅能成功完成约 45% 的任务,coding agent 仍停留在 L3 水平。
来源:Lenny Rachitsky(@lennysan) · x.com