Oossa

Google推出Android Bench 2.0:新增长期任务与评分体系

新版基准测试加入历时数天的开发任务,采用智能体评估和分级评分,衡量AI助手的Android编程能力。

简讯作者: Oossa 发布日期: 1 分钟阅读

Google发布了Android Bench 2.0,这是其面向AI模型的Android开发基准测试的升级版。新版本加入了长期任务,完成这些任务可能需要工程师花上几天甚至一周;评估对象也从代码片段扩展到了智能体。评分方式改为连续评分,评估功能、视觉还原度和指令遵循情况,而不再只是简单判定通过或不通过。仪表板显示,Claude Opus 5.5在难度最高的任务中以32%的通过率领先。

为什么重要

开发者可以借助这项基准测试,了解哪些AI助手在复杂Android项目中更可靠。

这篇文章有帮助吗?
分享

继续阅读

Oossa · 新闻简报

一周 AI,讲明白

每周一,用通俗的语言讲清值得知道的新闻。免费,无垃圾邮件。