HeadlinesBriefing favicon HeadlinesBriefing.com

Google Android Bench 2.0:AI 编程测试结果

Android Central •
×

Google 推出了 Android Bench 2.0,用于在可能需要数天才能完成的复杂 Android 开发任务上测试 AI 模型。这个新基准测试包含升级依赖项、添加重大功能以及从零开始构建 Android 应用等任务。

GPT-6 Astra 目前在 Google 的新基准测试中领先,通过率为 28%,而 Gemini 3.8 Flash 仅得分 8%

Google 宣布了 Android Bench 2.0,这是其基准测试的更新版本,用于评估大型语言模型(LLM)和 AI 智能体处理复杂 Android 开发任务的能力。今年早些时候,Google 推出了 Android Bench 的第一个版本,以衡量 AI 模型在真实世界 Android 开发工作中的表现。该公司现已将基准测试更新为 Android Bench 2.0,旨在针对更复杂的任务来评估模型和智能体,从而更好地反映实际的软件开发。

其中最大的新增内容之一是 Google 所称的长周期任务(LHT)。这些是明显更复杂的开发工作,人类工程师可能需要数天甚至一周才能完成。Google 表示,第一版 Android Bench 以及许多其他早期 AI 编程基准测试主要关注较小的增量更改。Android Bench 2.0 旨在通过升级依赖项、添加重大新功能,甚至从零开始构建 Android 应用等任务来提高标准。

借助 Android Bench 2.0,Google 改变了模型的评分方式。Android Bench 2.0 不再完全依赖二元的通过或失败系统,而是使用“连续评分”。该公司表示,即使模型未能完全完成任务,这也能更“有意义地表明”模型的表现如何。

Google 已经使用新基准测试测试了多款最新 AI 模型,包括 Gemini 3.8 Flash、GPT-6 Astra、Claude Fable 5.1、GPT-5.6 Sol 和 Claude Opus 5 等。根据结果,GPT-6 Astra 目前以 28% 的通过率位居基准测试榜首。与此同时,Gemini 3.8 Flash 仅得分 8%。

Google 表示,针对 LHT 数据集测试模型应能让其更好地了解这些模型的优势和劣势,同时也为开发者提供更实用的指导,说明哪些模型更适合不同的 Android 开发任务。更新后的 Android Bench 2.0 排行榜现已可用,Google 表示计划随着时间推移继续扩展更多模型和结果。

关键实体:公司:Google、Android Central | 人物:Nicholas Sutrich、Sanuj

FAQ:什么是 Android Bench 2.0?

Android Bench 2.0 是 Google 更新的基准测试,用于评估 AI 模型处理复杂 Android 开发任务的能力,包括人类工程师可能需要数天才能完成的长周期任务。

FAQ 问题:什么是 Android Bench 2.0?

FAQ 回答:Android Bench 2.0 是 Google 更新的基准测试,用于评估 AI 模型处理复杂 Android 开发任务的能力,包括人类工程师可能需要数天才能完成的长周期任务。