7月9日,谷歌宣布改版Android Bench代码开发者排行榜,引入标准化Harbor沙箱框架,将测试迁移至安全隔离环境,并通过GitHub开源基准测试,支持社区提交Android开发任务和模型评估。重新测定结果显示,Anthropic Claude Fable5以84.5%准确率居首,OpenAI GPT-5.5以80.2%列第二,谷歌Gemini 3.1 Pro位列第五。Gemini单次迭代成本约87美元,低于部分顶级模型;Gemini 3.5 Flash在百题评估中耗时28小时、成本165美元。