谷歌改版Android Bench:Claude Fable5登顶,Gemini 3.1 Pro列第五

7月9日,谷歌宣布改版Android Bench代码开发者排行榜,引入标准化Harbor沙箱框架,将测试迁移至安全隔离环境,并通过GitHub开源基准测试,支持社区提交Android开发任务和模型评估。重新测定结果显示,Anthropic Claude Fable5以84.5%准确率居首,OpenAI GPT-5.5以80.2%列第二,谷歌Gemini 3.1 Pro位列第五。Gemini单次迭代成本约87美元,低于部分顶级模型;Gemini 3.5 Flash在百题评估中耗时28小时、成本165美元。

上一篇:

下一篇:

发表回复

登录后才能评论