Google ra mắt Android Bench 2.0 để đánh giá AI trên các tác vụ phát triển Android phức tạp
Google just put the latest AI models through a brutal coding test — here's how they did

Tóm tắt nhanh
- Google giới thiệu Android Bench 2.0 để đánh giá LLM và AI agents trên các tác vụ phát triển Android phức tạp hơn.
- Bản cập nhật bổ sung 'long-horizon tasks' (LHTs) gồm công việc có thể mất vài ngày đến một tuần cho kỹ sư con người.
- Các LHT gồm nâng cấp dependency, thêm tính năng lớn và xây app Android từ đầu.
- Android Bench 2.0 chuyển từ điểm pass/fail sang 'continuous scoring' để phản ánh mức độ hoàn thành nhiệm vụ.
- Google đã thử nghiệm nhiều model như Gemini 3.8 Flash, GPT-6 Astra, Claude Fable 5.1, GPT-5.6 Sol, Claude Opus 5.
- Kết quả hiện tại: GPT-6 Astra dẫn đầu với tỉ lệ pass 28%, Gemini 3.8 Flash đạt 8%.
- Google nói LHT giúp hiểu rõ điểm mạnh/yếu của các model và hướng dẫn thực tế cho nhà phát triển.
- Bảng xếp hạng Android Bench 2.0 đã có sẵn và Google sẽ mở rộng với thêm model và kết quả theo thời gian.
Tóm tắt tự động bằng AI từ bài gốc, có thể có sai sót. Hãy kiểm chứng ở bài gốc.
Trích đoạn bài gốc
AI coding models are getting better, but Google's latest test shows there's still a long way to go.Tapview chỉ hiển thị tiêu đề, trích đoạn ngắn, tóm tắt và đường dẫn tới bài gốc. Nội dung gốc thuộc bản quyền của Android Central.





