Google ra Android Bench 2.0 đánh giá AI trên các tác vụ phát triển phức tạp kéo dài nhiều ngày
Android Bench 2.0 focuses on long-horizon tasks, agent evaluations

Tóm tắt nhanh
- Android Bench 2.0 của Google chuyển trọng tâm sang các tác vụ phức tạp tốn nhiều ngày hoặc cả tuần như thêm tính năng mới, xây app từ đầu và chuyển app đa nền tảng sang Android.
- Google giới thiệu chấm điểm liên tục thay vì pass/fail, tính toán completion rate dựa trên chức năng, fidelity hình ảnh và tránh regressions, kèm hình phạt khi lệch hướng đánh giá hoặc cấu trúc.
- Google đã chấm các model như Gemini 3.7/3.8 Flash, OpenAI GPT-6, Anthropic Fable 5.1, Kimi K3 và Qwen 3.8 Max; GPT-6 Astra dẫn đầu với pass rate 28% theo cách chấm mới.
- Google nêu rằng porting app đa nền tảng vẫn là thách thức lớn (không model nào đạt 100% pass; frontier models đạt tối đa ~80% completion), và AI tốt hơn khi viết mã mới so với refactor hoặc migration.
- Android Bench nhận thấy model mạnh với chuyển đổi xác định (ví dụ Java→Kotlin, Retrofit→Ktor, thêm ViewModel) nhưng gặp khó khi cần xác thực runtime, thay đổi framework lớn hoặc thư viện chưa ra mắt.
- Với đánh giá agent, Android Bench chạy agent từ nhà cung cấp tương ứng (ví dụ Gemini 3.8 Flash trên Google Antigravity, GPT-5.6 Sol với Codex) và cho biết thiết kế harness ảnh hưởng tích cực tới kết quả phát triển.
Tóm tắt tự động bằng AI từ bài gốc, có thể có sai sót. Hãy kiểm chứng ở bài gốc.
Trích đoạn bài gốc
Google’s development of Android Bench continues today with a version 2.0 that reflects how AI can handle more complex development tasks.Tapview chỉ hiển thị tiêu đề, trích đoạn ngắn, tóm tắt và đường dẫn tới bài gốc. Nội dung gốc thuộc bản quyền của 9to5Google.





