Google이 앱 신규 작성과 대규모 리팩터링, 플랫폼 이전 등 장기 과제를 평가하는 Android Bench 2.0을 공개했습니다. 기능과 화면 충실도, 회귀를 연속 점수로 측정하고 비용 및 모델 제공자의 에이전트 조합도 제시합니다. 장기 과제 최고 통과율은 GPT-6 Astra의 약 28%로 기존 과제의 약 91%보다 낮지만 평가 대상이 달라 성능 퇴보를 뜻하지 않습니다. 익숙한 코드 변환보다 런타임 검증과 구조 변경이 어려워, 실제 맡길 업무와 유사한 항목을 봐야 합니다.
Tech로 돌아가기
Tech
Android Bench 2.0, 며칠 걸리는 개발 과제 도입
기존의 짧은 수정 과제 점수와 직접 비교하지 말고, 완성도와 비용 및 실행 에이전트를 함께 봐야 합니다.