Gemini 4 발표 뒤 일부 내부 관계자들이 코딩의 일관성과 프런트엔드 작업 품질에 의문을 제기했다고 보도됐습니다. 높은 벤치마크 점수에 비해 완성도 높은 앱을 만드는 실제 업무에서는 성능 편차가 있다는 주장입니다. 구글은 코딩 성능이 떨어진다는 평가에 동의하지 않았고 내부에서도 경쟁력을 높게 보는 의견이 전해졌습니다. 이는 출시 자체와 구분되는 후속 평가 논쟁이지만 동일 조건의 공개 재현 실험은 아닙니다. 제한된 이용 범위에서 나온 평가를 전체 사용자 경험으로 일반화하지 않아야 합니다.
Tech로 돌아가기
Tech
Gemini 4, 벤치마크와 실제 코딩 성능의 격차 논쟁
익명 평가도 공급자 점수도 단독 결론으로 삼지 말고 자신의 실제 작업으로 성능을 검증해야 합니다.