AI 도구 · 자동화 · 생산성
1개의 글 · #모델비교
MMLU 88.3% vs 87.9%. 0.4%p 차이로 중국 LLM이 Claude를 넘어섰다는 발표가 나왔다. 제가 확인한 공식 벤치마크 결과는 분명했지만, 실제로 같은 번역 작업을 두 모델에 맡겼을 때 체감 격차는 거꾸로였어요. 벤치마크 우위가 실무 선택을 바꿔야 할 이유는 아니…