클로드 파블 5, AI 코딩 순위 2위로 하락
클로드 페이블 5가 왕좌를 내주었습니다. 중국의 문샷 에이아이(Moonshot AI)에서 개발한 새로운 모델 키미-K3가 최근 아레나(Arena)의 순위에서 최고의 웹사이트 코드 작성 모델로 등극했습니다. 키미-K3는 1,679점을 획득했고, 페이블 5는 1,631점을 기록했습니다. 아레나는 AI 모델 순위를 매우 단순하게 매깁니다. 사람들은 두 개의 숨겨진 모델에 동일한 작업을 부여하고, 더 나은 결과에 투표합니다. 웹 코딩 순위판만 놓고 보아도 96개 모델에 걸쳐 약 47만 표가 집계되었습니다. 키미-K3가 클로드 페이블 5를 어떻게 이겼는가 이 승리는 예고 없이 나타났습니다. 문샷의 이전 모델 키미-K2.6은 18위에 머물렀습니다. 새 모델은 단번에 1위로 올라섰습니다. 후원 This is a 17-place jump from Kimi-k2.6 (#18 - #1). 48점 차이는 간발의 승부가 아닙니다. 페이블 5는 3위 GPT-5.6(OpenAI)보다 불과 13점 앞서 있습니다. 키미-K3는 마케팅 페이지, 데이터 대시보드, 소비자 앱 등 7개 코딩 부문 중 6개에서 1위를 차지했습니다. 클로드 페이블 5는 ‘게이밍’ 부문에서만 1위를 지켰습니다. 아레나 프론트엔드 코드 순위표에서 키미-K3가 클로드 페이블 5를 앞서 있는 모습입니다. 출처: Arena.ai 앤트로픽(Anthropic)은 여전히 20위 내에 9개 모델을 올려놓으며 저변을 넓게 차지하고 있습니다. 그러나 이번 시점은 앤트로픽에게도 뼈아픕니다. 며칠 전 일론 머스크는 “앤트로픽이 업계의 선두주자”라고 평가했습니다. 순위는 논쟁을 일으키기도 합니다. 과거 클로드 관련 AI 벤치마크 논란이 그 예입니다. 마크 저커버그의 뮤즈 스파크 1.1도 출시 후 며칠 만에 11위에 올랐습니다. 단순 순위 이상의 의미 더 큰 맥락이 있습니다. 키미-K3는 경쟁 모델보다 가격이 저렴합니다. 문샷은 공식 문서에서 입력 100만 토큰당 3달러, 출력은 15달러로 책정했습니다.