벤치마크 승리가 아니라 형식적인 표현력 결과야
2023년 결과에 따르면 표준 Transformer는 TC⁰ 복잡도 부류 안에 묶여 있어. 다항 크기와 일정한 깊이를 가진 문턱 회로로 표현할 수 있는 문제만 풀 수 있다는 뜻이야. TC⁰ 바깥에만 존재하는 언어와 계산 문제가 있고, 기본 Transformer는 크기를 아무리 키워도 그런 문제를 풀 수 없어.
RWKV-7의 핵심 결과는 분명해. TC⁰를 넘어설 수 있음을 증명했어. 복잡도가 NC¹인 S5 상태 추적 문제를 두 개 층으로 풀 수 있고, 네 개 층이면 모든 정규 언어를 인식할 수 있어. 표준 Transformer는 크기와 무관하게 구조상 풀 수 없는 문제들이야.
실전에서는 상태를 더 잘 붙잡아
TC⁰를 넘었다는 말은 벤치마크용 장식이 아니야. 실제 능력의 차이를 예측해. RWKV-7은 Transformer가 어려워하는 수 세기, 홀짝성, 정규 언어 구조 같은 순차 상태를 더 풍부하게 유지해. 2.9B 모델이 표준 벤치마크에서 평균 72.8점을 냈어. Qwen2.5-3B의 71.4점과 맞먹고 Llama 3.2 3B의 69.7점을 앞서지. 경쟁 모델은 15–18T 토큰을 학습했지만 RWKV-7은 5.6T 토큰만 썼어.
학습 토큰 효율이 중요한 데는 이유가 있어. 데이터 3분의 1만으로 Transformer와 비슷한 벤치마크에 닿았다면 아키텍처가 다른 방식으로 배우고 있다는 신호야. 더 풍부한 상태 동역학이 사례에서 더 빨리 배우게 했을 가능성이 커. RWKV가 단지 다른 수학으로 적은 Transformer가 아니라는 걸 보여 주는 또렷한 근거야.
다만 모든 축에서 우월한 것은 아니야
TC⁰ 돌파는 상태 추적에 관한 결과야. 일반적인 표현력 우위를 뜻하지는 않아. Transformer는 전체 문맥을 병렬로 연상 조회하는 데 아주 강해. 순환 상태를 쓰는 RWKV는 그 축에서는 양보하지. 결론은 RWKV가 Transformer보다 낫다는 게 아니야. 아키텍처마다 속한 계산 복잡도 부류가 다르고, 그 선택이 흔히 생각하는 것보다 중요하다는 거야.