회상의 벽은 모양만 다를 뿐 남아 있어
RWKV-7은 passkey retrieval에서 약 28K 토큰까지 좋은 성능을 유지하다가 그 뒤로 떨어져. Mamba와 실패하는 모양은 달라. RWKV의 지수 감쇠와 Mamba의 선택적 압축이 서로 다른 망각 무늬를 만들기 때문이야. 그래도 범주는 같아. 크기가 고정된 상태에는 임의로 많은 정보를 담을 수 없어.
이 퀘스트가 계속 같은 벽을 만나는 이유야. 어텐션을 바꾸려는 아키텍처는 저마다 다른 문맥 길이와 다른 모양으로 유한 상태의 벽에 닿아. RWKV는 대략 28K 근처고 Mamba도 비슷해. Hyena도 모양이 다를 뿐 벽은 있어. Transformer에는 이 회상 벽 대신 큰 계산 비용이 있고.
생태계도 현실적으로 봐야 해
RWKV 생태계는 대안 아키텍처치고 놀랄 만큼 넓지만 Transformer보다는 훨씬 작아. 미세 조정 조리법, 지시 조정 변형, 평가 도구, RLHF 기반 시설이 모두 얇아. 벤치마크에서 경쟁력을 얻으려면 구조적 제약을 보완할 학습 토큰도 더 필요해. 그래서 작은 미세 조정 실행은 비슷한 Transformer 미세 조정보다 더 빨리 단단한 천장에 닿을 수 있어.
반대로 작은 생태계에는 기여할 자리도 많아. 연구자나 취미 개발자가 흔적을 남기고 싶다면 2026년의 Transformer 도구보다 RWKV 쪽에 손쉽게 따낼 결실이 더 많아.
다음은 v8 Heron과 RWKV-X야
RWKV-8 "Heron"은 두 가지 아이디어를 가져와. DeepEmbed는 VRAM 부대 비용 없이 edge-MoE처럼 희소하게 동작해서 추론 메모리를 늘리지 않고도 실제로 활용할 수 있는 모델 용량을 키워. ROSA는 구조화된 지식을 위한 신경기호 suffix automaton이야. 순환 아키텍처에 명시적인 기호 상태를 들여오지.
RWKV-X(2025.4)는 회상 한계에 대한 하이브리드 답이야. RWKV 층에 희소 어텐션 층을 섞어서 Jamba와 Nemotron-H의 SSM-어텐션 구성을 되풀이해. 하이브리드로 수렴하는 흐름은 Mamba에만 있는 게 아니라 계열 전체에서 나타나고 있어.