본문 바로가기
C.W.K.
Stream
Lesson 04 of 05 · published

강점, 한계, 그리고 회상의 벽

~12 min · limitations, recall, language-modeling

Level 0관찰자
0 XP0/50 lessons0/14 achievements
0/100 XP to next level100 XP to go0% complete

Hyena가 빛나는 데이터 모양이 있어

Hyena는 유전체학을 닮은 작업에 강해. 시퀀스가 아주 길고, 무늬가 자연어보다 규칙적이며, 정확한 검색 능력을 조금 잃어도 되는 경우야.

  • 유전체 모델링 — DNA, RNA, 단백질 시퀀스를 다뤄. 대표 사례는 Evo 2이고 그 전신은 HyenaDNA야.
  • 바이트 단위 모델링 — 토크나이저 없이 바이트에서 바로 동작해 토큰화한 형태보다 시퀀스가 약 4배 길어.
  • 시계열 예측 — 주기 구조가 강한 데이터에서는 합성곱의 귀납 편향이 잘 맞아.
  • 긴 문맥 문서 처리 — 검색보다 통계적 무늬를 잡는 작업에 어울려.

자연어와 회상에서는 밀려

표준 규모의 언어 모델링에서 Hyena는 경쟁력은 있지만 우세하지는 않아. 360M 규모에서 perplexity가 10.11이었고 어텐션은 8.39였어. 규모를 키우면 차이가 줄지만 완전히 닫히지 않고, 언어 작업에서는 보통 Mamba 계열이 앞서.

가장 큰 한계는 회상이야. 회상 중심 벤치마크에서 Hyena는 약 5.1점, 어텐션은 47.7점을 냈어. 특정 과거 토큰을 찾는 능력이 거의 한 자릿수 배 약한 셈이지. Mamba보다도 뒤져. Hyena 필터는 내용이 아니라 위치에서 만들어져 토큰별 선택성이 없거든.

학습도 예민해

Hyena가 안정적으로 학습되는 학습률 구간은 Mamba보다도 좁아. 암시적 필터 FFN이 초기화에 민감하고 공개된 조리법을 조심스럽게 따르지 않으면 수렴이 쉽게 흔들려. 연구소에는 추가 비용이고 제품 팀에는 진입 장벽이야. StripedHyena 밖에서 언어 모델링 채택이 넓어지지 않은 이유 가운데 하나지.

External links

Exercise

회상 중심 벤치마크(LongBench QA 작업이나 합성 key-value 검색 자료)를 골라 StripedHyena-7B 체크포인트를 실행해. Llama-2 7B 기준 모델과 점수를 비교해. 그런 다음 같은 체크포인트를 GovReport 같은 긴 문맥 요약 작업에서 돌려. 두 작업에서 상대적인 성적이 뒤집힐 거야. Hyena는 QA에서 지고 요약에서는 종종 이기거나 비겨. 회상과 요약의 축을 숫자로 확인하는 실험이야.

Progress

Progress is local-only — sign in to sync across devices.
이 페이지에서 버그를 발견하셨거나 피드백이 있으세요?문제 신고

댓글 0

🔔 답글 알림 (로그인 필요)
로그인댓글을 남기려면 로그인해 주세요.

아직 댓글이 없어요. 첫 댓글을 남겨보세요.