본문 바로가기
C.W.K.
Stream
Lesson 02 of 05 · published

순위가 아니라 문턱

~13 min · measurement, statistics, judgment, instruments

Level 0젖은 흙
0 XP0/36 lessons0/12 achievements
0/100 XP to next level100 XP to go0% complete

착지한 측정

항목 일흔여덟 개에 독자 점수가 붙자, 하루 종일 실패하던 그 연습이 통하는 걸 하나 만들어냈어. 이긴 측정은 어떤 대리 지표보다도 결함에 가까이 갔어. 대신 세우는 게 아니라 직접 세는 거였거든. 목표어여야 할 산문에서 원어 문자로 쓰인 비율. 가까운 거지 같은 건 아니고, 왜 그런지는 이 강의 자기 주의사항이 말해줘. 독자가 20/20 을 준 항목 둘이 26 퍼센트랑 37 퍼센트에 앉아 있어. 거기선 그 문자가 원어 그대로가 맞는 식별자랑 명령어를 나르고 있거든.

영리한 게 아냐. 제일 나쁜 항목들이 뜻을 나르는 단어는 그대로 두고 문법만 번역했다고 독자들이 말할 때 서술하던 그것을 직접 센 거야. 독자 총점이랑의 상관관계가 강한 음수로 나왔고, 바닥 구간의 육십삼 퍼센트가 표시된 데 비해 꼭대기 구간은 이십삼 퍼센트였어.

모양은 계단이고, 그 모양이 이야기 전부야

상관계수는 중요한 걸 가려. 구간별로 묶으면 그 관계는 기울기가 아냐. 대략 사십 퍼센트 아래에선 항목들이 잘 나오고, 그 선을 넘으면 무너지고, 그 너머로는 그 양이 더 많아도 아무것도 더 예측 안 해. 칠십 퍼센트가 사십오 퍼센트보다 나쁘지 않아.

그러니 정직한 진술은 순위가 아니라 문턱이야. 그리고 그건 취향이 아니라 데이터가 뒷받침하는 바야. 이걸로 작업 목록을 줄 세우는 건 이 측정한테 구조가 없다고 증명된 구간에서 구조를 읽어내는 거고. 작업 목록을 줄 세우는 건 독자의 총점이야. 이 측정이 하는 일은 뭐가 선의 어느 쪽에 떨어지는지를 말하는 거고.

각각 하중을 받는 경계 셋

게이트가 될 수 없어. 좋은 기술 자료는 이 측정에서 정당하게 높게 나와. 식별자랑 명령은 원어로 쓰인 게 맞으니까. 독자한테 만점 받은 항목 둘이 26 퍼센트랑 37 퍼센트에 앉아 있어. 선 아래라서 지금 그은 선은 통과시키고, 여유가 딱 그만큼밖에 없다는 뜻이야. 나쁜 구간을 더 잡겠다고 문턱을 세 점만 조여도 만점짜리가 유죄 판결을 받아.

놓쳐. 어떤 항목은 측정 비율이 낮은데 독자한테 완전 영점을 받았어. 전혀 다른 이유로 나빴고, 그 이유는 어떤 세는 계기도 못 봐. 이 측정을 통과했다는 게 무혐의는 아냐.

솔깃한 변종 하나는 헛것이야. 같은 신호처럼 느껴지던 관련 패턴이 거의 0 에 가까운 상관을 냈고, 아무도 다시 안 짓게 특별히 기록해뒀어. 그 패턴은 사방에 나와. 완벽하게 읽히는 항목에서도 나와.

이 측정이 뭘 해도 되는지 정하기 전에 기준 진실에 대고 구간별로 묶어봐. 상관계수는 네가 순위를 가졌다고 믿게 놔둬. 구간 묶기는 네가 순위를 가졌는지, 문턱을 가졌는지, 우연을 가졌는지 보여주고. 그 셋은 완전히 다른 용도를 허가해.

Code

같은 측정, 계수로 볼 때와 구간으로 볼 때·text
AS A CORRELATION - looks like a ranking

  source-alphabet share of target prose   r = -0.70
  source stem + target verb ending        r = -0.35
  bare source discourse adverbs           r = -0.30
  source token + space + grammar particle r = -0.13   <- a dud


BINNED AGAINST READER SCORES - is a STEP

  share    items   mean reader score (0-20)
  -----    -----   ------------------------
  0-39%      28    13 - 18 *    <- fine  (* one band, several
                                            sub-bins; means run 13 to 18)
  40-49%      5     6.6         <- collapsed
  50-59%     16     6.5
  60-69%     21     6.8
  70-79%      8     5.6         <- not meaningfully worse

  Past ~40% the relationship is FLAT. Within the flagged set this
  measure carries no ordering information at all, so it must never
  sort the worklist. The reader's total does that.


AND THE CAUTIONS, EACH FROM A REAL ITEM
  cannot gate  : two items scored 20/20 by a reader sit at 26%
                 and 37% - identifiers and commands are CORRECT
                 in the source language
  it misses    : one item scored 0/20 at 13.8% - broken for a
                 different reason no counter can see
  the dud      : r = -0.13. the spaced-particle pattern appears
                 everywhere, including in items that read
                 perfectly. recorded so nobody rebuilds it.

External links

Exercise

팀이 정렬 기준으로 쓰는 지표를 하나 잡고, 모을 수 있는 기준 진실에 대고 구간별로 묶어봐. 손으로 판정한 항목 스무 개라도 좋아. 계수 말고 모양을 봐. 계단이면 그걸로 정렬하는 걸 멈추고 거르는 데 쓰기 시작해. 어디서나 평평하면, 아무 이유 없이 주의력을 몰아온 숫자를 하나 찾은 거고.
Hint
품질 근처의 측정에선 기울기보다 계단이 훨씬 흔해. 밑에 깔린 현상이 대개 연속체가 아니라 범주라서. 뭔가는 그 망가진 짓을 하고 있거나 안 하고 있거나 둘 중 하나고, 그다음에 그걸 얼마나 많이 하느냐는 대부분 길이 문제거든.

Progress

Progress is local-only — sign in to sync across devices.
이 페이지에서 버그를 발견하셨거나 피드백이 있으세요?문제 신고

댓글 0

🔔 답글 알림 (로그인 필요)
로그인댓글을 남기려면 로그인해 주세요.

아직 댓글이 없어요. 첫 댓글을 남겨보세요.