통제하는 텍스트 경계에는 UTF-8을 써
현대 파일·웹·소스의 보통 선택은 UTF-8이야. 다만 오래된 Windows 도구, CP949, 예전 Excel 출력처럼 다른 인코딩이 실제로 존재하므로 파일의 계약을 확인해.
BOM과 decode 오류를 읽어
utf-8-sig는 앞의 BOM이 있으면 없애고, utf-8은 문자로 남겨. UnicodeDecodeError는 어느 바이트 위치가 규칙에 맞지 않는지 알려주므로 무작정 무시하지 마.
추정은 증거가 아니야
chardet 같은 도구는 후보와 확률을 줄 뿐이야. 다시 얻기 어려운 자료는 원본 bytes를 먼저 보관하고 UTF-8 사본을 별도로 만들어 대표적인 한글·기호·줄바꿈을 확인해. errors='ignore'는 조용한 데이터 손실이야.