개인 연구 노트

모델과 시스템,
설명 가능한 것의 경계에 대해 씁니다.

AI, mechanistic interpretability, 도구를 사용하는 시스템, 그리고 그 사이에서 아직 이름 붙이지 못한 문제들을 기록합니다.

  1. 이미 블랙박스가 아닌 것부터 걷어내자

    활성화된 회로보다 어떤 계산이 호출될지를 정하는 내부 컴파일 과정이 더 깊은 블랙박스일 수 있다는 가설.