공지사항
강유진(AI박사) NeurIPS 논문 게재 승인
2026-10-02 09:48:04
|
관리자
|
조회수: 161
강유진(AI대학원, 박사과정)
AI대학원 강유진(박사과정)의 논문 What Do SAE Features Encode? Evidence from Human Neural Activity이 NeurIPS 2026에 게재 승인되었다.
본 연구는 대규모 언어모델(LLM)의 내부 표현을 해석 가능한 피처로 분해하는 희소 오토인코더(Sparse Autoencoder, SAE)가 실제로 모델 바깥의 구조를 포착하는지를 인간의 뇌 활동을 통해 검증하였다. 사전학습된 SAE 피처를 사람이 같은 글을 읽을 때의 뇌 신호와 표상 유사성 분석(RSA)을 통해 피처 단위로 비교한 결과, 이들 피처가 뇌 활동과 체계적으로 정렬됨을 확인하였다. 특히 PCA 등 다른 분해 기법과 달리 SAE만이 양의 정렬을 보여, 이러한 대응이 SAE가 학습한 sparse code에서 주로 비롯됨을 밝혔다. 또한 단일의미성(monosemanticity)이 높은 피처가 뇌와 더 잘 정렬됨도 보였다. 이를 통해 본 연구는 SAE 평가에 모델 내부 지표를 보완하는 외부 타당성 기준을 제시하였다. 또한 그간 모델 내부에서만 판단되던 해석 가능성 기준을 인간의 뇌 신호로 뒷받침함으로써 해석 가능성 연구와 신경과학을 잇는 연결고리를 마련하였다.
본 연구는 중앙대학교 인공지능대학원 지원사업을 통해 진행되었다.
| 이전글 | 이재용 교수 연구팀(MAISC 연구실) ICML 2026 논문 2편 채택 |
|---|---|
| 다음글 | 다음 글이 없습니다. |