2025년 11월 13일, OpenAI는 "희소 회로를 통한 신경망 이해"라는 제목의 연구 및 논문을 발표하여 "가중치 희소 변환기"를 통해 신경망의 기계적 해석 가능성을 향상시킬 것을 제안했습니다. 사후 고밀도 네트워크의 "얽힘 해제"와 달리 이 작업은 훈련 단계에서 대부분의 가중치를 0으로 직접 제한하여 각 뉴런이 소수의 채널에만 연결되도록 하여 모델이 명확한 구조를 가진 희소 회로를 형성하도록 장려합니다. 연구팀은 일련의 간단한 수동 설계 작업에 대해 검증한 결과 이러한 희소 모델에서 크기가 작고 구조가 완전하며 작업을 완료하기에 충분한 회로를 가지치기할 수 있으며 이러한 회로의 노드는 종종 "문자열 시작 부분의 따옴표 유형 감지"와 같은 직관적인 개념에 해당합니다.
이논문은 동일한 사전 훈련 손실 하에서 가중치 희소 모델에서 동일한 작업을 완료하는 데 필요한 가장 작은 회로의 규모가 밀도 모델에 비해 한 자릿수 이상 감소할 수 있음을 보여주며, 이는 내부 계산이 더 "분해"되었음을 나타냅니다. 동시에, "희소성-능력" 곡선을 따라 희소성을 높이면 특정 능력이 희생되지만 해석 가능성이 향상되는 반면, 희소성을 유지하면서 총 매개변수 수를 확장하면 "능력-설명 가능성" 경계의 전반적인 이동을 유리한 방향으로 촉진할 수 있습니다. 이 연구는 또한 완전히 설명하기 어렵지만 여전히 모델 동작에 대한 예측 구조적 설명을 제공할 수 있는 변수 결합과 같은 더 복잡한 동작을 가진 회로의 몇 가지 예를 보여줍니다.
OpenAI는 이 작업을 보다 설명 가능한 대규모 모델을 향한 초기 단계로 포지셔닝하며, 현재의 가중치 희소 모델이 최첨단 시스템보다 훨씬 작고 훈련 및 배포 효율성이 현저히 낮기 때문에 직접적으로 가장 강력한 프로덕션 모델이 될 가능성은 낮다는 점을 인정합니다. 팀은 두 가지 후속 경로를 제안했습니다: 첫째, 희소 모델의 규모를 지속적으로 확장하고, 회로 패턴 라이브러리를 풍부하게 하며, 보다 복잡한 추론 행동을 이해하기 위한 기반을 마련합니다. 두 번째는 기존의 고밀도 모델에서 희소 회로를 추출하고 "브리징" 방법을 통해 희소 모델을 원래 모델 표현과 정렬하여 해석 가능한 근사 대체자가 되도록 하는 것입니다. OpenAI는 또한 관련 희소 모델 가중치, 가지치기 회로 및 시각화 코드를 오픈 소스로 제공하여 후속 재생산 및 확장 연구의 기반을 제공합니다.
자주 묻는 질문(FAQ
) Q: "희소 회로"는 정확히 무엇을 의미합니까?
A: 이 작업에서 "희소 회로"는 가중치 희소 변압기에서 정리된 가장 작은 하위 네트워크를 의미하며, 여기에는 특정 작업을 수행하는 데 필요하고 충분한 소수의 노드와 연결이 포함되어 있습니다. 노드는 개별 뉴런, 어텐션 헤더 채널 또는 잔차 채널일 수 있으며, 가장자리는 0이 아닌 가중치에 해당합니다.
Q: 일반적으로 "설명 가능한 AI"라고 하는 것과 어떻게 다른가요?
A: 일반적인 해석 가능한 방법은 대부분 입력, 출력 또는 중간 활성화에 대한 사후 분석이지만 여기서는 기계적 해석 가능성에 속하며 모델이 구현한 "알고리즘"을 가능한 한 하위 수준에서 역축소하는 것이 목표입니다. 무게 희소성과 가지치기를 강요함으로써 이 연구는 완전한 블록 다이어그램으로 그릴 수 있는 특정 회로를 제공하고 정보의 흐름을 단계별로 추적합니다.
Q: 이러한 결과를 GPT 수준의 대규모 모델로 직접 일반화할 수 있나요?
A: 이 논문은 현재의 희소 모델에는 0이 아닌 매개변수가 수천만 개에 불과해 최첨단 대형 모델의 규모와 능력과는 거리가 멀고, 희소 훈련은 컴퓨팅 성능과 효율성 측면에서 비용 효율적이지 않기 때문에 동일한 방법이 더 크고 강력한 모델에서도 똑같이 효과적이라고 주장할 수 없다고 분명히 지적합니다. 저자는 이를 "유망하지만 초기" 탐구로 포지셔닝합니다.
Q: 설명 가능성을 위해 능력을 희생하는 이유는 무엇입니까?
A: 안전하고 신뢰할 수 있는 배포 시나리오에서는 완전히 불투명한 고기능 모델을 경고하고 수정하기 어려울 위험이 있습니다. 희소성을 높임으로써 잠재적으로 유해한 행동의 메커니즘을 더 쉽게 분석하기 위해 더 작고 명확한 회로를 교환할 수 있으며, 이는 다시 더 강력한 모델의 검토, 디버깅 및 정렬을 위한 단서를 제공하며, 이는 훈련 중에 해석 가능성을 위해 사전에 "공간을 예약"하는 아이디어입니다.
Q: 일반 연구자들이 이 작업을 기반으로 실험을 재현하거나 계속 할 수 있나요?
A: OpenAI는 모든 희소 모델의 가중치, 가지치기된 회로, 회로 시각화 코드 저장소에 대한 링크를 종이 첨부 파일에 제공하여 외부 팀이 실험을 재현하고, 더 많은 작업을 테스트하거나, 더 높은 수준의 행동 패턴을 탐색하는 데 도움을 주어 기계론적 해석 가능성 커뮤니티를 위한 보다 체계적인 실험 플랫폼을 제공합니다.