Hugging Face는 별도 추론 도구가 필요했던 Nunchaku 4-bit 체크포인트를 현재 Diffusers에서 직접 불러오는 통합 경로를 공개했다. 공식 설명에 따르면 이 경로는 가중치와 활성값을 함께 4비트로 다루어 메모리 사용을 낮추면서 잡음 제거 단계의 처리 시간도 줄이는 데 초점을 둔다.

Nunchaku 4-bit를 표준 Diffusers 흐름으로 불러오는 경로

이번 발표의 핵심은 Nunchaku 방식의 체크포인트를 별도 파이프라인이나 별도 추론 엔진 없이 일반 Diffusers 저장소처럼 다루게 한 점이다. 다만 범용 통합은 모델별 융합 실행을 모두 재현하지 않으므로, 공식 글은 호환성과 속도 사이의 차이와 하드웨어 조건을 함께 제시한다.

공식 발표 내용

대규모 확산 변환기에서 양자화가 필요한 배경부터 분명하다. Hugging Face는 현대적인 글자 기반 이미지 생성 모델을 16비트 정밀도로 불러올 때 영상 메모리가 흔히 20~30기가바이트 필요하다고 설명했다. 이 용량은 많은 소비자용 그래픽카드가 감당하기 어렵다. 따라서 체크포인트의 저장 크기만 줄이는 데 그치지 않고, 실제 추론 중 연산량과 메모리 이동을 함께 줄일 수 있는 방식이 중요해진다. 이번 통합은 바로 그 지점을 겨냥해, 이미 Diffusers 안에 있던 여러 양자화 선택지와 구별되는 새 실행 경로를 제공한다.

기존의 여러 양자화 뒷단은 가중치만 낮은 정밀도로 저장하고 계산할 때 다시 높은 정밀도로 풀어 쓰는 방식이다. 이 방식은 메모리 사용량을 크게 낮출 수 있지만 추론을 반드시 빠르게 만들지는 않으며, 복원 과정 때문에 작은 지연이 더해질 수도 있다. Nunchaku가 채택한 방법은 주된 변환기 층의 가중치와 활성값을 모두 4비트로 계산한다. 저장 공간 축소만을 목표로 삼지 않고 잡음 제거 반복 과정의 속도까지 함께 다룬다는 점이 이번 발표에서 제시한 기술적 구분선이다.

활성값까지 4비트로 낮추기 어려운 까닭은 확산 변환기의 가중치와 활성값에 큰 이상치가 함께 나타나기 때문이다. 공식 글이 소개한 해법은 활성값의 이상치를 가중치 쪽으로 옮기고, 각 가중치 행렬에서 처리하기 가장 까다로운 부분을 작은 16비트 저계수 갈래로 남기는 것이다. 나머지 잔차는 4비트로 양자화한다. Nunchaku는 4비트 경로와 저계수 갈래를 결합한 연산핵으로 처리해 이 설계를 실제 추론 속도 개선으로 연결한다. 즉 모든 값을 똑같이 거칠게 줄이는 방식이 아니라, 오차에 민감한 부분과 대다수 계산을 나누어 다루는 구조다.

원래 Nunchaku 엔진은 모델 구조에 맞춘 융합 실행에서 많은 속도 이득을 얻었다. 예를 들어 주의 계산에 필요한 여러 투영을 묶거나, 활성화 함수와 다층 퍼셉트론 연산을 한꺼번에 처리하는 방식이다. 그러나 이런 최적화는 각 구조의 모듈 배치와 체크포인트 형식에 결속된다. 새 모델 계열을 지원할 때마다 별도의 통합 작업이 필요한 이유다. 이번 Diffusers 경로는 그 모델별 결속을 완화하는 대신, 범용 구조 안에서 어떤 최적화를 유지하고 어떤 부분을 포기하는지 공개적으로 구분한다.

사용자 관점에서 가장 큰 변화는 불러오기 절차다. 현재 Diffusers에서는 사전 양자화된 Nunchaku 체크포인트를 일반 모델처럼 불러올 수 있다. 별도 파이프라인 클래스나 별도 추론 엔진이 필요하지 않고, 로컬에서 연산핵을 컴파일할 필요도 없다. 필요한 연산핵은 처음 사용할 때 허브의 전용 페이지를 통해 내려받는다. 모델 저장소에는 어떤 모듈이 어떤 방식으로 양자화됐는지 적은 설정 블록이 들어가며, Diffusers는 이를 읽어 알맞은 실행 층을 만든다. 설치와 불러오기 경로가 표준 흐름에 가까워졌다는 의미다.

내부에서는 일반 Diffusers 모델의 관련 선형 모듈을 체크포인트가 적재되기 전에 양자화 실행 층으로 바꾼다. 계산이 집중되는 주의와 다층 퍼셉트론 투영에는 가중치와 활성값을 함께 4비트로 다루는 연산층을 쓴다. 적응형 정규화와 변조 투영처럼 메모리 이동의 영향을 많이 받고 정밀도에 민감한 부분에는 4비트 가중치와 16비트 활성값을 조합한다. 한 가지 정밀도 규칙을 전체 모델에 일괄 적용하지 않고, 연산 성격에 따라 두 갈래를 배치하는 구성이다.

양자화 모델이 조밀한 원본과 같은 모듈 구조를 유지한다는 점도 호환성의 근거다. 공식 글에 따르면 이 구조 덕분에 일정 조절기, 추가 가중치 불러오기 고리, 중앙처리장치로의 모형 이동, 그래프 컴파일 같은 뒤쪽 기능은 일반 Diffusers 모델을 보는 것처럼 작동한다. 별도 엔진이 전체 실행 흐름을 소유하는 대신 기존 생태계의 구성요소를 계속 쓸 수 있도록 한 것이다. 다만 구조가 같다는 사실은 모든 모델별 융합 최적화가 자동으로 재현된다는 뜻은 아니며, 발표는 이 한계를 별도로 설명한다.

Hugging Face가 제시한 첫 사용 예시는 최신 블랙웰 계열 그래픽카드에서 가로 1024픽셀·세로 1024픽셀 이미지를 약 1.7초에 만들고, 최대 메모리를 약 12기가바이트 사용했다. 같은 예시의 16비트 파이프라인은 약 24기가바이트를 사용했다. 이 수치는 특정 체크포인트가 Nunchaku 변환기와 별도로 양자화한 글자 부호기를 함께 사용한 결과다. 따라서 통합 자체의 보편적 보장이라기보다, 공식 글에 명시된 모델 구성과 하드웨어에서 관측한 사례로 읽어야 한다.

추가 최적화를 조합한 결과도 따로 제시됐다. 변환기 그래프를 컴파일했을 때 공식 측정의 전체 속도 향상 폭은 1.35배에서 1.8배로 커졌다. 변환기 외에 수 기가바이트를 차지할 수 있는 글자 부호기도 낮은 정밀도로 바꾸자 해당 측정에서 최대 메모리가 약 22퍼센트 더 줄었다. 더 작은 그래픽카드에 파이프라인을 맞춰야 할 때는 Diffusers가 제공하는 중앙처리장치 이동 기능을 그대로 사용할 수 있다고 설명한다. 각각은 서로 다른 병목을 다루는 선택지다.

공식 비교표의 모든 수치는 NVIDIA의 블랙웰 계열 전문가용 그래픽카드에서 가로 1024픽셀·세로 1024픽셀 조건으로 측정됐다. Hugging Face는 그 조건에서 최대 메모리를 최대 50퍼센트까지 줄이면서 지연 시간도 대략 30퍼센트 개선했다고 요약했다. 남는 지연의 큰 부분은 연산핵을 더 자주 호출하는 데서 생기며, 그래프 컴파일을 적용한 전체 파이프라인은 1.68초, 16비트 기준보다 1.8배 빠른 결과를 냈다고 적었다. 수치의 장치·해상도·체크포인트 조건이 명시돼 있으므로 서로 다른 환경에 그대로 일반화하지 않는 것이 중요하다.

관련 기능 또는 적용 범위

이번 통합은 준비된 체크포인트를 불러오는 기능에 머물지 않는다. 함께 소개된 압축 도구는 Diffusers 모델을 보정하고, 양자화하고, 파이프라인 형태로 묶고, 저장소에 공개하는 전 과정을 제공한다. 공식 예시는 먼저 모델 구조를 살펴 양자화 대상을 정한 뒤, 변환기를 보정·양자화하고, 나머지 파이프라인 구성요소와 결합해 실제로 다시 불러오는 순서를 따른다. 새 구조를 지원하기 위해 별도 추론 엔진 전체를 기다리는 대신, 표준 저장소 형식 안에서 제작 과정을 이어 갈 수 있게 한 범위 확장이다.

대상을 찾는 단계에서는 반복되는 변환기 블록 안의 호환 가능한 선형층을 가중치·활성값 4비트 대상으로 분류하고, 알려진 변조 선형층은 가중치 4비트·활성값 16비트 대상으로 둔다. 그 밖의 층은 원래 정밀도를 유지한다. 공식 글은 실제 양자화를 시작하기 전에 이 스캔 보고서를 반드시 확인하라고 안내한다. 예시 구조에서는 첫 부류 100개, 둘째 부류 3개, 바깥쪽 원래 정밀도 선형층 6개가 예상되며, 누락된 모양이나 중복 이름이 없어야 한다고 구체적으로 적었다.

양자화가 끝나면 변환기 체크포인트를 파이프라인의 다른 구성요소와 합치고, 변환기 설정 파일에 Nunchaku 실행 정보를 기록한다. 선택에 따라 글자 부호기도 함께 낮은 정밀도로 바꿀 수 있다. 이렇게 만든 저장소는 일반 Diffusers 저장소로 취급된다. 이용자는 사전 학습 모델 불러오기 절차로 가져오고, 제작자는 자신의 저장소 이름으로 허브에 올릴 수 있다. 실행 방식에 필요한 정보가 체크포인트와 설정에 함께 포장되므로, 배포 형식과 불러오기 형식이 한 흐름으로 이어진다.

범용 경로에도 명시적인 전제가 있다. 모델 구조를 바꾸지 않고 양자화할 수 있어야 자동 절차가 그대로 작동한다. 원래 Nunchaku 엔진은 더 높은 속도를 위해 여러 Diffusers 층을 하나의 융합 모듈로 다시 쓰기도 한다. 그러나 범용 스캐너는 떨어져 있는 질의·키·값 투영을 한 모듈로 합치거나, 이미 합쳐진 투영을 여러 모듈로 나누는 구조 변경을 스스로 추론하지 못한다. 따라서 모든 모델을 같은 설정만으로 변환할 수 있다고 발표한 것은 아니다.

공식 글은 FLUX 계열을 구조 변경의 구체적 예로 든다. Diffusers 쪽에는 질의·키·값을 위한 세 모듈이 따로 있지만, Nunchaku 쪽에서는 이를 하나의 양자화 투영 모듈로 묶는다. 융합 연산자는 그 묶인 투영뿐 아니라 질의·키 정규화와 회전 위치 표현까지 함께 받는다. 반대로 기본 Diffusers 경로는 이 연산들을 따로 실행한다. 같은 수학적 역할을 수행하더라도 체크포인트의 매개변수 배치와 실행 모듈의 경계가 다르기 때문에 단순한 이름 대응만으로는 옮길 수 없다.

이 차이를 처리하려면 모델별 대상 설정이 세 투영의 매개변수를 출력 차원을 따라 질의·키·값 순서로 이어 붙여 묶인 모듈에 넣으라고 명시해야 한다. 실행 시에는 작은 어댑터가 그룹화된 투영을 불러오거나, 융합된 투영을 나누는 등 체크포인트 형식과 Diffusers 구조 사이를 연결한다. 공식 글은 특정 예제의 대상 설정과 별도 실행 어댑터 저장소를 참고 경로로 제시한다. 범용 양자화와 모델별 구조 변경의 책임을 설정과 어댑터로 분리한 셈이다.

하드웨어에 따라 쓸 수 있는 4비트 형식도 다르다. 공식 글은 최신 블랙웰 계열 그래픽카드에서는 해당 세대용 4비트 형식을 쓰고, 이전 세대에서는 정수 4비트 변형을 쓰라고 안내한다. 볼타와 호퍼 계열은 현재 이 4비트 연산핵이 지원하지 않는다. 불러올 때 양자화 도구가 장치의 계산 능력을 검사하고, 맞지 않으면 잘못된 결과를 내는 대신 명확한 오류를 발생시킨다. 따라서 체크포인트를 일반 저장소처럼 불러올 수 있게 됐더라도 장치 호환성 검사는 여전히 필수 절차다.

범용 통합의 속도 한계도 공식적으로 밝혀졌다. 모델별 융합 연산핵과 모듈을 쓰지 않는 기본 구현은 원래 Nunchaku 엔진과 같은 속도 향상을 내지 못한다. 그럼에도 Hugging Face는 기본 구현에서 같은 수준의 메모리 감소를 유지하면서 약 30퍼센트의 속도 개선을 얻었다고 설명한다. 이는 호환성을 넓힌 경로와 속도 극대화를 위한 모델별 경로가 같은 결과를 약속하지 않는다는 뜻이다. 사용자는 모델 구조, 지원 장치, 필요한 속도에 따라 두 경로의 차이를 확인해야 한다.

바로 시험할 수 있는 사전 양자화 체크포인트도 함께 안내됐다. 정수 4비트 변환기와 낮은 정밀도 글자 부호기를 결합한 예시, 블랙웰 세대용 4비트 변형, 다른 이미지 생성 모델의 사전 양자화 체크포인트, 더 많은 Nunchaku 모음으로 이어지는 저장소가 공식 글에 열거돼 있다. 다만 목록에 포함됐다는 사실과 각 장치에서 지원된다는 사실은 별개다. 앞서 제시한 하드웨어 표와 체크포인트 정밀도 조건을 함께 확인해야 실제로 불러올 수 있다.

발표가 제시하는 최종 범위는 준비된 모델의 소비와 새 모델의 제작을 함께 묶는 것이다. 사전 양자화 체크포인트는 표준 불러오기 절차를 사용하고, 압축 도구는 새 구조를 보정·양자화·포장·공개하는 흐름을 제공한다. 가중치와 활성값을 함께 낮은 정밀도로 처리해 메모리를 줄이고 잡음 제거 지연을 개선하면서, 이미지 품질은 16비트 원본에 가깝게 유지한다는 것이 공식 요약이다. 다만 실제 성능은 공개된 측정 조건과 구조별 융합 여부, 장치 지원 범위 안에서 판단해야 한다.

이번 작업은 Diffusers 유지관리자들의 검토와 안내, 원래 양자화 방법을 만든 연구진과 Nunchaku 팀의 작업 위에 놓여 있다. 공식 글은 글 초안에 의견을 준 기여자들과 통합을 시험한 참여자, 개발 환경을 지원한 조직에도 감사를 표했다. 기술 발표의 결과만이 아니라 원래 연구, 실행 엔진, 범용 통합, 사용 시험이 이어진 협업 과정까지 출처 안에 기록돼 있다. 발표 말미에는 Diffusers 통합 변경 제안, 양자화 연구 논문과 Nunchaku 엔진, 이전 양자화 글도 후속 자료로 제시됐다. 편집 검토에서는 이 공로 표기와 함께 성능 수치가 Hugging Face의 특정 공식 측정이라는 점을 유지해야 한다.

원문

출처명: Hugging Face Blog
공식 원문 URL: https://huggingface.co/blog/nunchaku-diffusers
공식 게시일: 2026-07-23