R9700으로 SDXL 돌린 수치 남깁니다. 국내에 실측이 안 보여서요.
환경: Radeon AI PRO R9700(gfx1201, VRAM 31.86GiB), ROCm 7.2.4, torch 2.13.0+rocm7.2, ComfyUI 0.28.0(--use-pytorch-cross-attention), Proxmox VM passthrough(16코어/96GB), Ubuntu 24.04
조건: SDXL base 1.0, 1024x1024, euler, normal, cfg 8.0, 배치 1
- 스텝당 223ms → 약 4.49 it/s
- 20스텝 전체 5.41초 / 40스텝 전체 9.87초
- 첫 실행(모델 로드 포함) 23.88초
- 고정 오버헤드(로드·인코딩·VAE·저장) 0.96초
- VRAM 피크 12.87GiB, 전력 피크 약 400W, 정션 온도 최대 91도
스텝당 비용은 20스텝과 40스텝을 각 3회 돌려 (40스텝 평균 - 20스텝 평균) / 20으로 계산했습니다. 이렇게 하면 모델 로드나 VAE 같은 고정 비용이 상쇄돼서 샘플링 속도만 남습니다. 전체 시간만 보면 짧은 워크플로우일수록 오버헤드에 묻혀 비교가 왜곡됩니다.
VRAM 32GB는 SDXL에는 과합니다(피크 12.87GiB). 이 카드 값어치는 영상이나 Flux 계열, 또는 LLM을 같이 올릴 때 나올 것 같습니다.
튜닝은 아직 아무것도 안 한 상태입니다(TunableOp off, attention은 pytorch 기본). 바꿔보고 차이가 나면 다시 올리겠습니다.
다른 카드로 같은 조건 재신 분들 수치 공유해주시면 비교해보고 싶습니다.