Stability AI의 Stable Diffusion 3.5 최적화, Runway의 Characters와 Runway Dev, Black Forest Labs와 mimic robotics가 공동 개발한 FLUX-mimic 발표를 묶었다. 이미지 생성의 GPU 운용, 실시간 캐릭터, 미디어 개발 플랫폼, 로봇 제어로 이어지는 서로 다른 적용 범위를 공식 원문에 따라 정리한다.

Stable Diffusion 3.5, TensorRT 적용으로 RTX 지원 범위 확대

Stability AI는 NVIDIA와 협력해 Stable Diffusion 3.5의 TensorRT 최적화 버전을 내놓았다. 회사가 공개한 측정치에 따르면 SD3.5 Large는 최대 2.3배, SD3.5 Medium은 최대 1.7배 빠르게 이미지를 생성하며 VRAM 요구량은 40% 줄었다.

공식 발표 내용

이번 배포는 Stable Diffusion 3.5 모델군을 지원되는 RTX 환경에서 더 빠르게 실행하고 필요한 그래픽 메모리를 낮추는 데 초점을 맞췄다. Stability AI는 SD3.5 Large와 Medium의 결과를 구분해 제시했으며, Large에는 FP8 TensorRT, Medium에는 BF16 TensorRT 측정치를 연결했다. 비교 기준은 기본 PyTorch 계열 실행 방식이다.

메모리 사용량에 대해서는 19GB에서 11GB로 줄었다는 구체적인 수치도 공개됐다. 회사는 이 변화가 출력 품질을 유지한 상태에서 측정됐다고 설명했으며, Medium 구성은 속도와 효율을 우선하는 이용자와 중급 RTX 하드웨어를 쓰는 제작자를 적용 대상으로 들었다.

최적화 모델은 Stability AI Community License에 따라 상업 및 비상업 용도로 제공된다. 모델 가중치는 Hugging Face에서, 실행 코드는 NVIDIA의 GitHub에서 받을 수 있다고 안내됐다. 따라서 발표는 벤치마크 수치뿐 아니라 이용 조건과 배포 위치까지 함께 명시한 형태다.

관련 기능 또는 적용 범위

Stability AI는 TensorRT와 FP8의 역할을 나눠 설명했다. TensorRT 최적화는 NVIDIA 하드웨어에서 모델 실행 방식을 간소화하면서 품질을 유지하는 과정이고, 모델 크기 감소는 FP8 양자화를 통해 이뤄진다고 밝혔다. 두 요소는 함께 적용되지만 동일한 작동 원리로 서술되지는 않았다.

Stable Diffusion 3.5의 생성 범위로는 3D, 사진, 회화, 라인 아트 등 여러 시각 양식이 제시됐다. 다양한 피부색과 특징을 반영한 이미지를 복잡한 추가 지시 없이 만들 수 있다는 설명도 포함됐다. 입력한 텍스트 지시를 가깝게 따르는 능력은 회사가 별도로 분석한 항목으로 소개했다.

지원 하드웨어는 NVIDIA GeForce RTX 50·40 Series GPU와 Blackwell 및 Ada Lovelace 세대의 NVIDIA RTX PRO GPU로 제시됐다. Stability AI는 최적화 전에는 한 종류의 RTX 50 Series 시스템만 메모리에서 SD3.5 Large를 실행할 수 있었지만, 적용 후에는 다섯 종류의 시스템에서 가능해졌다고 설명했다.

원문

출처명: Stability AI News
공식 원문 URL: https://stability.ai/news-updates/stable-diffusion-35-models-optimized-with-tensorrt-deliver-2x-faster-performance-and-40-less-memory-on-nvidia-rtx-gpus
공식 게시일: 2026-08-18

Runway Characters, SIGGRAPH 2026에서 실시간 생성 시연

Runway의 Characters가 SIGGRAPH 2026의 Real-Time Live! 세션에 선정돼 무대에서 작동 과정을 시연했다. Characters는 한 장의 이미지에서 출발해 대화에 반응하는 영상을 프레임 단위로 실시간 생성하는 시스템으로 소개됐다.

공식 발표 내용

Real-Time Live! 참가 팀에는 수천 명 앞에서 작업을 실시간으로 보여줄 6분이 주어지며, 컴퓨터 그래픽과 실시간 기술 전문가로 구성된 심사단이 이를 평가한다. Runway 연구·제품팀은 이러한 형식이 사전에 정리된 영상이 아니라 실제로 실행되는 시스템을 입증하도록 요구했다고 설명했다.

무대에서는 다음 해 콘퍼런스 의장의 사진을 촬영한 뒤 몇 초 안에 말하는 캐릭터로 만드는 과정이 진행됐다. 행사 기간 참가자들도 현장에서 사진을 찍고 자신의 모습을 바탕으로 만들어진 캐릭터와 대화했다. 이는 준비된 특정 캐릭터만 보여준 시연이 아니라 입력 이미지를 현장에서 받아 처리한 사례다.

Runway는 자연스러운 대화에서 지연 시간이 핵심 조건이라고 설명했다. 이용자가 말을 멈출 때 캐릭터가 이미 응답을 시작해야 하며, 작은 지연도 경험을 깨뜨릴 수 있다는 것이다. 이를 위해 제작 환경에 배포한 첫 실시간 모델의 렌더링 엔진과 영상·음성 스트리밍 계층을 함께 다듬었다.

관련 기능 또는 적용 범위

Characters는 사람이나 반려동물의 사진, 애니메이션 캐릭터, 추상 이미지 등 한 장의 이미지에서 시작할 수 있다. Runway는 별도의 미세조정이나 양식별 적응 과정이 필요하지 않다고 밝혔다. 기존 실시간 아바타가 주로 사람 형태와 특정 영상 또는 3D 자산 형식에 묶였던 점과 구분되는 입력 범위다.

긴 상호작용에 관해 Runway는 대화가 일반적으로 30분 이상 이어져도 저하되지 않을 수 있다고 설명했다. 특정 SIGGRAPH 현장 대화 한 건의 지속 시간을 뜻하는 수치는 아니다. 시스템은 일관성을 위해 영상 구간을 반복 재생하는 대신 모든 프레임을 생성하며, 회사는 이 방식이 긴 대화를 가능하게 한다고 밝혔다.

향후 과제로는 아동용 경험에서의 보호 장치와 특정 역할을 맡은 캐릭터가 대화 주제에서 벗어났을 때 다시 임무로 유도하는 방식이 언급됐다. Runway는 조정 기능을 우선순위에 두고 있으며, 이동 가능한 환경과 텍스트 상호작용, 감정 표현 제어, 여러 참조 이미지 및 기억 기능도 살펴보고 있다고 밝혔다.

원문

출처명: Runway News
공식 원문 URL: https://runway.com/news/company-news/runway-characters-siggraph-2026
공식 게시일: 2026-07-31

Runway Dev, 생성형 미디어 모델과 작업 흐름을 단일 API로 제공

Runway는 이미지, 영상, 음성, 실시간 캐릭터 모델을 하나의 API로 연결하는 Runway Dev를 출시했다. 전문 개발자와 기업 팀을 대상으로 Models, Runway Media Router, Recipes, Workflows와 Characters를 묶어 제공한다.

공식 발표 내용

Runway Dev에서는 Runway의 Gen-4.5, Aleph 2.0, Act-Two와 Seedance, GPT Image 2, ElevenLabs 등 외부 모델을 한 번의 통합으로 이용할 수 있다. 새 모델은 공개 시점에 추가되며, 코드 한 줄을 바꿔 모델을 전환하고 단일 결제 대시보드에서 모델별 지출을 추적할 수 있다고 회사는 설명했다.

Runway Media Router는 요청의 기능 및 모달리티 조건을 먼저 맞춘 뒤 설정된 비용, 품질, 지연 시간 기준에 따라 후보 모델을 선택한다. 이용자는 가격 상한과 허용·차단할 모델 또는 공급자를 구성하고, 생성 요청에는 해당 구성 ID만 첨부한다. 응답에는 실제 사용된 모델과 선택 이유를 나타내는 메타데이터가 포함된다.

플랫폼의 기업 운영 조건으로는 이용자 데이터를 학습에 사용하지 않겠다는 계약상 약속과 zero-data retention 지원이 제시됐다. 외부 모델 공급자는 보안 검토, 보안 인증 확인, 계약상 데이터 보호 요건을 포함한 공급자 관리 절차를 거친다. SOC 2 Type II 준수, 콘텐츠 조정, 99.9% 가동 시간도 발표 항목에 포함됐다.

관련 기능 또는 적용 범위

Recipes는 Runway가 설계한 프롬프트와 작업 절차를 하나의 API 호출로 묶은 엔드포인트다. Ad Localization, Product Ad, Product Swap, Multi-Shot Video, Marketing Stock Image 등이 예시로 제시됐다. Ad Localization은 이미지 한 장을 입력해 한 번의 요청으로 여러 시장용 버전을 만드는 방식이다.

Workflows는 여러 모델과 모달리티, 작업을 사용자 정의 파이프라인으로 결합하고 이를 비공개 API 엔드포인트에서 실행하는 기능이다. 공식 사례에는 5명 규모의 팀이 50개가 넘는 스튜디오 레이블에서 연간 800~1,000개 광고를 만드는 방송사와, 27개 언어로 제품 영상을 현지화하는 음식 배달 플랫폼이 포함됐다.

Characters는 음성, 도구 호출, 지식 기반을 갖춘 실시간 상호작용형 아바타를 제품에 연결한다. 사진을 올리거나 캐릭터를 생성해 에이전트에 외형과 개성을 부여할 수 있으며, 고객 지원, 교육 시뮬레이션, 상호작용형 엔터테인먼트가 적용 사례로 제시됐다. 이 기능은 Runway Dev에서만 제공된다고 회사는 밝혔다.

원문

출처명: Runway News
공식 원문 URL: https://runway.com/news/company-news/introducing-runway-dev
공식 게시일: 2026-07-23

FLUX 3 기반 FLUX-mimic, Video-Action 모델을 생산 현장에 연결

Black Forest Labs는 mimic robotics와 공동 개발한 FLUX-mimic을 공개했다. 이미지·영상·음성을 함께 학습한 FLUX 3을 기반으로 로봇 행동을 예측하는 Video-Action 계열 모델이며, mimic이 제작한 로봇을 통해 Audi 생산 환경에서 시험 및 배포됐다.

공식 발표 내용

FLUX 3은 처음부터 이미지, 영상, 음성을 함께 다루도록 학습된 단일 멀티모달 기반 모델이다. Black Forest Labs는 전체 학습 계산 비용의 95% 이상이 영상 예측에 투입됐으며, 음성은 오디오가 포함된 720p 영상 토큰의 0.5% 미만을 차지한다고 밝혔다. 회사는 영상에서 접촉, 움직임, 무게, 인과 관계를 익히는 과정을 로봇 행동 예측의 바탕으로 설명했다.

행동 예측을 학습 과정에 추가했을 때 텍스트-영상 및 이미지-영상 결과에 대한 사람 평가가 처음에는 최대 10% 낮아졌지만, 3,500단계 뒤에는 이전 영상 생성 품질을 회복하면서 행동도 예측했다고 발표했다. Black Forest Labs는 이 결과를 영상 생성과 행동 예측이 별도 기반 모델을 필요로 하지 않는다는 관찰로 정리했다.

FLUX-mimic은 FLUX 3의 영상 예측 경로에서 추출한 중간 특징 위에 가벼운 행동 디코더를 학습한다. 이 구조는 mimic-video에서 제시된 접근을 따른다. 공동 개발에서 mimic은 로봇 학습, 정교한 조작, 생산 배포 경험을 맡고, Black Forest Labs는 시각 기반 모델과 멀티모달 학습 경험을 제공했다고 설명됐다.

관련 기능 또는 적용 범위

학습 데이터 범위로는 일반적인 세계 동역학을 익히기 위한 수천만 시간의 영상과, 사람 및 로봇 조작에 초점을 맞춘 수십만 시간의 영상이 제시됐다. mimic은 FLUX-mimic을 실제 공장 작업에 배치해 부품을 정해진 트레이에 담기, 전자 제어 장치를 좁은 고정구에 삽입하기, 부품 조립, 씰과 케이블 같은 유연한 소재 다루기를 수행했다.

새 작업을 익히는 데 필요한 데이터와 관련해 Self-Flow 실험에서는 행동 예측이 Self-Flow를 쓰지 않은 영상 모델보다 절반의 학습 단계로 같은 성공률에 도달했다. mimic-video 논문에서는 Video-Action 모델이 시각·언어·행동 모델보다 최대 10배의 표본 효율을 보였다고 소개됐다. 또한 FLUX-mimic은 잡기에 실패한 뒤 다시 시도해 작업을 끝내는 복구 행동을 보였다고 발표됐다.

배포 지연 시간에 대해 Black Forest Labs는 FLUX-mimic의 기반 모델이 단일 NVIDIA RTX 5090 GPU에서 입력부터 세계 표현까지 80ms 미만으로 실행되도록 최적화될 수 있다고 밝혔다. mimic은 센서, 모델, 구동 장치 사이의 처리 지연과 행동 디코더를 조정하고 예측과 실행을 겹치는 실시간 청킹을 적용했으며, 전체 로봇 시스템의 반응 시간은 101ms로 제시됐다.

원문

출처명: Black Forest Labs Blog
공식 원문 URL: https://bfl.ai/blog/flux-3-mimic
공식 게시일: 2026-07-23