아래는 출처에서 가져온 원문입니다.

이미지 생성으로 유명한 블랙 포레스트 랩스(BFL)가 로봇 분야로 영역을 확대했다. 경쟁 모델 절반 수준의 크기로 세계 최고 수준의 제어 성능을 달성한 로봇 AI를 공개하며 피지컬 AI 시장에 도전장을 던졌다.
BFL은 22일(현지시간) 카메라 영상과 로봇의 현재 상태, 자연어 지시를 분석해 실제 물리적 행동으로 전환하는 70억 매개변수 규모의 오픈웨이트 로봇 모델 '플럭스 3 액션(FLUX 3 Action)'을 공개했다.
공개 모델은 기본 모델인 '플럭스 3 액션-베이스(Base)'와 지시 이행 및 미세조정 능력을 강화한 '플럭스 3 액션-인스트럭트(Instruct)' 등 라인업으로 구성된다.
무엇보다 엔비디아의 로봇 공학 평가 플랫폼인 '로보랩-120(RoboLab-120)' 벤치마크에서 42.92%의 종합 성공률을 달성해 공개 리더보드 1위에 올랐다는 점이 주목된다. 이는 기존 최고 오픈 모델인 '엔비디아 코스모스3-나노(Cosmos3-Nano-Policy, 36.8%)'보다 6.1%포인트 높은 수치이며, 전체 1위였던 'OASIS WAM(39.0%)'의 기록을 상회한다.
특히 코스모스3-나노(160억 개) 대비 매개변수 규모가 56% 적은 70억개이면서도, GPU와 정밀도 설정에 따라 최대 3.95배 빠른 추론 속도를 기록하며 성능과 효율성을 모두 확보했다.

이번 발표의 핵심은 로봇 AI 분야의 난제였던 '세계 행동 모델(WAM, World Action Model)'과 '시각-언어-행동 모델(VLA)' 간의 성능·지연시간 상충 관계를 해소했다는 점이다. 환경 변화를 예측하는 기존 WAM은 성공률은 높지만 연산량이 많았고, VLA는 반응은 빠르지만 장기 판단력과 성공률에서 한계를 보였다.
그러나 플럭스 3 액션은 BFL의 '플럭스 3' 영상 사전학습 백본을 기반으로, 단일 단계(Single-step) 추론 과정에서 미래 비디오 프레임과 로봇의 제어 동작을 동시에 예측하도록 설계됐다. 복잡한 가이던스 패스를 제거하고 단 1 스텝 증류(Distillation) 방식을 적용해 VLA급 반응 속도와 WAM 특유의 높은 정확도를 통합했다.
이를 위해 이미지·비디오·오디오를 포함한 대규모 멀티모달 사전학습 후, 게임 플레이 화면, 인간의 작 관찰 데이터, 텔레오퍼레이션 등 다채로운 행동 데이터를 혼합한 '행동 중간 학습(Action Midtraining)' 단계를 거쳤다.
추론 시에는 카메라 영상과 로봇 상태, 자연어 지시를 입력받아 이후 2.13초 동안 실행될 32개의 연속 행동 및 시각적 변화 예측을 생성한다.
실증 평가에서는 200여 개의 원격조종 에피소드로 미세조정한 로봇이 첫 시도에 실패하더라도 스스로 관찰을 재수행해 작업을 복구하는 정교한 제어 성능을 선보였다.
물리적 로봇을 넘어 디지털 에이전트로서의 확장성도 증명됐다. 동일 아키텍처를 통해 드론 비행 제어는 물론, 1인칭 슈팅 게임 '둠(Doom)' 환경에서 시점과 공격을 제어해 사망 없이 플레이를 마치는 등 시각 정보 기반의 복잡한 판단 환경에 대한 적응력을 입증했다.
Read the full blog: https://t.co/i3ql6TbWy3
Download the weights: https://t.co/nabutsgdXI
Talk to our robotics team: https://t.co/uWW7jBFIjQ
— Black Forest Labs (@bfl_ai) September 23, 2026
특히 주목할 점은 고성능 추론 모델과의 '하이브리드 제어(Hybrid Policy)' 구상이다.
'GPT-6 아스트라' 같은 대형 추론 모델은 복잡한 계획 수립 능력이 뛰어나지만, 추론 호출당 35초 이상의 시간과 높은 비용이 소요된다. 반면 플럭스 3 액션을 기본 하위 제어기(Policy)로 두고 고성능 추론 모델이 필요할 때만 개입하는 하이브리드 방식을 적용하면, 실시간 반응성과 정교한 작업 계획을 동시에 확보할 수 있다.
자체 테스트 결과, 복잡한 고난도 에피소드 조건에서도 90%의 성공률을 유지하면서 전체 연산 비용을 29% 절감하고 실행 시간을 40% 단축하는 것으로 나타났다. 이는 피지컬 AI 구현의 최대 걸림돌인 연산 비용을 획기적으로 낮추는 대안이 될 전망이다.
BFL은 허깅페이스를 통해 가중치와 코드, 미세조정 레시피, 벤치마크 예제 일체를 전면 개방했다. 엔비디아와의 협력으로 허깅페이스의 로봇 프레임워크인 '르로봇(LeRobot)'에 즉시 통합되며, 엣지 AI 기기인 '엔비디아 젯슨(NVIDIA Jetson)' 및 저가형 오픈소스 로봇 팔 'SO-101' 환경도 지원한다. 대규모 데이터 구축이 어려운 연구자도 자체 데이터로 7B 모델을 미세조정해 고성능 로봇 제어를 연구할 수 있는 기반이 마련된 셈이다.
다만 평가 환경과 작업 구성이 다른 로봇 AI 시장 특성상 단순 수치 비교에는 신중해야 하며, 상용 API나 최종 라이선스 조건은 아직 구체적으로 공개되지 않았다. 또 시뮬레이션 및 초기 실험 단계의 성과가 다양한 실물 환경에 완전히 일반화되는지 확인하는 추가 검증 과제도 남아 있다.
그럼에도 이번 공개는 화면 속 텍스트나 이미지를 생성하는 데 머물던 생성 AI 기술을 실물 로봇을 움직이는 물리적 AI 영역으로 본격 이식했다는 점에서 의미가 크다. 특히 그동안 거대 AI 기업의 전유물이었던 고성능 로봇 제어 모델을 7B 규모의 가벼운 오픈 가중치로 풀어냄으로써, 중소 연구진과 개발자들의 로봇 AI 접근성을 크게 끌어 올리는 계기가 될 것으로 평가된다.
박찬 기자 cpark@aitimes.com