아래는 출처에서 가져온 원문입니다.

샤오미가 오픈소스 모델을 앞세워 글로벌 AI 선두권과의 성능 격차 좁히기에 속도를 내고 있다.
샤오미는 21일(현지시간) 차세대 오픈소스 AI 모델 ‘미모-V2.6(MiMo-V2.6)’ 시리즈를 공개했다. 대규모 강화학습 컴퓨팅을 투입해 추론·코딩 역량을 높이는 동시에 3D 공간 추론과 멀티모달 인식, 컴퓨터를 직접 조작하는 에이전트 능력까지 폭넓게 강화한 것이 특징이다.
‘미모-V2.6-프로’와 ‘미모-V2.6-플래시’ 두 가지 모델로 구성된다. 이 가운데 미모-V2.6-프로는 아티피셜 애널리시스 지능 지수(AAII)에서 46.32점을 기록했다.
이는 그록 4.6과 비슷한 수준으로, 중국에서 개발된 AI 모델 가운데 가장 높은 성적이다. 오픈소스 모델 가운데에서도 최고 수준의 지능 점수다.
MiMo-V2.6-Pro debuts as the top open weights model on the Artificial Analysis Intelligence Index (46). At $0.13 per Intelligence Index task, it lands on the Intelligence vs. Cost per Task Pareto frontier@Xiaomi has just released MiMo-V2.6-Pro, an open weights model with major… pic.twitter.com/W3BrQ7q4Lk
— Artificial Analysis (@ArtificialAnlys) September 21, 2026
가격 경쟁력도 강조했다. 동급 성능 모델 가운데 업계 최저 수준의 가격을 자랑했던 이전 V2.5 시리즈의 API 가격 체계를 그대로 유지해, 이번 모델도 시장에서 가장 저렴한 비용으로 최상위 성능을 제공하게 됐다.
여기에 아티피셜 애널리시스 분석에 따르면, 미모-V2.6-프로는 지능 지수 과제당 약 0.13달러의 비용으로 평가돼 지능과 비용을 함께 고려한 '파레토 프런티어'에 올랐다. 이처럼 압도적인 가성비 우위를 이어가면서, 오픈소스 및 상용 AI 시장 전체에서 가장 경제적인 고성능 모델로 입지를 굳혔다.
모델은 총 1조200억개의 매개변수와 420억개의 활성 매개변수를 사용하는 전문가 혼합(MoE) 구조다.
성능 향상의 핵심은 강화학습 컴퓨팅의 대규모 확장이다. 샤오미는 실제 모델 훈련 과정을 실시간으로 공개하면서 미모-V2.6-프로와 플래시에 각각 75만개의 학습 궤적을 적용하고 30단계의 강화학습을 6일 동안 진행했다. 이 과정에 투입된 비용은 프로가 262만달러(약 35억5300만원), 플래시가 85만달러(약 11억5300만원)였다.
강화학습 이후 장기 소프트웨어 엔지니어링 능력을 평가하는 '딥SWE v1.1'에서 미모-V2.6-프로는 58.4점에서 72.57점으로, 플래시는 48.8점에서 65.68점으로 상승했다. 샤오미는 대규모 배치와 높은 처리량, 다양한 작업 환경, 더 많은 검증 연산을 동시에 확대하면서 모델의 학습 효율과 일반화 성능을 끌어올렸다고 설명했다.
강화학습 과정에서 발생할 수 있는 ‘보상 해킹’에도 대응했다고 밝혔다. 보상 설계와 적대적 평가, 이상 징후 탐지, 복수 검증기 간 교차 확인 등을 적용해 모델이 평가 시스템의 허점을 이용하는 현상을 줄이고 훈련 안정성과 보상 신뢰도를 높였다는 설명이다.
From Vibe Coding to Vibe World.
MiMo-V2.6 brings together 3D spatial reasoning, multimodal perception and computer use to build and interact with richer environments.
Turn text, images or video into playable 3D worlds, coordinating agents to build scenes, write… pic.twitter.com/axDf6v5yT0
— Xiaomi MiMo (@XiaomiMiMo) September 21, 2026
활용 범위는 코딩을 넘어선다. 샤오미는 3D 공간 추론과 멀티모달 인지, 컴퓨터 사용 에이전트 기능을 결합해 이를 ‘바이브 월드(Vibe World)’라는 개념으로 확장했다. 사용자가 텍스트나 이미지, 영상을 입력하면 모델이 여러 작업으로 분해한 뒤 에이전트들을 조율해 3D 장면과 상호작용 기능을 만들고, 렌더링 결과를 확인하면서 결과물을 반복적으로 수정할 수 있다.
실제로 블렌더를 이용한 3D 객체와 장면 생성, 게임 개발용 에셋 제작, 로봇 시뮬레이션 등에서 활용 사례를 제시했다. 다중 카메라 영상을 입력받아 가상 환경에서 로봇 팔을 제어하고 물체를 집거나 지정된 위치에 배치하는 작업도 가능하다고 설명했다.
문서와 프레젠테이션 제작, 영상 생성, 음악 작곡에서도 활용 사례가 공개됐다. 한 줄짜리 지시만으로 교육 자료나 연구 보고서, 디자인 리뷰용 프레젠테이션을 만들고, 영상에서는 장면 구성과 모션, 음악, 편집까지 처리할 수 있다는 설명이다. 또 오케스트라와 피아노 곡을 작곡하고 악보를 MIDI로 변환하는 사례도 제시했다.
과학 연구 분야에서도 가능성을 보여줬다. 미모-V2.6-프로가 관련 논문과 특허를 검색하고 새로운 소재 후보를 설계한 뒤 시뮬레이션을 수행하는 방식으로 PFAS 흡착용 금속유기구조체(MOF) 연구를 지원했다고 밝혔다. 또 수학 분야에서는 ‘3주기이면 혼돈을 의미한다’는 리-요크 정리의 전체 증명을 린(Lean) 4로 형식화하는 작업에 활용됐으며, 6000줄이 넘는 린 코드를 생성해 커널 검증까지 완료했다고 설명했다.
미모-V2.6-프로와 플래시는 AI 스튜디오, 미모 코드(Code), 미모 데스크톱(Desktop), 미모 API 플랫폼 및 오픈라우터(OpenRouter)를 통해 제공된다.
모델 가중치는 허깅페이스를 통해 내려받을 수 있다. 동시에 샤오미는 '미모 데스크톱'의 정식 버전을 출시하고, 프로와 동일한 품질을 유지하면서 최대 20배 빠른 출력 속도를 제공하는 ‘프로-울트라스피드(Pro-UltraSpeed)’ 모드도 선보였다.
박찬 기자 cpark@aitimes.com