simoori.AI·IT 소식에서 신호만 골라 훑는 곳
피드로

기대 못 미친 '그록 4.7'…스페이스XAI, 프런티어 경쟁 '4.8'로 미뤄

AI타임스 · 22일 오후 · 분야 AI 모델 · 사건종류 출시

signal 포인트

핵심

  1. 그록 4.7, 지능 지수 46점으로 전체 7위에 그쳐
  2. 토큰 소비량 급증해 비용·효율성 우려 제기
  3. 차기작 그록 4.8이 매개변수 2조5000억개로 프런티어 경쟁 담당
이전 형식의 요약 문단 보기

스페이스XAI가 코딩과 지식 작업에 특화한 '그록 4.7'을 공개했으나 아티피셜 애널리시스 지능 지수에서 46점, 전체 7위에 그치며 프런티어 모델과의 격차를 좁히지 못했다. 에이전트형 지식 작업과 코딩 에이전트 성능은 전작 대비 개선됐지만, 일부 벤치마크에서는 오히려 하락했고 추론 시 토큰 소비량이 크게 늘어 비용 효율성 우려도 제기됐다. 이에 따라 최첨단 모델과의 본격 경쟁은 매개변수 2조5000억개로 커질 차기작 '그록 4.8'로 넘어가게 됐다. 한편 탈옥 공격과 위험 요청 거부 성능을 높인 신규 세이프가드 스택도 함께 적용됐다.

요약은 자동으로 만들어집니다. 사실 확인이 필요하면 원문을 읽어주세요.

원문 보기 (한국어)

아래는 출처에서 가져온 원문입니다.

(사진=스페이스XAI)

(사진=스페이스XAI)

스페이스XAI가 코딩과 지식 작업에 특화한 차세대 AI 모델 ‘그록 4.7(Grok 4.7)’을 공개했으나, 프런티어 성능에 미치지 못하며 차기 모델인 ‘그록 4.8’로 본격적인 경쟁을 미루게 됐다.

스페이스XAI는 21일(현지시간) 그록 4.7을 출시하며 장시간 수행되는 복잡한 작업에서의 추론 능력과 자체 검증 기능, 사이버보안 성능을 강화했다고 발표했다.

그록 4.6 출시 이후 한 달여 만이다. 이날부터 커서와 xAI의 ‘그록 빌드(Grok Build)’에서 사용할 수 있으며, 그록 API와 제3자 코딩 하네스, 모델 라우터 및 클라우드 플랫폼을 통해서도 제공된다.

가격은 입력 토큰 100만개당 2달러, 출력 토큰 100만개당 6달러로 그록 4.6과 동일하다. 캐시 적중 토큰은 100만개당 0.50달러이며, 출력 속도가 두 배인 고속 버전은 두 배의 가격으로 제공된다. 추론 강도는 낮은 수준부터 ‘xhigh’까지 조절할 수 있다.

그록 4.6보다 더 큰 기반 모델을 사용했으며, 여러 시간에 걸쳐 수행되는 어려운 작업에 초점을 맞춰 강화학습을 더 길게 진행했다. 특히 생성한 답변과 작업 결과를 스스로 정밀하게 검증하고 긴 작업 흐름을 관리하는 능력을 강화했다. 컨텍스트 창은 최대 50만 토큰으로 그록 4.6과 동일하다.

Grok 4.7 scores 46 on the Artificial Analysis Intelligence Index to bring SpaceXAI into the top 4 AI labs. Coding Agent Index performance has also improved, overtaking GPT-5.6 Sol

Grok 4.7 scores +2 points over Grok 4.6 on the Intelligence Index, with strong performance on… pic.twitter.com/8p4KC6cgZy

— Artificial Analysis (@ArtificialAnlys) September 21, 2026

에이전트형 지식 작업 분야에서는 일정한 성능 향상이 확인됐다. 아티피셜 애널리시스 브리프케이스(AA-Briefcase) 평가에서 1657점을 기록해 그록 4.6보다 111점 상승했다. GDPval-AA에서는 1695점을 기록하며 전작 대비 90점 올랐다

코딩 에이전트 성능도 개선됐다. 그록 빌드와 그록 4.7을 함께 평가한 아티피셜 애널리시스 코딩 에이전트 지수(Coding Agent Index)에서 56점을 기록했다. 이는 그록 4.6보다 9점 상승한 수치로, 자체 하네스 환경 기준 순위에서 4위에 해당한다.

모든 영역에서 뚜렷한 진전이 이뤄진 것은 아니다. 아티피셜 애널리시스의 다른 과제에서는 전반적으로 그록 4.6과 유사한 수준을 기록했다. '터미널-벤치 4.0'은 4.5%포인트, 'GDP.pdf'는 3.0%포인트 개선됐지만, 'AA-LCR'은 3.7%포인트, '오토메이션벤치(AutomationBench-AA)'는 1.1%포인트 하락하며 엇갈린 결과를 나타냈다.  

높은 토큰 사용량도 부담 요인으로 꼽힌다. xhigh 추론 설정에서 지능 지수 과제당 평균 8만1000개의 출력 토큰을 소비했는데, 이는 그록 4.6의 3만6000개보다 약 125%, 'GPT-6 아스트라'의 2만7000개보다 약 196% 많은 규모다. 어려운 문제를 오래 추론하고 결과를 반복 검증하는 방식이 성능 향상에는 도움이 됐으나. 실무 적용 시 토큰 소비량이 늘어나며 비용 및 처리 효율성이 반감될 수 있다.  

결과적으로 아티피셜 애널리시스 지능 지수(AAII)에서 46점을 기록하며 전체 7위에 그쳤다. 선두권 모델과의 격차를 좁히지 못하면서, 최첨단 프런티어 모델과의 직접적인 주도권 다툼은 차기작 '그록 4.8'의 몫으로 남게 됐다.  

일론 머스크 CEO도 앞서 그록 4.7의 강화학습 과정에서 응답 길이에 대한 페널티가 지나치게 높게 설정됐을 가능성을 들며, 대신 매개변수가 2조5000억개로 늘어날 그록 4.8에 큰 기대를 걸고 있다고 밝힌 바 있다.

한편, 최근 AI 안전성 문제를 감안한 듯 신규 ‘세이프가드 스택’을 구축했다고 강조했다. 그록 4.7이 탈옥 공격 및 위험 요청 거부 성능에서 자체 모델 중 가장 우수하다는 설명이다.

악성 작업은 차단하면서 정상적인 보안 연구에 대한 과도한 거부는 경감하는 데 중점을 뒀다. 그 결과, '해커벤치(HackerBench) v0.3'에서는 위험한 이중용도 사이버 요청 허용률을 3.3%로 통제했으며, '래치바이오(LatchBio)' 벤치마크에서는 62.4점을 올렸다.  

박찬 기자 cpark@aitimes.com

원문의 저작권은 출처에 있습니다.출처에서 원문 보기 새 창에서 열림