163 읽음
xAI 그록 4.7 코파일럿 탑재, 저가 경쟁력 확보
위키트리
0
코파일럿 전 플랜에 순차 배포…모델 피커서 바로 선택 — AI로 생성한 자료 이미지

xAI의 최신 추론 모델 Grok 4.7이 깃허브 코파일럿(GitHub Copilot)에 전격 탑재됐다. 깃허브는 9월 21일(현지시각) 공식 체인지로그를 통해 Grok 4.7이 코파일럿 전 플랜에 순차 롤아웃되고 있다고 밝혔다. 같은 날 xAI도 Grok 4.7을 정식 출시하며 커서(Cursor), 그록 빌드(Grok Build), 자체 API에도 동시 배포했다. 가격은 전작과 동일한 100만 토큰당 입력 2달러·출력 6달러로 책정돼 GPT나 클로드 계열보다 훨씬 저렴하다.

깃허브에 따르면 Grok 4.7은 Grok 4.6을 기반으로 구축된 모델로, 에이전틱 코딩(AI가 스스로 여러 단계를 수행하는 코딩 방식)과 복잡한 다단계 작업 처리를 겨냥해 설계됐다. 코파일럿 프로(Pro)·프로+(Pro+)·맥스(Max)·비즈니스·엔터프라이즈 등 전 SKU에서 이용할 수 있다.

개발자는 비주얼 스튜디오 코드, 비주얼 스튜디오, 코파일럿 CLI, 깃허브 코파일럿 클라우드 에이전트, 깃허브 코파일럿 앱, 젯브레인스, 엑스코드, 이클립스 등 모델 피커에서 Grok 4.7을 직접 선택할 수 있다. 깃허브는 롤아웃이 점진적으로 이뤄지는 만큼 아직 보이지 않으면 곧 다시 확인해달라고 안내했다.

비즈니스·엔터프라이즈 플랜 관리자는 코파일럿 설정의 모델 정책 화면에서 Grok 4.7 접근 권한을 관리할 수 있다. 관리자가 전역 기본값을 끄거나 이 모델을 명시적으로 비활성화하지 않는 한, 새 모델은 기본 활성화 상태로 제공된다. 과금은 제공업체 목록가 기준의 사용량 기반 방식으로 이뤄진다.
입력 2달러·출력 6달러…GPT·클로드보다 최대 8배 저렴 — AI 자료 이미지

xAI는 9월 21일 Grok 4.7을 공식 출시했다. 전작 Grok 4.6이 나온 지 한 달 조금 지난 시점이다. 가격은 전작과 동일하게 100만 입력 토큰당 2달러, 100만 출력 토큰당 6달러로 유지됐다.

이는 경쟁 모델과 비교하면 파격적인 수준이다. GPT-5.6 솔(Sol, 입력 4달러·출력 20달러) 대비 입력은 절반, 출력은 약 3분의 1 가격이다. 클로드 페이블 5.1(입력 10달러·출력 50달러)과 비교하면 입력은 5분의 1, 출력은 8분의 1 수준에 그친다. 출력 속도를 2배로 높인 고속 버전은 가격도 2배(입력 4달러·출력 12달러)로 책정됐다.

xenospectrum은 이런 가격 정책이 에이전틱 워크플로처럼 토큰을 대량으로 소모하는 작업의 운영 비용을 낮추는 효과가 있다고 짚었다. 더 디코더는 이 가격대가 서구 프런티어 모델보다는 중국산 모델에 더 가깝다고 평가했다.

xAI 발표자료에 따르면 Grok 4.7은 Grok 4.6보다 더 큰 새 베이스 모델을 기반으로 구축됐다. 훈련 과정에서는 몇 시간씩 걸리는 어려운 문제에 집중한 강화학습(RL, 시행착오를 통해 보상을 최적화하는 학습 방식)을 확장 적용했다. 이를 통해 생성 중간 결과를 검증하고 오류를 스스로 고치는 능력, 긴 컨텍스트에서 출력의 일관성을 유지하는 능력이 향상됐다고 설명했다.

xAI는 또 Grok 4.7이 자사의 자율 코딩 환경인 “그록 봇” 하니스의 내부 구조를 네이티브로 이해하도록 사전학습시켰다고 밝혔다. 외부 도구 호출과 대화형 파일 편집이 필요한 실전 작업에서 더 정확한 명령을 생성하고 상황을 판단하도록 하기 위한 조치라는 설명이다.

xAI가 공개한 자체 벤치마크에서 Grok 4.7은 대체로 좋은 성적을 냈다. 커서벤치 4.0에서 46.3%를 기록해 GPT-5.6 솔을 앞섰고, 소프트웨어 엔지니어링 작업을 시뮬레이션하는 딥SWE v1.1(고강도 추론 설정)에서는 71.0%로 전작 Grok 4.6과 클로드 페이블 5.1 맥스를 넘어섰다. 다만 GPT-5.6 솔 맥스에는 못 미쳤다. 전기공학 과제를 다루는 이이벤치에서는 64.0%로 GPT-5.6 솔 맥스와 페이블 5.1 맥스를 큰 차이로 앞섰다.

그러나 독립 평가에서는 결과가 달랐다. 열 가지 벤치마크를 종합한 아티피셜 애널리시스 인텔리전스 인덱스(Artificial Analysis Intelligence Index, v4.3.2)에서 Grok 4.7은 46점으로 중간권에 머물렀다. 클로드 페이블 5.1과 GPT-6이 각각 53점으로 앞섰다는 게 더 디코더의 평가다.

에이전틱 코딩 성능을 가리키는 터미널벤치 4.0에서도 소스별로 수치가 엇갈렸다. xenospectrum이 인용한 xAI 발표자료에서는 Grok 4.7이 38.0%로 클로드 페이블 5.1보다 19.9포인트 낮았다. 반면 더 디코더가 인용한 독립 평가에서는 Grok 4.7이 26%에 그쳐 GPT-6 아스트라와 클로드 페이블 5.1은 물론, 저가형 모델인 딥시크 V4.1 플래시에도 못 미쳤다.

Grok 4.7의 코파일럿 합류는 깃허브가 모델 선택과 비용관리 기능을 계속 손봐온 흐름 속에서 이뤄졌다. 앞서 깃허브는 9월 14일 오토 모델 선택에 효율성·균형·지능 세 가지 티어를 도입해 비용과 품질 중 무엇을 우선할지 사용자가 고를 수 있게 했다. 세 티어 모두 동일한 모델 풀에서 프롬프트별로 최적 모델을 고르는 방식이며, Grok 4.7 역시 이런 정책 틀 안에서 관리자가 활성화 여부를 조정할 수 있다.
0 / 300