Grok 4.6 등 AI 신모델이 12일 사이 네 개나 쏟아졌습니다

xAI Grok logo Gemini logo Qwen logo

사진 출처: raw.githubusercontent.com | 사진설명: “12일 사이 쏟아진 프런티어 모델 네 건”

슈퍼그록은 모델 이름이 아니라 xAI의 구독 등급명이에요. 8월에 xAI가 실제로 낸 모델은 Grok 4.6이고요. 그리고 8월 18일 당일에 발표된 신규 AI 모델은 검색으로 확인되지 않았어요. 실제로 움직인 구간은 8월 3일부터 14일까지, 딱 12일입니다.

그 12일 사이에 프런티어급 모델 4건이 몰렸어요. Qwen3.8-Max(8/3) → Grok 4.6(8/12) → Gemini 3.7 Flash(8/13) → GLM-5.3(8/14). 성능 점수는 상위권이 2점 안쪽으로 붙었고, 진짜로 갈린 건 가격이었어요.

목차

슈퍼그록은 모델 이름일까요, 요금제 이름일까요?

SuperGrok은 xAI 구독 등급 중 하나예요. Lite 월 $10, SuperGrok 월 $30, Heavy 월 $300 구조이고, X Premium $8·X Premium+ $40은 별개 상품입니다.

SuperGrok subscription tiers xAI

사진 출처: oukdqujzonxvqhiefdsv.supabase.co | 사진설명: “슈퍼그록은 모델이 아니라 구독 등급 이름”

모델 쪽 소식은 Grok 4.6이에요. 2026년 8월 12일 출시, 컨텍스트 윈도우 50만 토큰, 지식 컷오프는 2026년 2월 1일입니다. 컷오프가 2월이라는 건 그 이후 나온 라이브러리 API를 모델이 모른다는 뜻이에요. 같은 주(8/11)에는 전용 클라우드 컴퓨터에서 상시 동작하는 에이전트 Grok Bot도 공개됐어요.

Grok 4.6 xAI release announcement

사진 출처: www.basenor.com | 사진설명: “8월 12일 공개된 Grok 4.6의 사양”

12일 사이에 네 건, 각각 무엇이 바뀐 걸까요?

발표 순서는 이렇습니다.

  • 8월 3일 — 알리바바 Qwen3.8-Max 정식 출시(7월 19일 프리뷰)
  • 8월 12일 — xAI Grok 4.6
  • 8월 13일 — 구글 Gemini 3.7 Flash (3.6 Flash 출시 3주 만)
  • 8월 14일 — Zhipu AI GLM-5.3
모델 컨텍스트 입력(1M) 출력(1M) 가중치 공개
Gemini 3.7 Flash 100만(출력 64K) $0.75 $3.75 비공개
Grok 4.6 50만 $2 $6 비공개
Qwen3.8-Max 입력 991K $2 $6 일부 공개
GLM-5.3 미공개 미공개 미공개 8월 말 예정

비교 기준으로 Claude Opus 5가 입력 $5·출력 $25예요. Gemini 3.7 Flash의 $0.75/$3.75는 2026년 12월 31일까지만 적용되는 도입가이고, 2027년 1월 1일부터 $1.50/$7.50으로 정확히 2배가 됩니다.

Gemini 3.7 Flash Google pricing | 사진설명: “네 모델의 토큰 단가를 나란히 비교한 표”

GLM 5.3은 베이스를 안 바꾸고 어떻게 20점씩 올랐을까요?

Zhipu AI는 GLM-5.3 발표문 첫 문장을 이렇게 썼어요. “Scaling post-training is all we did for GLM-5.3.” GLM-5.2와 베이스 모델이 같고, 사후학습(post-training, 이미 만들어진 모델에 추가 학습을 얹는 단계)만 늘렸다는 뜻입니다.

그 결과가 이래요.

  • DeepSWE v1.1 — 46.2 → 66.9 (+20.7)
  • Terminal-Bench 3.0 — 4.6 → 28.3 (약 6배)
  • ExploitBench — 24.4% → 54.4% (2배 이상)
  • CyberGym — 84.5%

GLM-5.3 Zhipu AI benchmark | 사진설명: “사후학습만으로 껑충 뛴 GLM-5.3 점수”

Terminal-Bench 3.0의 4.6에서 28.3은 ‘아는 게 늘어난’ 변화로 설명하기 어려워요. 터미널에 명령을 던지고 결과를 보고 다시 판단하는 절차를 익힌 쪽에 가깝다고 봐요. 다만 Zhipu가 학습 레시피를 공개하지 않아 단정할 수는 없어요. Grok 4.6도 베이스를 그대로 뒀다는 서술이 있는데, 이건 2차 매체 보도에서만 확인돼서 단정하지 않는 편이 안전해요.

보안 쪽 숫자도 같이 나왔어요. 중국 보안팀들과 협업해 269개 프로젝트에서 취약점 2,436건을 찾았고, 그중 일부는 40년 된 코드였습니다. 가중치는 발표 시점에 공개되지 않았고, 보안 검토를 거쳐 약 2주 뒤 공개 예정이에요.

1등을 가리는 일이 왜 흐려졌을까요?

Artificial Analysis Intelligence Index 기준으로 Claude Opus 5 63점, Claude Fable 5 62점, Grok 4.6 61점, GPT-5.6 Sol 61점이에요. 1등부터 4등까지 2점 차입니다.

GDPval-AA v2에서 Grok 4.6은 Elo 1753으로 Claude Opus 5에만 뒤졌고, Fable 5·Qwen3.8-Max와는 신뢰구간이 겹쳐요. 신뢰구간이 겹친다는 건 측정 오차 범위 안에 있어서 순위를 가릴 수 없다는 뜻이에요. DeepSWE v1.1에서는 GPT-5.6 Luna Max 67.2 vs GLM-5.3 66.9로 0.3점 차고요.

상위권이 신뢰구간까지 겹치면, 선택 기준은 성능에서 비용으로 넘어갈 수밖에 없어요.

비용 쪽 숫자를 보면 이유가 분명해져요. Grok 4.6은 Artificial Analysis 평가에서 태스크당 $0.84가 들었고, Claude Opus 5 대비 토큰 단가가 60% 이상 저렴합니다.

오픈웨이트라고 다 같은 오픈웨이트일까요?

Qwen3.8-2.4T-A95B의 라이선스는 Apache 2.0이 아니라 자체 qwen3.8-max 라이선스예요. Hugging Face 공식 모델카드 기준입니다. Apache 2.0은 Qwen3.8-27B에만 적용돼요.

스펙도 API판과 달라요. 오픈웨이트로 풀린 쪽은 텍스트 전용이라 멀티모달 입력을 지원하지 않고, 항상 thinking 모드가 필요합니다. Hugging Face 토론 게시판에 “Max 오픈웨이트가 텍스트 전용이고 비전·1M 컨텍스트가 빠졌다”는 공개 항의 스레드도 올라와 있어요.

오픈웨이트 발표를 볼 때 확인할 게 세 가지로 늘었다고 봐요.

  • 라이선스가 정말 Apache 2.0인지 (Qwen은 모델별로 다름)
  • 공개된 체크포인트가 API판과 같은 스펙인지
  • 가중치를 지금 받을 수 있는지 (GLM-5.3은 8월 말 예정)

배경에는 점유율 변화가 있어요. 2026년 봄 기준 중국 오픈웨이트 모델이 Hugging Face 다운로드의 41%를 차지해 미국 모델을 앞질렀습니다. Qwen 기반 파생 모델은 151,448개로 Meta 총합의 2.6배고요. 로컬 추론용 GGUF 포맷 월간 다운로드는 Qwen 39.6M, Gemma 20.8M, Llama 7.5M입니다.

단가는 내려가는데 왜 청구서는 늘어날까요?

Hugging Face Qwen model card

사진 출처: qianwen-res.oss-accelerate.aliyuncs.com | 사진설명: “Apache 2.0이 아닌 자체 라이선스 표기”

토큰 단가는 2020년 대비 600분의 1 수준까지 떨어졌어요. OpenAI 범용 모델 출력 단가도 GPT-4 시절 100만 토큰당 $60에서 최근 $15까지 내려왔습니다.

그런데 청구서는 반대로 갔어요. 에이전트 업무는 일반 코드 채팅보다 약 1,000배 많은 토큰을 씁니다. 램프 AI 인덱스 조사 기준으로 직원 1인당 월평균 $7,500을 지출하고, 일부 기업은 연간 예산을 3~4개월 만에 다 썼어요.

여기가 이번 4건을 관통하는 지점이라고 봐요. 이번에 나온 모델들은 전부 ‘코딩·에이전트’를 대표 용도로 내세웠어요. 그런데 에이전트는 토큰을 1,000배 먹습니다. 단가가 절반이 돼도 사용량이 그걸 삼켜요. Gemini 3.7 Flash의 절반 가격은 할인이라기보다 에이전트를 돌리라는 초대장에 가깝습니다.

실제로 요금 부담을 호소하는 기업 상당수가 가격이 낮은 중국 모델로의 전환을 고민 중이고, OpenAI도 사용료 인하를 검토 중이라고 보도됐어요.

실제로 써 보면 비용이 어디서 갈릴까요?

청구서에 직결되는 변수가 네 개예요.

  • 컨텍스트 분기점Grok 4.6은 200K 토큰이 경계입니다. 넘기는 순간 입력 $2→$4, 출력 $6→$12로 정확히 2배가 돼요.
  • 기본값Grok 4.6의 reasoning effort는 low·medium·high·xhigh 4단계인데 기본이 high예요. Gemini 3.7 Flash의 기본 thinking level은 medium이고요. 손대지 않으면 그 값으로 계속 청구됩니다.
  • 캐시 단가Qwen3.8-Max 캐시 읽기 $0.25 vs Grok 4.6 캐시 입력 $0.50. 본 단가가 $2/$6로 같아도 캐시 히트가 잦은 작업이면 여기서 갈려요.
  • 도입가 만료Gemini 3.7 Flash는 2026년 12월 31일까지가 도입가입니다. 지금 단가로 2027년 예산을 짜면 그 항목만 2배 어긋나요.

GLM-5.3은 ZCode, Claude Code, OpenCode 같은 코딩 에이전트에서 쓸 수 있어요. 다만 종량제 API 단가가 아직 공개되지 않아 현재는 GLM Coding Plan 구독으로만 접근합니다. 엔트리 요금 $18은 확인됐지만 상위 요금은 출처마다 값이 달라서 $70~170대 정도로만 보는 게 맞아요.

한 가지 짚어둘 게 있어요. 위 점수들 중 한국어 성능 측정치는 확인되지 않았습니다. DeepSWE, Terminal-Bench, FrontierCode는 전부 영어권 코딩·에이전트 평가예요. 이 점수를 한국어 작업 성능으로 옮겨 읽으면 어긋날 수 있어요.

개인이 집에서 돌릴 수 있는 건 어느 쪽일까요?

Qwen3.8-Max는 총 2.4조 파라미터 MoE(쿼리당 활성 95B)라 개인 PC용이 아니에요. 오픈웨이트라는 말만 보고 집에서 돌릴 계획을 세우면 어긋납니다.

실제로 손에 잡히는 건 Apache 2.0으로 풀린 Qwen3.8-27B 쪽이에요. 27B 밀집(dense) 비전-언어 모델이라 이미지·영상도 받고, 컨텍스트는 262,144 네이티브에서 100만까지 확장됩니다. Gemini 3.7 Flash를 Gemini 앱 Spark에서 쓰려면 AI Pro 또는 Ultra 구독이 필요하고요.

Qwen3.8-27B local inference GPU | 사진설명: “집에서 돌릴 수 있는 건 27B 쪽이에요”

다음 사이클은 무엇으로 갈릴까요?

구글이 Gemini 3.5 Pro보다 Flash를 먼저 낸 순서를 두고 Axios가 이례적이라고 지적했어요. 이유는 구글이 공식적으로 밝히지 않았습니다.

숫자를 보면 짐작은 가요. 3.6 Flash 대비 AutomationBench 17.0% → 30.4%(1.8배), DeepSWE 49.0% → 65.3%, WebDev Arena Elo 1538 → 1588입니다. ‘무거운 건 Pro, 가벼운 건 Flash’라는 분업 기준이 흔들릴 만한 폭이에요.

정책 쪽 변수도 남아 있어요. 2026년 6월 미국은 중국 기업의 해외 자회사에도 반도체 선적 제한이 적용된다고 재확인했습니다. 본사나 모회사가 중국이면 소재지와 무관하게 걸려요. 그리고 취약점을 찾아내는 능력은 방어와 공격이 정확히 같은 능력입니다. Zhipu가 가중치 공개 전에 보안 검토 2주를 배정한 지점이 여기라고 봐요. 오픈웨이트 정책과 보안 정책이 정면으로 부딪히는 사례예요.

그래서 지금 무엇을 정해두면 좋을까요?

달력에 찍어둘 날짜는 두 개예요. 2026년 12월 31일 — Gemini 3.7 Flash 도입가 만료. 그리고 8월 말 — GLM-5.3 가중치 공개 예정일. 앞의 것은 예산에, 뒤의 것은 자체 구축 계획에 걸립니다.

12일 사이 네 건을 보고 남은 인상은 성능 순위가 아니었어요. 상위권은 오차 범위 안에서 겹쳤고, 실제로 달라진 건 컨텍스트 분기점·기본 추론 강도·캐시 단가·도입가 만료일 같은 것들이었습니다.

지금 쓰는 모델을 벤치마크 점수로 고르셨나요, 아니면 지난달 청구서를 보고 고르셨나요?

참고 출처

댓글 남기기