AI · 벤치마크
AI 벤치마크 순위 비교, 가장 강력한 AI는 (2026.9)

“가장 강력한 AI가 뭐예요?” 요즘 이런 질문을 부쩍 자주 듣습니다. 그런데 AI 벤치마크 순위는 지난달 확인한 표가 이번 달 초에 벌써 뒤집힐 만큼 빠르게 바뀌고 있어요. 신모델 하나가 나오면 벤치마크 표 전체가 다시 짜이는 일도 흔합니다. 최근에도 비슷한 일이 있었죠. 어느 회사가 신형 모델을 발표하자마자 “역대 최고 지능”이라는 제목의 기사가 쏟아졌는데, 정작 제3자 검증 기관이 같은 모델을 독립적으로 측정해보니 발표만큼 압도적인 결과는 아니었습니다. 이런 일이 반복되다 보면 어느 발표를 믿어야 할지 헷갈리기 마련이고요.
이 글은 OpenAI·Anthropic·Google·xAI·Meta·DeepSeek, 이렇게 6개 회사가 최근 내놓은 최신 모델을 벤치마크 자료로 비교합니다. 각 회사가 자체적으로 발표한 수치와 제3자 리더보드가 독립적으로 측정한 수치를 나란히 놓고 봤어요. 미리 밝혀두자면 이 글에서 “종합 1위”라는 단정은 하지 않습니다. 벤치마크 종류에 따라, 그리고 무엇을 기준으로 재느냐에 따라 순위가 뒤바뀌기 때문입니다.
이 글의 벤치마크 수치와 순위는 2026년 9월 6일 조사 시점 기준입니다. 특히 사람이 직접 답변을 비교해 투표하는 방식의 리더보드(Arena)는 실시간으로 계속 바뀌는 구조라, 이 글을 읽는 시점에는 이미 순위가 달라져 있을 가능성이 높습니다. GPT-6 Astra처럼 발표된 지 며칠 안 된 모델은 조사 시점 기준 일부 리더보드에 아직 정식 반영되지 않은 상태였다는 점도 참고해주세요.
AI 벤치마크 순위 비교, 기준마다 다른 1위
벤치마크를 비교할 때 가장 먼저 구분해야 할 게 있습니다. 문제를 기계가 자동으로 채점하는 방식과, 사람이 두 모델의 답변을 직접 보고 어느 쪽이 더 나은지 투표하는 방식은 완전히 다른 걸 측정합니다. 전자를 대표하는 게 제3자 검증 기관 Artificial Analysis의 Intelligence Index고, 후자를 대표하는 게 LMArena(현 Arena) 리더보드예요. 같은 모델이라도 이 두 방식에서 순위가 다르게 나오는 일이 드물지 않아요.
| 모델 | 개발사 | AA Intelligence Index(2026-09 기준) |
|---|---|---|
| Claude Fable 5.1 | Anthropic | 66 |
| Claude Opus 5 | Anthropic | 63 |
| Claude Fable 5 | Anthropic | 62 |
| Grok 4.6 | xAI | 61 |
| GPT-6 Astra | OpenAI | 61 |
| Gemini 3.7 Flash | 56 |
* 같은 비교 자료에서 Meta·DeepSeek 모델은 별도 수치가 공개되지 않아 이 표에는 포함하지 않았습니다.
숫자만 보면 Claude Fable 5.1이 66점으로 가장 높습니다. 다만 표 아래쪽 Grok 4.6과 GPT-6 Astra는 나란히 61점으로 사실상 동률이에요. 이 정도 차이는 측정 시점이나 조건에 따라 오차범위 안에서 왔다 갔다 할 수 있는 수준으로 보는 게 맞습니다.
같은 시점에 사람이 직접 답변을 비교해 투표하는 Arena 리더보드를 보면 그림이 조금 달라집니다. 2026년 9월 6일 조회 시점 기준으로 텍스트 종합 순위 상위 10개 가운데 8개를 Claude 계열 모델이 차지하고 있었고, Gemini 3.8 Flash가 8위에 올라 있었어요(참고로 공식 모델 카드로 확인된 최신 버전은 3.7 Flash인데, 조사 중 3.8이라는 이름도 동시에 검색돼 헷갈렸습니다 — 마이너 버전이 워낙 빨리 갱신되다 보니 흔한 일입니다).
GPT-6 Astra와 Grok 계열은 이 상위 10위 안에는 없었는데, 발표 직후라 투표 데이터가 아직 충분히 쌓이지 않았을 가능성도 배제할 수 없습니다. 실제로 GPT-6 Astra는 별도 세부 리더보드인 “웹 개발 코드 비교”에서는 1,797점으로 1위를 기록했고, 메인 종합 리더보드 점수는 운영진이 “곧 공개하겠다”고 공지한 상태였어요.
자동채점 벤치마크는 정답이 정해진 문제를 얼마나 맞히는지 재고, Arena 같은 리더보드는 사람이 어느 답변을 더 선호하는지 투표합니다. 재는 대상 자체가 다르니 순위가 엇갈리는 건 이상한 일이 아니에요. 이 표 하나만 봐도 기준에 따라 순위가 달라질 수 있다는 게 보일 텐데, 이 글이 어느 한 모델을 “종합 1위”로 못 박지 않는 이유이기도 합니다.

GPT-6 Astra 벤치마크, OpenAI가 내놓은 신형 모델
2026년 9월 3~4일 OpenAI가 공개한 GPT-6 Astra는 “세계에서 가장 지능적이고 정렬(alignment)된 모델”이라는 문구로 소개됐습니다. 컴퓨터 사용, 브라우징, 소프트웨어 엔지니어링, 사이버보안, 과학, 전문 업무 영역에서 “state-of-the-art”라고 공식 발표문에 명시돼 있어요.
| 벤치마크 | 영역 | 수치 |
|---|---|---|
| FrontierMath Tier 4 | 최상위 수학 | 약 97.6~98%(포화 수준으로 보도) |
| ARC-AGI-3 | 일반 추론 | 98.6%~99.9%* |
| ExploitBench | 사이버보안 | 100% |
| GPQA Diamond | 대학원 수준 과학 | 96.0% |
| DeepSWE v1.1 | 소프트웨어 엔지니어링 | 74.1% |
| HealthBench Professional | 의료 전문 지식 | 63.4점(GPT-5.6 Sol 60.5 대비 +2.9) |
| HealthBench Hard | 고난도 의료 상담 | 36.3점(+3.2) |
| 프롬프트 인젝션 견고성 | 보안(간접 공격 방어) | 99.79%(GPT-5.6 Sol 96.23% 대비 개선) |
| 오정렬(misalignment) 비율 | 안전성, 낮을수록 좋음 | 3.4%(GPT-5.6 Sol 18.8% 대비 대폭 감소) |
* ARC-AGI-3는 상태유지형(stateful) 고비용 평가 환경에서 99.9%가 나오고, 일반 API 단발 호출 조건에서는 이보다 낮게 나온다는 3자 해설이 있습니다. 다만 OpenAI 공식 문서가 이 차이를 직접 설명한 문구는 확인되지 않았습니다(3자 종합, 추정).
가격은 입력 100만 토큰당 $10, 캐시 입력 $1, 출력 $50이고 컨텍스트 윈도우는 105만 토큰, 최대 출력은 12만 8천 토큰입니다. GPT-5.6 Sol 대비 가격은 약 2.5배 올랐지만, 코덱스 계열 작업 기준 토큰 소모량은 약 3분의 1 수준이라는 제3자 분석(Artificial Analysis)도 함께 확인됐어요.
자체 안전성 문서에서 “사고 과정(Chain-of-Thought) 모니터링 가능성이 상당히 감소했다”는 점을 스스로 명시했습니다. 자사 발표문에 자기 리스크를 공개했다는 점에서는 이례적으로 투명한 대목이지만, 그만큼 모델 내부 작동을 들여다보기가 더 어려워졌다는 뜻이기도 합니다.
제3자 검증으로 넘어가면 얘기가 조금 달라집니다. Artificial Analysis Intelligence Index에서 GPT-6 Astra는 61점으로 Claude Fable 5.1(66점)보다 낮았습니다. 코딩 에이전트 세부 지표에서는 처음엔 Claude Fable 5와 GPT-6 Astra가 67점으로 동률이었는데, 곧이어 나온 Claude Fable 5.1이 70점으로 두 모델을 모두 앞질렀어요. 도구 사용 추론 능력을 재는 Humanity’s Last Exam에서도 Astra는 57.2%로 Claude Fable 5.1(65.0%)·Opus 5(63.6%)보다 낮게 측정됐습니다.
종합해보면 GPT-6 Astra는 컴퓨터 사용, 에이전틱 코딩, 사이버보안, 안전성 지표에서 두드러졌고 웹 개발 코딩 세부 리더보드에서도 1위를 기록했습니다. 다만 종합 지능 지수나 도구 활용 추론 평가에서는 같은 시점 Claude 최상위 모델에 못 미쳤어요. “전 영역 1위”라는 표현은 이 모델에 어울리지 않습니다. “특정 영역에서 두드러지게 강한 최신 모델” 정도가 더 정확한 설명이겠죠.
Claude Fable 5.1·Mythos 5.1 벤치마크 vs Opus 5, 두 갈래 라인업
GPT-6 Astra와 계속 비교선상에 오른 곳이 바로 Anthropic입니다. Anthropic은 지금 서로 다른 등급의 최신 모델 라인 두 개를 동시에 운영하고 있어서, 이 부분에서 이름이 꼬여 헷갈리는 경우가 꽤 있습니다. ‘Claude Opus 5’와 ‘Claude Fable 5.1’이 마치 경쟁하는 별개 모델처럼 보이지만, 실제로는 서로 다른 두 계보가 나란히 이어지는 구조예요.
2026년 9월 1일 발표된 Claude Fable 5.1과 Claude Mythos 5.1은 동일한 기반 모델입니다. Fable 5.1은 표준 안전장치를 갖춘 일반 공개판이고, Mythos 5.1은 사이버보안·생명과학 업무 지원을 위해 안전장치를 일부 완화한 버전으로 “신뢰할 수 있는 접근 프로그램” 대상에게만 제공됩니다. 즉 Mythos 5.1은 실재하는 공식 모델명이 맞지만, 일반 사용자는 접근할 수 없는 모델이에요.
| 벤치마크 | Claude Fable 5 | Claude Fable 5.1 | Claude Opus 5 |
|---|---|---|---|
| Terminal-Bench-Science | 24.7% | 52.6% | 29.0% |
| Terminal-Bench 4.0(에이전틱 코딩) | 42.0% | 55.8% | 52.3% |
| GDPval-AA v2 | 1723 | 1853 | 1824 |
| OSWorld 2.0 | 72.9% | 77.9% | 75.4% |
| HLE(도구 사용) | 63.8% | 65.0% | 63.6% |
Fable 5.1/Mythos 5.1 쪽은 코딩·에이전틱 작업의 근본 원인 해결 능력, 장시간 무감시 작업, 단백질 설계나 GPU 커널 최적화 같은 과학 연구 지원을 강조합니다. 안전장치 오탐도 줄었는데, 생물학 관련 오탐이 85% 감소하고 사이버보안 개입이 60% 감소했다고 발표됐어요. 가격은 입력 $10/출력 $50(백만 토큰당)으로 Fable 5와 동일하지만, 캐시 읽기 가격이 75% 인하돼 일반 작업 비용은 약 25%, 에이전틱 작업은 최대 45%까지 절감된다고 합니다.
Opus 5는 2026년 7월 24일 발표된 중급 라인으로, Opus 4.8의 후속입니다. 공식 포지셔닝은 “Fable 5의 프런티어 지능에 근접하면서 가격은 절반”이에요. CursorBench 3.2 최고 난이도에서는 Fable 5 최고점의 99.5%를 절반 비용으로 달성했고, ARC-AGI-3에서는 차순위 모델의 3배 점수를 기록했다고 발표됐습니다. 가격은 입력 $5/출력 $25로 Opus 4.8과 동일하게 유지됐고요.
제3자 검증에서는 Claude Fable 5.1이 AA Intelligence Index 66점으로 6개 모델 중 가장 높았고, Opus 5는 63점, Fable 5는 62점이었습니다. Arena 리더보드 조회 스냅샷(2026-09-06)에서도 Claude Fable 5.1이 1507점으로 1위, Opus 5가 1493점으로 상위권에 있었고, 텍스트 종합 상위 10개 중 8개가 Claude 계열이었어요. 다만 이건 특정 조회 시점의 스냅샷일 뿐, Arena 순위는 상시 변동된다는 점을 다시 한번 짚어둡니다.
Gemini 3.7 Flash 벤치마크, Google의 에이전틱 방향
Anthropic이 코딩과 과학 연구에 집중하는 동안, Google DeepMind는 조금 다른 방향을 파고들고 있습니다. 2026년 8월 13일 공개된 Gemini 3.7 Flash의 공식 모델 카드 기준 AA Intelligence Index는 56점이었습니다.
| 벤치마크 | 영역 | 수치 |
|---|---|---|
| FrontierCode 1.1 | 코딩 | 43.6% |
| DeepSWE v1.1 | 소프트웨어 엔지니어링 | 65.3% |
| Terminal-bench 2.1 | 에이전틱 터미널 코딩 | 85.8% |
| LVBench | 장문 비디오 이해 | 85.4% |
| GDM-MRCR v2 | 장문맥 처리 | 97.0% |
| 에이전틱 컴퓨터 사용 | 컴퓨터 조작 | 47.9%(이전 버전 33.8%) |
Google은 2026년을 “에이전틱 제미나이 시대”로 규정하고 있습니다. thinking_level 파라미터로 개발자가 추론 깊이·속도·비용을 직접 조절하게 하는 방향, 시각 추론과 코드 실행을 결합한 Agentic Vision, 3.7·3.6·3.5 Flash-Lite로 확대되는 에이전틱 비디오 이해까지, “에이전트 생태계” 구축에 무게를 두는 모습이에요. Gemini 3.5 Pro는 파트너 대상 테스트 중이고, Gemini 4는 사전학습을 시작한 단계로 언급됐습니다(2026-09 시점 기준, 공개 출시 전).
Grok 4.6 벤치마크, xAI의 속도와 효율
Google이 에이전트 생태계 확장에 힘을 쏟는 사이, xAI는 속도와 비용이라는 다른 쪽에 집중하고 있습니다. Grok 4.6은 2026년 8월 12일, 전작 Grok 4.5로부터 불과 35일 만에 출시됐습니다.
| 항목 | Grok 4.6 | Grok 4.3(대용량 컨텍스트용) |
|---|---|---|
| 컨텍스트 윈도우 | 500K 토큰 | 1M 토큰 |
| 가격(입력/백만 토큰) | $2~4(구간별 차등) | $1.25 |
| 가격(출력/백만 토큰) | $6~12(구간별 차등) | $2.50~5 |
| AA Intelligence Index | 61 | – |
| GDPval-AA v2 | 1753(Elo) | – |
| CursorBench v3.2 | 69.9% | – |
| DeepSWE v1.1 | 65.9% | – |
xAI는 GDPval-AA v2, AA-Briefcase(장기 분석 업무), Harvey 법률 평가 같은 “지식노동형” 벤치마크에서 1위라고 자체 발표했습니다. 흥미로운 건 동시에 DeepSWE v1.1과 Terminal-Bench v3.0에서는 GPT-5.6 Sol에 뒤처진다는 점을 스스로 인정했다는 점이에요. 자사 발표에서 약점까지 밝힌 드문 사례죠.
xAI의 공식 미션은 “인류의 과학적 발견을 가속화한다”이며, 공개된 시스템 프롬프트 정책에는 “최대한 진실 추구(maximally truth-seeking)”가 최우선으로 명시돼 있어요. 참고로 2026년 9월 2일 일론 머스크가 차기 플래그십이 열흘쯤 뒤 출시되며 파라미터 규모가 약 2.1조 개(현재의 약 40% 증가)라고 언급했는데, 이건 공식 블로그 발표가 아닌 개인 발언 기준이라 실제 출시일과 스펙은 달라질 수 있습니다.
Muse Spark, Meta의 개인 초지능(벤치마크 비공개)
xAI가 지식노동형 벤치마크를 내세우는 것과 달리, Meta는 벤치마크 경쟁 자체에서 한 발 비켜서 있는 모습입니다. 2026년 4월 8일 발표된 Muse Spark는 Meta Superintelligence Labs가 기존 스택을 전면 재구축한 뒤 내놓은 첫 모델로, 기존 Llama 브랜드가 아닌 새로운 “Muse” 계열의 시작입니다.
공식 발표문은 “개인 초지능(Personal Superintelligence)”을 목표로 내세우며 건강, 쇼핑, 소셜 콘텐츠 같은 일상 개인 용도에 특화한다고 밝혔습니다. 세상을 함께 보는 멀티모달 인식, 병렬 서브에이전트 실행을 강조하고 “질문에 답하는 것을 넘어 사용자를 위해 실제로 일을 대신 해주는 에이전트”를 지향한다고 명시했어요. 다만 공식 발표문에는 구체적인 벤치마크 수치가 공개되지 않았고, “작고 빠르지만 강력하다”는 정성적 설명만 제시됐습니다.
이후 2026년 8월 10일 300억 규모 오픈웨이트 모델 “Muse Glimmer”(Apache 2.0, 128K 컨텍스트)도 나온 것으로 보도됐는데, 이 부분은 3자 보도 기준이라 공식 1차 문서로 직접 대조하지는 못했어요.
DeepSeek V4 벤치마크, 오픈웨이트 진영
Meta가 벤치마크 수치를 공개하지 않는 것과 대조적으로, DeepSeek은 처음부터 수치와 오픈소스 전략을 전면에 내세웁니다. V4는 2026년 4월 24일 프리뷰로 처음 공개됐고, V4-Flash-0731이 7월 31일 정식화됐으며, V4-Pro는 8월 13일 앱·웹·API 전체에 정식 배포됐습니다.
| 항목 | V4-Pro | V4-Flash |
|---|---|---|
| 총 파라미터 | 1.6조 | 2,840억 |
| 활성 파라미터(MoE) | 490억 | 130억 |
| 기본 컨텍스트 윈도우 | 100만 토큰 | 100만 토큰 |
| 공개 방식 | 오픈웨이트 | 오픈웨이트 |
공식 문서는 “오픈소스 SOTA 에이전틱 코딩”을 강조하며 폭넓은 세계 지식과 수학·STEM·코딩 추론 성능을 내세웁니다. V4-Flash는 간단한 에이전트 작업에서 V4-Pro와 동등한 성능을 낸다고 자체 명시했고요. 가격표는 공식 문서에 이미지로만 제공돼 이번 조사에서 정확한 텍스트 수치를 확보하지 못했어요. DeepSeek은 자사 모델 다수를 오픈웨이트로 공개해 Ollama, LM Studio 같은 도구로 로컬 구동이 가능하도록 하는 정책을 유지하고 있습니다.
여기서 자사 발표와 제3자 검증의 괴리를 보여주는 사례 하나를 짚고 넘어가야 할 것 같아요. DeepSeek이 자체 발표한 Terminal-Bench 점수는 87.9%였는데, 한 제3자 분석 매체는 커뮤니티 표준 하네스로 재현했을 때 54.68%가 나왔다고 주장했습니다. 33점포인트 차이인데, DeepSeek 공식 문서에서 직접 재현되지는 않아 정확한 원인은 단정하기 어렵습니다(추정: 자사 벤치마크 환경과 표준 하네스 간 차이일 가능성). 앞서 GPT-6 Astra의 ARC-AGI-3 사례와 마찬가지로, 벤치마크는 측정 조건 하나로 결과가 크게 달라질 수 있다는 걸 보여주는 대목이죠.
6개 AI 기업 개발 방향 한눈에 보기
6개 회사가 강조하는 지점을 표로 정리하면 이렇습니다. 성능 수치보다 “이 회사가 어디에 힘을 주고 있는가”를 보는 데 도움이 될 거예요.
Anthropic · 코딩·안전장치
Google · 에이전틱 생태계
xAI · 속도·비용
Meta · 개인 초지능
DeepSeek · 오픈웨이트
아래 표에서 회사별 최신 모델과 특히 강한 영역을 자세히 확인하세요.
| 회사 | 2026-09 기준 최신 모델 | 강조하는 방향 | 특히 강한 영역 |
|---|---|---|---|
| OpenAI | GPT-6 Astra | 지능과 정렬, 컴퓨터 사용·에이전틱 코딩 | 사이버보안, 과학, 웹 개발 코딩(세부 리더보드) |
| Anthropic | Fable 5.1/Mythos 5.1(최상위), Opus 5(중급) | 코딩·과학 연구용 에이전틱 능력, 안전장치 정교화 | 종합 지능 지수, 에이전틱 터미널 작업, 도구 사용 추론 |
| Gemini 3.7 Flash | 에이전틱 생태계, 개발자가 추론 깊이 직접 조절 | 장문맥 처리, 장문 비디오 이해 | |
| xAI | Grok 4.6 | 속도·비용 효율, “진실 추구” | 지식노동형 업무(실무 분석, 법률 평가) |
| Meta | Muse Spark | 개인 일상용 초지능, 소비자 어시스턴트 | 정량 벤치마크 비공개 — 정성적 설명만 제시 |
| DeepSeek | V4-Pro/Flash | 오픈웨이트 공개, 비용 효율 | 에이전틱 코딩(오픈소스 기준), 100만 토큰 컨텍스트 가성비 |
AI 벤치마크 순위, 자주 묻는 질문
현시점 가장 좋은 AI는 무엇일까요?
솔직히 답하면 카테고리마다 다릅니다. 종합 지능 지수는 Claude Fable 5.1이 가장 높게 나왔고, 사람 선호도 기반 Arena 리더보드도 Claude 계열이 상위권을 다수 차지했습니다. 반면 코딩 세부 리더보드나 사이버보안 벤치마크에서는 GPT-6 Astra가, 지식노동형 벤치마크에서는 Grok 4.6이 강세를 보였어요. 하나의 왕좌를 정하기보다는 위 “회사별 개발 방향” 표를 보고 본인 용도에 맞는 강점을 찾는 편이 실용적입니다.
이 순위, 얼마나 자주 바뀌나요?
꽤 자주 바뀝니다. Arena 같은 사람 투표 기반 리더보드는 실시간으로 계속 갱신되고, 새 모델이 나올 때마다 자동채점 벤치마크 표도 새로 짜입니다. 실제로 GPT-6 Astra는 이 글 조사 시점 기준으로도 메인 텍스트 리더보드 점수가 아직 확정되지 않은 상태였어요. 이 글에 나온 수치를 참고하되, 중요한 의사결정 앞에서는 각 리더보드 사이트에서 최신 값을 다시 확인하는 걸 권합니다.
일반 사용자가 여기 나온 최상위 모델에 다 접근할 수 있나요?
아니요, 그렇지 않습니다. 대표적으로 Claude Mythos 5.1은 사이버보안·생명과학 업무를 위해 안전장치를 일부 완화한 버전이라 “신뢰할 수 있는 접근 프로그램” 대상에게만 제공되고, 일반 Pro·Max 구독자는 이용할 수 없어요. 벤치마크 표에 이름이 올라 있다고 해서 지금 쓰는 구독 요금제에서 바로 접근 가능하다는 뜻은 아니니, 실제 사용 전에 자신의 요금제가 어떤 모델을 지원하는지 확인이 필요합니다.
벤치마크 점수가 높으면 실제 업무에서도 그만큼 체감되나요?
어느 정도는 그렇지만, 완벽하게 비례하지는 않습니다. 벤치마크는 표준화된 조건에서 측정하는 반면 실제 업무는 훨씬 지저분한 맥락에서 벌어지니까요. 물론 벤치마크 점수가 실무 체감과 크게 다르지 않다는 반론도 있습니다만, 이 글에서 다룬 GPT-6 Astra의 ARC-AGI-3 사례나 DeepSeek의 Terminal-Bench 사례처럼 측정 조건 하나로 점수가 수십 점씩 벌어지는 경우가 실제로 확인됩니다. 벤치마크 순위표는 참고 자료로 보되, 중요한 업무에 적용하기 전에는 직접 몇 가지 프롬프트를 넣어 결과를 확인해보는 편이 안전합니다.
핵심 정리
- 2026년 9월 초 기준 AA Intelligence Index는 Claude Fable 5.1이 66점으로 가장 높았지만, Grok 4.6·GPT-6 Astra는 61점으로 사실상 동률이었습니다.
- GPT-6 Astra는 컴퓨터 사용·에이전틱 코딩·사이버보안·웹 개발 코딩에서 강세를 보였지만, 종합 지능 지수와 도구 사용 추론(HLE)에서는 Claude 최상위 모델보다 낮게 측정됐습니다.
- Anthropic은 최상위(Fable 5.1/Mythos 5.1)와 중급(Opus 5) 두 라인을 동시에 운영 중이며, Mythos 5.1은 일반 사용자가 접근할 수 없는 제한된 모델입니다.
- Google·xAI·Meta·DeepSeek은 각각 에이전틱 생태계, 속도·비용 효율, 개인 초지능, 오픈웨이트라는 서로 다른 방향에 집중하고 있습니다.
- 자사 발표 수치와 제3자 검증 수치는 다를 수 있으므로, 중요한 판단 전에는 교차 확인이 필요합니다.
- OpenAI 공식 발표 스레드(community.openai.com) 및 안전성 문서(deploymentsafety.openai.com/gpt-6-astra), 2026-09-03
- Anthropic 공식 발표문(anthropic.com/claude-fable-and-mythos-5-1, anthropic.com/news/claude-opus-5) 및 System Card, 2026-09-01·2026-07-24
- Google DeepMind 공식 모델 카드(deepmind.google/models/model-cards/gemini-3-7-flash), 2026-08-13
- xAI 공식 모델 문서(docs.x.ai/developers/models), 2026-08-12
- Meta 공식 발표문(about.fb.com), 2026-04-08
- DeepSeek 공식 API 문서(api-docs.deepseek.com/news/news260424), 2026-04-24
- 제3자 교차검증: Artificial Analysis(artificialanalysis.ai), LMArena/Arena(arena.ai/leaderboard) — 2026-09-06 조회 스냅샷 기준
