2026년 9월 첫 주에 세 회사가 연달아 새 모델을 내놓았습니다. 1일 Anthropic의 클로드 페이블 5.1, 2일 구글의 제미나이 3.8 플래시, 3일 OpenAI의 GPT-6 아스트라입니다. 셋 다 “가장 똑똑하다”고 말하지만 자리가 다릅니다. 아스트라와 페이블 5.1은 100만 토큰당 입력 10달러·출력 50달러의 최상위 칸이고, 제미나이 3.8 플래시는 그 13분의 1 값으로 “상위 모델에 근접”을 내세우는 보급형입니다. 이 글은 세 모델의 가격·컨텍스트·컷오프를 한 표에 놓고, 어떤 작업에 무엇을 쓰면 되는지 정리합니다. 수치는 2026년 9월 6일 각 사 공식 문서 기준입니다.
목차
한 주에 나온 세 모델
- 클로드 페이블 5.1(9월 1일): Anthropic이 “코딩과 지식 작업에서 가장 유능한 모델”로 소개했습니다. 값은 페이블 5와 같지만 캐시 읽기 단가를 100만 토큰당 1달러에서 0.25달러로 75% 내렸습니다. claude.ai의 Pro·Max·Team·Enterprise 요금제와 API, AWS·Google Cloud·Microsoft Foundry에서 쓸 수 있습니다.
- 제미나이 3.8 플래시(9월 2일): 구글이 “3.7 플래시와 같은 속도·비용으로 추론과 코딩이 가장 좋은 플래시”라고 소개했습니다. 도구 없이 푸는 HLE-Verified에서 54.9%를 냈다고 밝혔고, 제미나이 앱(Pro·Ultra), AI 스튜디오, 검색의 AI 모드, 구글 시트에 들어갔습니다.
- GPT-6 아스트라(9월 3일): OpenAI가 “컴퓨터에서 할 수 있는 일은 대신 해 준다”를 내세운 에이전트 특화 모델입니다. Pro·Enterprise·Business Premium과 API에 먼저 열렸고 Plus는 순차 적용입니다. 자세한 내용은 아스트라와 GPT-5.6 비교 글에서 다뤘습니다.
세 모델 한눈 비교
API 가격은 100만 토큰당 단가입니다. 캐시 읽기는 같은 문맥을 반복 호출할 때 적용되는 단가로, 에이전트 작업에서는 이 항목이 청구액의 대부분을 차지합니다.
| 구분 | GPT-6 아스트라 | 클로드 페이블 5.1 | 제미나이 3.8 플래시 |
|---|---|---|---|
| 출시 | 2026-09-03 | 2026-09-01 | 2026-09-02 |
| 입력 / 출력 | $10 / $50 | $10 / $50 | $0.75 / $3.75 (12월 31일까지, 이후 $1.50 / $7.50) |
| 캐시 읽기 | $1 | $0.25 | $0.075 (이후 $0.15) |
| 컨텍스트 / 최대 출력 | 105만 / 12.8만 | 100만 / 12.8만 | 공식 문서 미기재 |
| 지식 컷오프 | 2026-04-30 | 2026년 6월 | 미기재 |
| 초점 | 컴퓨터 조작·에이전트 | 장기 추론·장시간 에이전트 코딩 | 속도·비용 대비 추론 |
| 보안 특화판 | 신뢰 접근 프로그램(사이버 Critical) | 미소스 5.1(검증 기관 전용) | 3.8 플래시 사이버(Fairwind 프로그램) |
표에서 두 가지가 눈에 띕니다. 첫째, 최상위 둘의 정가는 같지만 캐시 읽기는 페이블 5.1이 아스트라의 4분의 1입니다. 같은 긴 문맥을 수십 번 돌리는 에이전트 작업에서는 이 차이가 총액을 가릅니다. 둘째, 제미나이 3.8 플래시의 값은 연말까지의 도입가이고 1월 1일부터 두 배가 됩니다. 지금 단가로 예산을 짜면 1월에 두 배 청구서를 받습니다.
세 회사가 같은 주에 같은 일을 했다 — 보안 특화판
우연이 아닌 공통점이 하나 있습니다. 셋 다 일반판과 별도로 사이버보안 능력을 푼 판을 검증된 기관에만 열었습니다. OpenAI는 아스트라가 자사 대비 프레임워크에서 사이버 역량 Critical에 도달했다며 대규모 취약점 탐색을 신뢰 접근 프로그램으로 제한했고, Anthropic은 페이블 5.1과 함께 안전장치를 느슨하게 둔 미소스 5.1을 검증된 조직에만 제공하며, 구글은 3.8 플래시 사이버를 Fairwind 프로그램을 통해 정부·핵심 인프라·소프트웨어 관리자에게 우선 제공한다고 밝혔습니다. 구글은 이 판이 취약점 벤치마크 CWE-Bench에서 47.2%로 상위 모델(47.8%)에 근접했다고 적었습니다. 일반 사용자에게 이것이 뜻하는 바는 하나입니다. 보안 관련 요청은 세 모델 모두에서 이전보다 보수적으로 거절될 수 있다는 것입니다. AI가 답을 거부하는 구조는 별도 글에서 다뤘습니다.
같은 작업에 무엇을 쓸까
기준은 셋입니다. 화면을 조작해야 하는가, 문맥을 얼마나 반복하는가, 얼마나 많이 부르는가.
- 브라우저·데스크톱을 직접 조작하는 자동화: 아스트라가 그 용도로 만들어진 모델입니다. 클로드 쪽에서는 Claude in Chrome이 같은 자리를 맡습니다.
- 긴 코드베이스를 오래 붙잡는 작업: 페이블 5.1. 같은 파일 수백 개를 문맥에 두고 수십 턴을 돌리면 캐시 읽기 0.25달러가 효과를 냅니다. Anthropic 문서는 “오퍼스 5의 추론 강도를 올려도 부족할 때” 페이블 5.1로 가라고 안내합니다. 추론 강도는 추론 수준 설정 글에서 설명했습니다.
- 대량 호출·실시간 응답: 제미나이 3.8 플래시. 단, 1월 단가로 다시 계산해 보고 결정해야 합니다.
- 대부분의 일상 업무: 세 회사 모두 최상위가 아닌 중간 칸을 기본값으로 권합니다. Anthropic은 오퍼스 5($5/$25), OpenAI는 GPT-5.6 테라·솔, 구글은 플래시입니다.
페이블 5.1과 오퍼스 5 중 무엇을 고를지는 캐시 읽기 단가로 계산한 글을 이어서 올릴 예정입니다.
자주 묻는 질문
셋 중 가장 똑똑한 모델은 무엇인가요?
작업에 따라 다릅니다. 각 사가 내세우는 벤치마크가 서로 달라 한 줄로 우열을 가릴 수 없습니다. 컴퓨터 조작은 아스트라, 장시간 코딩은 페이블 5.1, 비용 대비 추론은 3.8 플래시가 각자 강조하는 자리입니다. 벤치마크가 무엇을 재는지는 AI 벤치마크 글을 참고하십시오.
ChatGPT·클로드·제미나이 앱을 쓰는데 새 모델이 자동으로 적용되나요?
유료 요금제부터 순차로 들어갑니다. 아스트라는 Plus에 며칠 뒤, 페이블 5.1은 Pro 이상, 3.8 플래시는 제미나이 Pro·Ultra에 적용됐습니다. 무료 사용자는 세 회사 모두 하위 모델을 씁니다.
지식 컷오프가 왜 다른가요?
페이블 5.1은 2026년 6월, 아스트라는 4월 30일입니다. 두 달 차이는 그 사이 일어난 일을 모델이 아느냐를 가릅니다. 컷오프가 생기는 이유는 지식 컷오프 글에서 다뤘습니다.
정리
9월 첫 주의 세 모델은 서로 경쟁자라기보다 세 칸을 하나씩 채운 것에 가깝습니다. 화면 조작은 아스트라, 오래 붙잡는 코딩은 페이블 5.1, 싸고 빠른 추론은 3.8 플래시입니다. 값을 견줄 때는 정가보다 캐시 읽기 단가와 도입가 만료일을 보시면 됩니다.
공식 출처: Anthropic 모델 문서 · 구글 제미나이 3.8 플래시 발표 · OpenAI API 가격 (2026년 9월 6일 확인)