화면 확인용 샘플이에요. drafts의 초안을 옮긴 것이라 검수가 끝나지 않았어요.

GPT-6 아스트라·솔, 클로드 오푸스·페이블 중 뭘 쓸까

네 모델의 순위를 외우기보다, 지금 하려는 일이 문서 정리인지, 여러 앱을 오가는 실행인지, 반복해서 고칠 초안인지부터 보세요. 같은 평가에서도 과제와 설정에 따라 순서가 달라져요.

이 글 요약
  • 종합 평가에서는 Opus 5.5가 앞서지만, 이 점수가 디자인 결과물의 완성도 순위는 아니에요.
  • 어려운 다단계 작업은 Opus 5.5 또는 Astra, 여러 번 시도할 일은 Sol부터 살펴보세요.
  • Fable 5.1은 Opus 5.5로도 부족한 고난도·장기 작업에서 다시 비교할 후보예요.
준비물
비교 기준
같은 실제 작업·같은 자료·같은 완료 조건으로 살펴보기
앱
ChatGPT Work 또는 Codex, Claude 앱 또는 Claude Code
구독
모델마다 이용 가능한 화면과 요금제·사용량이 다름. 본문 「어디에서 쓸 수 있나」 참고
파일
실제로 비교할 작업의 브리프·참고 자료·완료 기준
시간
작업과 검토 범위에 따라 달라짐

새 모델이 나올 때마다 도구를 바꿔야 할까요? 이름보다 중요한 건 무슨 일을, 어디에서, 얼마나 반복할 건가예요.[1][2]

먼저 모델과 작업 공간을 구분해볼게요. 모델은 엔진이고, ChatGPT의 Chat은 대화, Work는 문서·사이트 등 다단계 결과물, Codex는 코드 작업을 위한 공간이에요. 같은 모델도 어디에 놓였는지에 따라 할 수 있는 일이 달라져요.[3]

숫자로 보면 누가 앞설까

모델Artificial Analysis 종합 지수Zapier 업무 흐름 완료율개발자용 API 입력/출력 가격*
Claude Opus 5.55842.47%$4 / $20
GPT-6 Astra5341.4%$10 / $50
Claude Fable 5.15331.4%$10 / $50
GPT-6 Sol4833.2%$2 / $10

*토큰은 AI가 처리하는 텍스트의 작은 단위예요. 가격은 입력·출력 각각 100만 토큰당 미국 달러 기준의 개발자용 API 정가예요. ChatGPT·Claude의 월 구독료가 아니에요.[1][2][4][5][6]

Artificial Analysis의 숫자는 지식·추론·문서·코딩 등 열 가지 평가를 합친 지수예요. 58점이 성공률 58%라는 뜻은 아니에요. 네 모델 모두 최대 추론 설정이고, Opus·Fable에는 평가기관이 명시한 대체 모델 연결 설정이 적용됐어요.[4][5]

Zapier는 CRM·메일 등 47개 모의 앱에서 600개 넘는 비공개 과제를 끝까지 수행했는지 검사했어요. Opus와 Fable은 거절한 단계를 다른 모델에 넘기는 설정을 포함해요. Sol은 xhigh, 나머지는 max로, 모델에 허용한 추론 강도도 달라요. 같은 조건의 정면 승부는 아니에요. Zapier는 평가기관이면서 자동화 도구 판매사예요.[6]

어느 쪽도 브랜드 톤이나 영상의 미감을 직접 평가한 숫자는 아니에요.

그래서 어떤 작업에 뭘 먼저 써볼까

자료가 많고 결과물까지 정리해야 한다면: Opus 5.5부터

브리프와 경쟁사 자료를 읽고 제안서의 논리·근거를 점검한다면요? Anthropic은 대부분의 작업에서 Opus 5.5부터 시작하라고 안내해요. Artificial Analysis에서도 네 모델 중 종합 지수가 가장 높고, 여러 자료를 분석해 결과물을 구성하는 평가에 강했어요. 다만 제안서의 디자인 적합성을 보증하는 점수는 아니에요.[2][7]

브라우저·앱을 오가며 실행해야 한다면: Astra도 비교

표를 고치고 사이트 초안을 만들며 결과를 확인해야 한다면 Astra도 비교해보세요. OpenAI는 컴퓨터 사용과 어려운 전문 작업에 배치해요. Zapier의 마케팅 업무 과제에서는 Astra가 50.0%, Opus 5.5가 48.0%였어요. 광고 비주얼 평가가 아니라 앱 속 기록·절차를 맞게 처리하는 시험이라는 점은 꼭 구분하고요.[6][8]

초안과 수정을 여러 번 반복한다면: Sol

자료를 분류하고 제목을 여러 번 고쳐본다면 Sol을 살펴보세요. 종합 지수는 Astra보다 낮지만, Artificial Analysis에서는 이전 세대와 비슷한 종합 성능을 유지하면서 과제당 비용을 절반가량 줄였어요. 다만 일부 지식 업무에서는 필수 항목을 빠뜨리거나 표현 품질이 떨어졌어요. 최종본을 무조건 맡기기보다, 반복하고 확인할 수 있는 단계의 출발점이에요.[1][9]

Opus로도 해결되지 않는 장기·고난도 작업이라면: Fable 5.1

Anthropic은 Fable 5.1을 어려운 추론·장기 작업에 권하지만, Opus 5.5로도 부족할 때의 선택지로 소개해요. 종합 지수는 Fable 53, Opus 58이에요. 비싼 모델이 매번 더 나은 건 아니죠.[2][4][5]

어디에서 쓸 수 있나

Sol은 일반 Chat이 아니라 ChatGPT Work·Codex에서 고를 수 있어요. Astra는 Plus의 Work·Codex에서 사용량이 제한돼요. 일반 대화의 GPT-6 Pro는 Pro $100·$200, Business, Enterprise 플랜에서 제공돼요.[3]

Claude Fable 5.1은 Pro와 Team 일반 좌석에서 별도 사용량 크레딧으로 쓰고, Max·Team 프리미엄 좌석에서는 주간 한도 안에서 이용해요. 위 표의 API 가격을 내 월 구독료로 읽으면 안 돼요.[10]

모델을 바꾸기 전에 확인할 세 가지

  1. 결과물: 지금 필요한 게 아이디어인가요, 자료를 근거로 한 문서인가요, 실제 파일·앱의 변경인가요?
  2. 실패 기준: 출처가 틀리면 안 되나요, 제품 형태가 바뀌면 안 되나요, 앱에서 실제 저장까지 끝나야 하나요?
  3. 접근·검토 비용: 그 모델을 내 요금제에서 쓸 수 있나요? 결과를 사람이 확인하고 고칠 시간은 있나요?

같은 브리프와 자료를 두 모델에 주고, 완료 조건에 비춰 결과를 확인하면 선택이 쉬워져요. 점수는 후보를 줄이는 데 쓰고, 마지막 판단은 내 작업의 실패 지점에서 하세요.

출처
  1. OpenAI · 「Introducing GPT-6 Sol and Luna」 · 2026-09-22 · https://openai.com/index/introducing-gpt-6-sol-and-luna/ 판매사 자료 ↩ ↩ ↩
  2. Anthropic · 「Models overview」 · 확인 2026-09-28 · https://platform.claude.com/docs/en/about-claude/models/overview 판매사 자료 ↩ ↩ ↩ ↩
  3. OpenAI Help Center · 「ChatGPT Work and Codex」 · 확인 2026-09-28 · https://help.openai.com/en/articles/20001275-chatgpt-work-and-codex 판매사 자료 ↩ ↩
  4. Artificial Analysis · 「Claude Opus 5.5 takes the top spot on the Artificial Analysis Intelligence Index」 · 2026-09-22 · https://artificialanalysis.ai/articles/claude-opus-5-5 ↩ ↩ ↩
  5. Artificial Analysis · GPT-6 Astra / GPT-6 Sol / Claude Opus 5.5 / Claude Fable 5.1 모델별 평가 페이지 · 확인 2026-09-28 · https://artificialanalysis.ai/models/gpt-6-astra · https://artificialanalysis.ai/models/gpt-6-sol · https://artificialanalysis.ai/models/claude-opus-5-5 · https://artificialanalysis.ai/models/claude-fable-5-1 ↩ ↩ ↩
  6. Zapier · 「AutomationBench」 v1.0.6 · 확인 2026-09-28 · https://zapier.com/benchmarks (자동화 도구 판매사 운영 평가) ↩ ↩ ↩
  7. Artificial Analysis · 「Claude Opus 5.5 takes the top spot…」, AA-Briefcase 평가 설명 · 2026-09-22 · https://artificialanalysis.ai/articles/claude-opus-5-5 ↩
  8. OpenAI · 「GPT-6 Astra: A new generation of intelligence」 · 2026-09 · https://openai.com/index/gpt-6-astra/ 판매사 자료 ↩
  9. Artificial Analysis · 「GPT-6 Sol and Luna push the cost efficiency frontier」 · 2026-09-22 · https://artificialanalysis.ai/articles/gpt-6-sol-and-luna-push-the-cost-efficiency-frontier ↩
  10. Anthropic Help Center · 「Claude Fable models on your plan」 · 확인 2026-09-28 · https://support.claude.com/en/articles/15424964-claude-fable-models-on-your-plan 판매사 자료 ↩

잘하는 것과 부족한 것

잘하는 것
  • 각 모델의 용도와 접근 조건을 공식 문서로 확인할 수 있음
  • 종합 과제와 업무 앱 실행을 분리해 비교할 수 있음
부족한 것
  • 브랜드 적합성·영상의 미감·시각 완성도를 직접 비교한 근거는 아님
  • API 가격과 월 구독료, 평가용 모델과 실제 앱 경험은 같지 않음
적용해보기
  • 현재 작업의 결과물과 실패하면 안 되는 조건을 먼저 적기
  • 접근 가능한 모델 둘에 같은 자료·완료 기준을 주고 비교하기
  • 답변의 자신감보다 파일·화면·출처·수정 내역 확인하기