한 줄 요약

모델은 작업 성격으로 고르고, 추론 강도는 medium에서 시작해 한 단계씩 움직이세요. GPT-5.4와 5.4 mini는 2026년 8월 31일에 이미 지원이 끝났고, GPT-5.5도 2026년 10월 14일에 끝나므로 설정에 남은 모델 이름을 지금 바꿔 두세요.

GPT-6 Astra — 가장 높은 성능

2026년 8월 말 공식 모델 문서에 GPT-6 Astra가 추가됐습니다. 고급 추론과 computer use, 한층 강화된 판단력을 합친 모델로, 코드·앱·리서치를 넘나드는 복잡한 작업을 처음부터 끝까지 맡길 때 쓰도록 안내합니다.

항목내용
쓸 수 있는 곳ChatGPT 데스크톱 앱, 웹, Codex CLI, IDE 확장, Codex cloud, API
고르는 방법모델 선택기에서 Astra 선택 · CLI는 codex -m gpt-6-astra
추론 강도Light · Medium · High · Extra High · Max · Ultra(서브에이전트 위임)
노출 조건롤아웃 단계와 플랜에 따라 다릅니다. Enterprise는 워크스페이스의 모델 허용 목록을 확인하세요.
Fast mode 비용사용 가능한 경우 표준 크레딧의 2.5배
📌 고르는 기준: Astra가 목록 맨 위에 있다고 모든 작업에 쓸 필요는 없습니다. 끝까지 판단이 이어지는 긴 작업은 Astra, 깊이 있는 단일 작업은 Sol, 일상 작업은 Terra, 형태가 반복되는 대량 작업은 Luna가 비용 대비 효율이 좋습니다.

세 모델 — Sol · Terra · Luna

2026년 7월 말 GPT-5.6 계열이 공식 권장 모델이 됐습니다. 이름은 서열이 아니라 쓰임새를 나눈 것입니다. API에서 gpt-5.6은 별칭이며 gpt-5.6-sol로 연결됩니다.

모델공식 설명이럴 때
gpt-5.6-sol 복잡한 코딩·컴퓨터 조작·리서치·보안 작업에서 가장 강한 플래그십 정답이 불분명하고 마감 품질이 필요한 고가치 작업
gpt-5.6-terra 일상 작업용 균형 모델. GPT-5.5에 견줄 성능을 더 낮은 비용으로 추론은 필요하지만 매일 반복하는 보통 작업
gpt-5.6-luna 계열에서 가장 싸고 빠르면서도 충분한 성능 추출·분류처럼 성공 기준이 뚜렷하고 형태가 반복되는 작업

출시와 함께 Terra는 20%, Luna는 80% 저렴해졌습니다. 그동안 비용 때문에 자동화를 못 돌렸다면 Luna 기준으로 다시 계산해 볼 만합니다. ChatGPT Pro에는 5.3 Codex Spark가 별도로 있습니다. 텍스트 전용 research preview이고, 거의 즉시 반응하는 실시간 코딩 반복에 맞춰진 모델입니다.

2026년 8월 31일, GPT-5.4와 GPT-5.4 mini 지원 종료. ChatGPT 계정으로 로그인해 쓰는 사용자가 대상입니다. 공식 안내는 gpt-5.4 → gpt-5.6-terra, gpt-5.4-mini → gpt-5.6-luna로 옮기라는 것입니다. 개인 config.toml뿐 아니라 워크스페이스 기본값과 자동화 설정에 박아 둔 모델 이름도 같이 바꿔야 합니다.

Reasoning effort — 앱 6단계, API 6단계

같은 모델이라도 추론에 얼마나 힘을 쓸지 따로 정합니다. 앱과 API의 단계 이름이 다릅니다.

표면단계비고
앱 · CLI · IDE Low · Medium · High · Extra High · Max · Ultra Ultra는 서브에이전트를 써서 작업을 나눠 처리
API none · low · medium · high · xhigh · max medium이 균형 잡힌 출발점, max는 품질 최우선
기존 설정에서 옮기는 법. 공식 마이그레이션 지침은 지금 쓰는 값을 기준선으로 두고 한 단계 낮춰서 먼저 시험해 보라는 것입니다. GPT-5.6은 추론 효율이 좋아져 같은 결과를 더 낮은 단계에서 내는 경우가 많습니다. none을 쓰고 있었다면 그대로 지연 시간 기준선으로 두되, 추론이 도움 될 만한 흐름에서는 low도 같이 재 보세요.

Ultra와 서브에이전트

Ultra는 단순히 "더 오래 생각하는" 단계가 아니라 일을 나눠 맡기는 단계입니다. 서브에이전트는 탐색·테스트·분류·요약처럼 읽기 위주의 작업에 잘 맞습니다. 중간의 시끄러운 작업을 서브에이전트가 처리하고 메인 스레드는 요구사항에 집중합니다.

  • 호출 방법 — "항목마다 에이전트를 하나씩 띄워 줘"처럼 직접 요청합니다. Ultra에서는 적합한 작업을 알아서 위임하고, 그 아래 단계에서는 명시적으로 요청해야 합니다.
  • 커스텀 에이전트 정의 — 개인용은 ~/.codex/agents/, 프로젝트용은 .codex/agents/에 TOML 파일로 둡니다. name · description · developer_instructions가 필수입니다.
  • 에이전트별 재정의 — model, model_reasoning_effort, sandbox_mode, mcp_servers, skills.config를 세션 설정과 다르게 줄 수 있습니다.
  • 전역 설정 — config.toml의 [agents]에서 agents.enabled(기본 true), agents.max_concurrent_threads_per_session, agents.default_subagent_model, agents.default_subagent_reasoning_effort를 정합니다. 호출 시 명시한 값이 이 기본값보다 우선합니다.
  • 권한 상속 — 서브에이전트는 부모의 샌드박스 정책과 권한 모드를 그대로 물려받습니다. 서브에이전트라고 더 넓게 접근하지 않습니다.
  • 빌트인 에이전트 — default · worker · explorer가 기본 제공되며, 같은 이름의 커스텀 에이전트를 만들면 그쪽이 우선합니다. CLI에서는 /agent로 활성 스레드 사이를 오갑니다.
비용 주의. 서브에이전트를 쓰는 흐름은 같은 일을 단일 에이전트로 돌릴 때보다 토큰을 더 씁니다. 에이전트마다 자기 몫의 모델 호출과 도구 실행을 하기 때문입니다. 나눌 만한 작업인지 먼저 판단하세요.

프롬프트를 덜어내야 하는 이유

GPT-5.6은 의도 파악이 좋아져서 단계를 일일이 지시할 필요가 줄었습니다. 공식 가이드는 예전 모델용으로 쌓아 둔 장황한 프롬프트를 그대로 가져오지 말라고 권합니다. 내부 테스트에서 프롬프트를 가볍게 만든 구성이 평가 점수는 10~15% 오르고 총 토큰은 41~66% 줄었습니다.

  • 같은 지시를 한 번만 적습니다. 반복 강조가 오히려 노이즈가 됩니다.
  • 필요한 도구만 노출하고 설명을 짧게 줄입니다.
  • 자율성의 경계를 명시합니다. 어디까지 알아서 하고 어디서 멈춰 물을지.
  • 반복된 예시를 걷어냅니다. 같은 패턴의 예시를 여러 개 두는 것은 효과가 적습니다.
  • "짧게 답해" 같은 지시는 다시 검토하세요. 5.6은 기본 응답이 이미 간결해 불필요한 경우가 많습니다.

프롬프트 구조를 어떻게 짜는지는 11. GPT-5.5 프롬프트 작성법의 outcome-first 원칙이 5.6에서도 그대로 유효합니다. 그 위에서 이 페이지의 "덜어내기"를 적용하면 됩니다.

5.6에서 새로 생긴 API 파라미터

파라미터값무엇을 바꾸나
reasoning.mode "pro" 최종 답 하나를 내기 전에 모델이 더 많이 일합니다. 어려운 작업의 신뢰도가 오르는 대신 지연과 토큰이 늘어납니다.
reasoning.context auto · all_turns · current_turn 턴 사이에 추론을 이어 쓸지. 5.6은 all_turns가 기본이고 이전 모델은 current_turn이 기본입니다.
text.verbosity low · medium · high 기본 상세도를 정합니다. 프롬프트로 매번 길이를 지시하는 대신 여기서 잡습니다.
prompt_cache_options.mode "explicit" 캐싱을 명시적으로 제어합니다.
programmatic_tool_calling allowed_callers 모델이 자바스크립트를 써서 도구를 호출하고 중간 결과를 가공합니다.
reasoning.mode: "pro"는 언제. 품질이 지연·토큰보다 중요할 때입니다. 복잡한 최적화, 값이 큰 코드 리뷰, 깊은 분석처럼 조금 나아진 결과가 결과 전체를 크게 바꾸는 작업이 대상입니다. 일상 작업에 기본으로 켜 둘 스위치는 아닙니다.
Programmatic Tool Calling(PTC)이 맞는 작업. 모델이 호스팅 런타임에서 자바스크립트를 작성해 도구를 부르고, 호출 사이로 결과를 넘기며 중간 출력을 가공합니다. allowed_callers로 대상 도구를 열어 줍니다. 필터링·조인·랭킹·중복 제거·집계처럼 경계가 뚜렷한 흐름에 잘 맞고, 단계 사이마다 모델의 판단이 필요한 작업에는 맞지 않습니다.
캐시 비용 계산. 캐시 쓰기는 캐시를 안 쓸 때의 입력 단가의 1.25배이고 캐시 읽기는 할인됩니다. 그래서 캐시를 켜면 무조건 싸지는 것이 아니라, 같은 프롬프트를 몇 번 재사용하느냐에 따라 순비용이 갈립니다. cached_tokens와 cache_write_tokens를 같이 보면서 판단하세요.

지원 종료 일정과 옮길 모델

설정 파일·워크스페이스 기본값·자동화 스크립트에 모델 이름을 적어 두었다면 아래 표대로 바꿔야 합니다. 종료일이 지나면 그 이름으로는 실행되지 않습니다.

모델지원 종료옮길 모델
GPT-5.52026-10-14 (ChatGPT · Work · Codex)gpt-5.6-sol
GPT-5.42026-08-31 (종료됨)gpt-5.6-terra
GPT-5.4 mini2026-08-31 (종료됨)gpt-5.6-luna
gpt-5.2 · gpt-5.3-codexChatGPT 로그인 기준 이미 종료GPT-5.6 계열

Fast mode — 크레딧을 더 쓰고 빠르게

Fast mode는 모델을 바꾸지 않고 같은 모델의 응답 속도만 올립니다. 대신 크레딧을 더 씁니다.

모델속도크레딧
GPT-6 Astra—표준의 2.5배 (사용 가능한 경우)
GPT-5.6 · GPT-5.51.5배표준의 2.5배
GPT-5.41.5배표준의 2배
  • CLI — /fast on · /fast off · /fast status
  • config.toml — service_tier = "fast"와 [features] 아래 fast_mode = true
  • 쓸 수 있는 곳 — 데스크톱 앱, CLI, IDE 확장 (ChatGPT로 로그인한 경우). Amazon Bedrock 경유에서는 쓸 수 없습니다.
📌 Codex-Spark와 다른 점: GPT-5.3-Codex-Spark는 속도 옵션이 아니라 별도 모델이고, 사용 한도도 따로 계산됩니다. research preview 기간에는 ChatGPT Pro에서만 쓸 수 있습니다.

출처: Speed

모델 바꾸는 법

  • 앱 · IDE — Composer의 모델 선택기에서 바꿉니다.
  • CLI 대화형 — codex --model gpt-5.6
  • CLI 비대화형 — codex exec -m gpt-5.6
  • 기본값 고정 — ~/.codex/config.toml의 model과 model_reasoning_effort. 자세히는 7. Settings.

그 밖에 달라진 것

  • 토큰 효율이 좋아졌습니다. 같은 작업을 더 적은 토큰으로 끝냅니다.
  • 프론트엔드 결과물의 시각적 완성도가 개선됐습니다. 레이아웃과 시각적 위계를 포함합니다.
  • 이미지 원본 비율 보존 — 입력한 이미지의 원래 치수를 유지합니다.

함께 보면 좋은 문서

장점 / 주의점

✅ 좋아진 점
같은 작업을 더 적은 토큰으로 끝냅니다. Terra 20%·Luna 80% 인하로 자동화 비용 계산이 달라집니다. Ultra로 큰 작업을 나눠 돌릴 수 있습니다.
⚠ 주의할 점
8월 31일 이후 GPT-5.4를 참조하는 설정은 깨집니다. 서브에이전트는 토큰을 더 씁니다. 캐시는 쓰기 1.25배라 재사용이 적으면 손해입니다.
🔄 옮길 때
추론 강도는 지금 값을 기준선으로 두고 한 단계 낮춰 먼저 시험하세요. 프롬프트의 간결성 지시와 반복 예시부터 걷어냅니다.

공식 출처