7 min read

GPT-5.6 Sol·Terra·Luna 선택 가이드: API 가격, 컨텍스트, 마이그레이션

GPT-5.6 세 모델의 차이와 API 가격, 105만 토큰 컨텍스트, 추론 강도, 캐싱 비용을 비교하고 실제 서비스에서 모델을 고르는 기준을 정리합니다.

GPT-5.6을 도입할 때 가장 중요한 결정은 “가장 강한 Sol을 쓸까”가 아닙니다. 기본 워크로드는 Terra로 시작하고, 객관적인 평가에서 품질이 부족한 작업만 Sol로 올리며, 반복량이 큰 단순 작업은 Luna로 내리는 방식이 비용과 품질을 함께 관리하기 좋습니다.

OpenAI는 2026년 7월 9일 GPT-5.6을 정식 출시하면서 하나의 모델이 아니라 Sol, Terra, Luna 세 계층을 함께 공개했습니다. 이름이 많아졌지만 역할은 비교적 명확합니다.

  • Sol: 복잡한 코딩, 전문 지식 업무, 장시간 에이전트 작업
  • Terra: 품질과 비용의 균형이 필요한 일반적인 제품 기능
  • Luna: 분류, 추출, 변환처럼 호출량이 많은 정형 작업

이 글에서는 출시 발표를 다시 요약하기보다, API를 사용하는 개발자가 실제로 결정해야 할 모델 선택, 비용 계산, 마이그레이션 순서를 중심으로 정리합니다.

GPT-5.6에서 달라진 핵심

GPT-5.6 제품군은 세 모델 모두 105만 토큰 컨텍스트와 최대 12만 8천 토큰 출력을 지원합니다. 공식 모델 문서 기준 지식 컷오프는 2026년 2월 16일이며, 텍스트와 이미지 입력, 함수 호출, 구조화 출력, 웹 검색, 파일 검색, 코드 실행, MCP와 컴퓨터 사용 도구를 지원합니다.

모델API 모델 ID입력 / 100만 토큰캐시 입력출력 / 100만 토큰권장 용도
GPT-5.6 Solgpt-5.6-sol$5.00$0.50$30.00복잡한 코딩, 고난도 분석, 장시간 에이전트
GPT-5.6 Terragpt-5.6-terra$2.50$0.25$15.00일반 제품 기능, 균형형 에이전트, 문서 작업
GPT-5.6 Lunagpt-5.6-luna$1.00$0.10$6.00대량 분류, 추출, 요약, 라우팅

gpt-5.6 별칭은 현재 Sol을 가리킵니다. 빠르게 최신 Sol로 따라가려면 별칭을 사용할 수 있고, 모델 선택을 코드에서 명확히 관리하려면 gpt-5.6-sol처럼 계층을 드러내는 ID가 낫습니다.

세 모델은 none, low, medium, high, xhigh, max 추론 강도를 지원합니다. 같은 모델이라도 추론 강도가 높아지면 더 어려운 문제를 처리할 여지가 생기지만, 지연 시간과 출력 비용도 함께 확인해야 합니다.

어떤 모델부터 시작해야 하나

대부분의 신규 기능은 Terra

새 기능의 기본값으로는 Terra가 가장 합리적입니다.

OpenAI는 Terra를 지능과 비용의 균형을 위한 모델로 설명합니다. Sol의 절반 가격이며, 긴 컨텍스트와 동일한 도구 범위를 지원합니다. 고객 문의 답변, 문서 분석, 코드 리뷰 보조, 검색 기반 리서치, 내부 업무 에이전트처럼 품질이 중요하지만 모든 요청이 최고 난도는 아닌 경우 Terra부터 평가하는 편이 좋습니다.

다음 조건이면 Terra로 시작할 수 있습니다.

  • 정답 기준이나 리뷰 체크리스트를 만들 수 있다.
  • 대부분 요청은 중간 난도이고 일부만 매우 어렵다.
  • 함수 호출과 파일 검색을 사용하지만 깊은 장기 계획은 매번 필요하지 않다.
  • 품질을 유지하면서 GPT-5.5 대비 비용을 줄이고 싶다.

Sol은 실패 비용이 큰 작업

Sol은 단순히 “더 좋은 답변”이 필요한 경우보다, 작업 실패가 비싼 경우에 적합합니다.

  • 여러 저장소를 분석하고 실제 수정까지 수행하는 코딩 에이전트
  • 긴 문서와 도구 결과를 연결해야 하는 조사
  • 복잡한 설계 검토와 보안 분석
  • 여러 단계에서 계획을 수정해야 하는 전문 지식 업무
  • Terra가 내부 평가에서 반복적으로 실패하는 핵심 작업

중요한 점은 Sol을 먼저 선택하고 비용을 감수하는 것이 아니라, Terra의 실패 사례를 모은 뒤 그 사례에서 Sol이 실제로 개선되는지 확인하는 것입니다. 벤치마크보다 자신의 데이터가 모델 선택에 더 직접적인 기준이 됩니다.

Luna는 작고 반복적인 작업

Luna는 단순 챗봇용 저가 모델로만 볼 필요가 없습니다. 큰 시스템 안에서 호출량이 많은 하위 작업에 배치하면 효과가 큽니다.

  • 이메일과 문서 분류
  • JSON 필드 추출
  • 언어 감지와 요청 라우팅
  • 짧은 요약과 제목 생성
  • 정해진 스키마로의 변환
  • 상위 모델에 넘기기 전 입력 정리

고난도 작업 전체를 Luna에 맡기기보다, Luna가 입력을 분류하고 필요한 요청만 Terra나 Sol로 보내는 계층형 구조가 실용적입니다.

Responses API로 시작하기

공식 JavaScript SDK에서는 모델 ID만 바꿔 같은 Responses API 형태로 호출할 수 있습니다.

import OpenAI from "openai";

const client = new OpenAI();

const response = await client.responses.create({
  model: "gpt-5.6-terra",
  reasoning: { effort: "medium" },
  input: `다음 TypeScript 코드의 오류 가능성을 찾고,
수정안과 검증용 테스트를 함께 작성해 주세요.`,
});

console.log(response.output_text);

모델 선택을 호출부마다 직접 쓰기보다 한 곳에서 관리하면 실험과 전환이 쉬워집니다.

type Workload = "high-stakes" | "balanced" | "high-volume";

function selectModel(workload: Workload): string {
  switch (workload) {
    case "high-stakes":
      return "gpt-5.6-sol";
    case "high-volume":
      return "gpt-5.6-luna";
    default:
      return "gpt-5.6-terra";
  }
}

const response = await client.responses.create({
  model: selectModel("balanced"),
  reasoning: { effort: "medium" },
  input: "이 변경 사항을 코드 리뷰 체크리스트에 따라 검토해 주세요.",
});

실서비스에서는 모델 이름뿐 아니라 추론 강도, 최대 출력, 도구 사용 여부를 워크로드 설정으로 묶는 편이 좋습니다.

const modelProfiles = {
  review: {
    model: "gpt-5.6-terra",
    effort: "medium" as const,
  },
  architecture: {
    model: "gpt-5.6-sol",
    effort: "high" as const,
  },
  classify: {
    model: "gpt-5.6-luna",
    effort: "low" as const,
  },
};

가격표보다 실제 요청 비용을 계산해야 한다

100만 토큰 가격만 비교하면 체감 비용을 놓치기 쉽습니다. 예를 들어 캐시되지 않은 입력 10만 토큰과 출력 1만 토큰을 사용하는 요청 한 건의 단순 토큰 비용은 다음과 같습니다.

모델입력 비용출력 비용합계
Sol$0.50$0.30$0.80
Terra$0.25$0.15$0.40
Luna$0.10$0.06$0.16

같은 요청을 반복하며 입력 10만 토큰이 캐시 읽기로 처리된다면 단순 계산상 Sol은 $0.35, Terra는 $0.175, Luna는 $0.07입니다. 다만 첫 캐시 쓰기는 일반 입력 가격의 1.25배로 청구되고, 도구 호출 비용은 별도입니다.

또 하나의 중요한 조건이 있습니다. 입력이 27만 2천 토큰을 넘으면 해당 요청 전체에 입력 2배, 출력 1.5배 요율이 적용됩니다. 컨텍스트 창이 105만 토큰이라고 해서 항상 문서를 전부 넣는 방식이 경제적인 것은 아닙니다.

긴 컨텍스트를 사용할 때는 다음 순서가 안전합니다.

  1. 고정된 시스템 지침과 반복 문서를 앞쪽에 둡니다.
  2. 매 요청마다 바뀌는 시간, 사용자 입력, 도구 결과는 뒤쪽에 둡니다.
  3. 명시적 캐시 중단점을 사용해 재사용 구간을 구분합니다.
  4. 27만 2천 토큰을 넘기는 요청은 검색·요약·분할 처리와 비용을 비교합니다.
  5. 모델 비용뿐 아니라 도구 호출과 실패 재시도 비용까지 기록합니다.

GPT-5.5에서 바로 전체 교체하지 말 것

GPT-5.5를 사용 중이라면 전역 검색·치환으로 gpt-5.6을 적용하기보다 워크로드별로 옮기는 편이 안전합니다.

1. 호출 유형을 나눈다

먼저 현재 요청을 최소 세 그룹으로 분류합니다.

  • 복잡한 추론과 장기 실행
  • 일반적인 생성과 분석
  • 대량 정형 처리

이 구분이 각각 Sol, Terra, Luna의 출발점이 됩니다.

2. 성공 기준을 고정한다

모델 비교 전에 평가 기준을 정합니다.

  • 정답 또는 필수 포함 항목
  • 함수 호출 성공률
  • JSON 스키마 유효성
  • 코드 테스트 통과 여부
  • 평균·상위 95% 지연 시간
  • 요청당 총비용
  • 사람이 수정한 비율

벤더가 공개한 벤치마크는 모델의 방향을 이해하는 자료이지, 자신의 제품에서 발생하는 성공률을 대신하지 않습니다.

3. 같은 입력으로 병렬 평가한다

운영 트래픽의 일부를 복제해 기존 모델과 후보 모델을 비교합니다. 결과를 사용자에게 두 번 보내지 않고 내부 평가 로그에만 저장하는 섀도 테스트가 유용합니다.

4. 단계적으로 라우팅한다

초기에는 Terra를 기본값으로 두고, 다음 조건에서만 Sol로 올릴 수 있습니다.

  • 입력이 복잡한 코드베이스나 다중 문서 작업이다.
  • Terra가 형식 검증 또는 테스트에서 실패했다.
  • 작업의 위험 등급이 높다.
  • 사용자가 최고 품질 모드를 명시적으로 선택했다.

반대로 명확한 스키마 변환이나 분류는 Luna로 내립니다.

ChatGPT에서 보이는 모델과 API 모델은 구분해야 한다

GPT-5.6은 ChatGPT, Codex, OpenAI API에 제공되지만 선택 방식은 제품과 요금제마다 다릅니다.

표준 ChatGPT 대화에서는 유료 요금제의 중간 이상 추론 옵션이 Sol을 사용하며, Terra와 Luna는 주로 ChatGPT Work, Codex, API에서 선택합니다. 계정에 GPT-5.6이 바로 보이지 않는다면 점진적 배포나 워크스페이스 관리자 설정 때문일 수 있습니다.

API에서 사용할 모델을 결정할 때 ChatGPT 모델 선택 화면을 기준으로 삼지 말고, 공식 API 모델 문서의 모델 ID와 지원 기능을 확인해야 합니다.

도입 전 알아둘 제한

  • 세 모델 모두 오디오 입력과 출력은 지원하지 않습니다.
  • 파인튜닝은 현재 지원하지 않습니다.
  • API 무료 티어에서는 GPT-5.6을 지원하지 않습니다.
  • 긴 컨텍스트는 가능하지만 27만 2천 토큰 초과 가격 규칙이 있습니다.
  • 웹 검색, 컴퓨터 사용 같은 도구는 토큰 비용 외 별도 비용이 발생할 수 있습니다.
  • 공개 벤치마크는 설정과 평가 방식에 따라 실제 제품 결과와 다를 수 있습니다.
  • 별칭은 편리하지만 동작 안정성이 중요한 서비스는 모델 변경 기록과 회귀 평가를 별도로 관리해야 합니다.

모델 성능만 올리는 것보다 반복 가능한 작업 규칙을 저장소에 두는 것이 중요합니다. Codex에서 프로젝트별 작업 방식을 재사용하려면 Codex 스킬 설치와 구조를 정리한 글도 함께 참고할 수 있습니다.

결론

GPT-5.6의 실용적인 기본 전략은 간단합니다.

  • Terra로 시작합니다.
  • 평가에서 부족한 고난도 작업만 Sol로 올립니다.
  • 대량의 정형 작업은 Luna로 분리합니다.
  • 모델 ID와 추론 강도를 코드 한 곳에서 관리합니다.
  • 27만 2천 토큰 초과 요율과 캐시 쓰기 비용을 포함해 계산합니다.

GPT-5.6은 하나의 최고 모델을 고르는 문제가 아니라, 세 계층을 어떻게 조합해 성공률과 비용을 관리할 것인지의 문제에 가깝습니다. 모델을 바꾸기 전에 평가 세트를 만들고, 모델을 바꾼 뒤에는 요청당 성공 비용을 비교하는 것이 가장 확실한 도입 방법입니다.

공식 자료