최근 수정 시각 : 2026-08-02 11:02:13

Claude/API


#!if top = 문서명1 != null ? 문서명1 : calleeTitle != null ? (i = calleeTitle.lastIndexOf("/")) != -1 ? calleeTitle.substr(0, i) : '상위 문서' : '상위 문서'
[[파일:상위 문서 아이콘.svg|align=left&width=21.6px]] {{{#!html  }}} 상위 문서: [[]]


1. 개요2. 지원 모델
2.1. Haiku2.2. Sonnet2.3. Opus2.4. Mythos/Fable
3. 토큰 계산하기4. 모델별 기능

1. 개요

Claude의 여러 API 모델.

2. 지원 모델

2.1. Haiku

지금은 Claude 4.5 Haiku를 공식적으로 지원하고 있고, Claude 3.5 Haiku는 Bedrock이나 Google cloud에서만 이용할 수 있다.
API 가격은 다음과 같다.
모델 입력[기준] 출력[기준] 5분 캐시 쓰기[3] 1시간 캐시 쓰기 캐시 읽기
Haiku 3.5 0.8$ 4$ 1$ 1.6$ 0.08$
Haiku 4.5 1$ 5$ 1.25$ 2$ 0.1$

2.2. Sonnet

지금은 Claude Sonnet 5, 4.6, 4.5를 지원하고 있다. 여기서 지금 Sonnet 5는 현재 입력 2$, 출력 10$이지만 2026년 8월 31일이 지나면 원래 가격인 입력 3$, 출력 15$로 인상된다. Sonnet 4는 Bedrock이나 Google cloud에서만 사용할 수 있다.
모델 입력[기준] 출력[기준] 5분 캐시 쓰기 1시간 캐시 쓰기 캐시 읽기
Sonnet 5 2$ 10$ 2.5$ 4$ 0.2$
Sonnet 4.6 3$ 15$ 3.75$ 6$ 0.3$
Sonnet 4.5 3$ 15$ 3.75$ 6$ 0.3$
Sonnet 4 3$ 15$ 3.75$ 6$ 0.3$

2.3. Opus

지금은 Opus 5, 4.8, 4.7, 4.6, 4.5를 지원하고, Opus 4는 Google cloud에서만 사용할 수 있다. 여기서 Opus 4.5 이전에는 API 가격이 3배로 폭등하니 조심하도록 하자. Opus 4.1은 Google cloud에서만 사용할 수 있다.

추론을 켜게되면 추론 단계를 설정할 수 있었는데 원래는 추론을 끌 수 있었지만 Opus 5부터는 추론을 끌 수 없게 되었다. 추론을 한 만큼 출력 비용으로 추가로 나가게 되므로 조심하도록 하자.
모델 입력[기준] 출력[기준] 5분 캐시 쓰기 1시간 캐시 쓰기 캐시 읽기
Opus 5 5$ 25$ 6.25$ 10$ 0.5$
Opus 4.8 5$ 25$ 6.25$ 10$ 0.5$
Opus 4.7 5$ 25$ 6.25$ 10$ 0.5$
Opus 4.6 5$ 25$ 6.25$ 10$ 0.5$
Opus 4.5 5$ 25$ 6.25$ 10$ 0.5$
Opus 4.1 15$ 75$ 18.75$ 30$ 1.5$
Opus 4 15$ 75$ 18.75$ 30$ 1.5$

2.4. Mythos/Fable

Mythos 5모델은 일반 사용자가 사용할 수 없고, 승인된 기업이나 정부만 사용 가능 하다. 그래서 일반 유저가 사용할 수 있는 모델은 Fable 5모델 뿐인데, 사용하면서 30일동안 Anthropic에 기록과 정보가 남게 된다. 남지 않게 할 수 없다.
모델 입력[기준] 출력[기준] 5분 캐시 쓰기 1시간 캐시 쓰기 캐시 읽기
Fable 5 10$ 50$ 12.5$ 20$ 1$
Mythos 5 10$ 50$ 12.5$ 20$ 1$

여기서 각 모델별로 Batch를 할 수가 있는데 배치를 하면 모든 가격이 절반이 되는 대신, 즉각적으로 답변이 나오지 않고, 24시간 이내의 시간에 출력되게 된다.

3. 토큰 계산하기

토큰을 계산하는 방법은 각 회사마다 다르다.
여기서 Claude에서는
Python SDK:
#!syntax python
from anthropic import Anthropic

client = Anthropic()

result = client.messages.count_tokens(
    model="claude-sonnet-4-5",
    messages=[
        {
            "role": "user",
            "content": "이 문장은 토큰이 몇 개야?"
        }
    ],
)

print(result.input_tokens)


TypeScript SDK:
#!syntax typescript
import Anthropic from "@anthropic-ai/sdk";

const client = new Anthropic();

const result = await client.messages.countTokens({
  model: "claude-sonnet-4-5",
  messages: [
    {
      role: "user",
      content: "이 문장은 토큰이 몇 개야?",
    },
  ],
});

console.log(result.input_tokens);


이런 방법들이 있다. 여기서 이 방법들은 실제로 대화를 처리하진 않고, 토큰 수만 계산해서 출력해준다.

4. 모델별 기능

구분 Fable 5 Opus 4.8 Sonnet 5 Haiku 4.5
확장 사고 아니요 아니요 아니요
적응형 사고 예(항상 활성화) 아니요
상대적 지연 시간 느림 보통 빠름 가장 빠름
컨텍스트 윈도우 100만 토큰 100만 토큰 100만 토큰 20만 토큰
최대 출력 12만 8천 토큰 12만 8천 토큰 12만 8천 토큰 6만 4천 토큰
지식 컷오프(신뢰 가능한 지식 단절일) 2026년 1월 2026년 1월 2026년 1월 2025년 2월
학습 데이터 기준일 2026년 1월 2026년 1월 2026년 1월 2025년 7월

[기준] 백만 토큰 당[기준] [3] 프롬포트 캐싱을 할때 사용하는 것이다. 여기서 만약 5분 캐시 쓰기를 하고 나서 똑같은 입력이 5분 이내에 들어오면 약 90%의 API 가격 할인을 해준다.[기준] [기준] [기준] [기준] [기준] [기준]