프롬프트를 길게 다듬느라 시간을 쓰는 사람은 Claude Fable 5 앞에서 성능만 깎는다. Anthropic이 Claude Code(클로드 코드)의 시스템 프롬프트를 80% 잘라냈기 때문이다. 시스템 프롬프트는 모델에 미리 심어 두는 기본 지시문이다. 프롬프트를 더 많이, 더 자세히 쓰라던 그동안의 조언과 정반대다.
이유는 하나다. 이 모델은 지시를 늘어놓을수록 오히려 나빠진다. Anthropic의 Tariq Shihipar는 이를 “이 새 클래스의 모델은 더 작은 시스템 프롬프트를 원한다”는 한 문장으로 요약했다. 그래서 이제는 컨텍스트, 곧 모델이 읽는 정보 전체의 설계가 프롬프트 한 줄보다 결과를 더 크게 가른다. 또 Fable 5는 오래 스스로 굴러가는 작업에서만 값을 한다.
30초 요약
- 뺀 일: 행동을 수십 줄로 열거하는 지시문. 대신 짧은 맥락과 effort 다이얼로 조종한다. effort는 지능·지연·비용을 함께 조절하는 설정이다.
- 남긴 일: 며칠짜리 자율 작업에만 Fable 5를 쓰고 나머지는 Sonnet이나 Opus로 돌린다. 모델의 완료 보고를 도구 실행 결과와 대조하는 일도 남긴다.
- 되찾은 시간: 미측정. 참고로 Stripe는 5천만 라인 Ruby 마이그레이션을 하루 만에 끝냈다고 인용된다. 수작업 추정은 두 달 이상이었다. 이는 Anthropic 자사 발표다.
- 든 비용: 2026년 7월 기준 토큰당 입력 $10/M, 출력 $50/M로 Opus 4.8의 2배다. 항상 켜진 사고 비용도 붙는다. 그래서 작업별로 모델을 나누는 라우팅 없이 기본값으로 깔면 비용이 샌다.
Claude Fable 5 모델은 며칠짜리 자율 작업에 맞춰져 있다
Claude Fable 5는 오래 스스로 실행하는 자율 에이전트를 위한 Anthropic의 최상위 모델이다. 에이전트는 사람이 옆에 붙어 있지 않아도 여러 단계를 스스로 밀고 나가는 AI다. 2026년 6월 9일 출시됐다.
컨텍스트 윈도우는 100만 토큰이다. 컨텍스트 윈도우는 모델이 한 번에 읽는 정보의 총량이다. 최대 출력은 12만 8천 토큰이다. 항상 켜져 있는 적응형 사고(always-on adaptive thinking)도 갖췄다. 적응형 사고는 모델이 답하기 전에 먼저 생각하는 단계다. 그래서 코드베이스 전체와 규칙, 문서를 컨텍스트 윈도우 하나에 넣어 두고 긴 작업을 맡기는 데 맞는다.
자주 헷갈리는 점이 두 가지 있다. 첫째, Fable 5는 “가장 똑똑한 하나”라는 뜻의 플래그십(라인업의 대표 모델)이 아니다. Anthropic 라인업은 이제 대표 모델 하나가 아니라 워크로드(작업 종류)별 메뉴에 가깝다. Sonnet이 대부분의 실무를 맡는 기본값이다. Opus는 정확성이 중요한 단발 작업을 맡는다. Fable 5는 장기 자율 작업 전용 프리미엄 옵션이다.
둘째, 적응형 사고는 끌 수 없다. 단순한 질문 하나에도 사고가 돌아간다. 그래서 단순한 작업에도 비용이 붙는다.
Fable 5는 지속력으로 값을 하는 모델이다. 벤치마크 점수 몇 점보다, 사람이 며칠 붙어야 할 작업을 혼자 끝까지 끌고 가는 능력이 쓸모다.
| 스펙 | 값 | 체감되는 의미 |
|---|---|---|
| 컨텍스트 | 100만 토큰 | 코드베이스·규칙·문서를 한 프롬프트에 동시에 담는다 |
| 최대 출력 | 12만 8천 토큰 | 대규모 산출물을 한 번에 뽑는다 |
| 사고 (thinking) | 항상 ON (끌 수 없음) | 단순 질의에도 사고 비용이 붙는다 |
| 가격 | 입력 $10/M · 출력 $50/M (M은 백만 토큰) | Opus 4.8의 2배 수준 |
| 데이터 보존 | 30일 필수 (ZDR 불가) | 규제 민감 산업엔 도입 장벽 |
Claude Fable 5 프롬프트는 어떻게 짜나?
프롬프트를 줄이고 컨텍스트를 설계하는 것이 첫 번째 규칙이다. Anthropic은 Fable 5용 공식 가이드에서 짧은 맥락 기반 지시를 권한다. 지시를 일일이 열거하지 말라는 뜻이다. Claude Code의 시스템 프롬프트를 80% 줄인 것도 이 규범을 자사 제품에 먼저 적용한 사례다.
질문 한 줄에서 컨텍스트 설계로 넘어간다
프롬프팅이라는 말 자체가 바뀌고 있다. 예전에는 질문 한 줄을 잘 쓰는 일이 프롬프트 엔지니어링이었다. 그런데 지금은 컨텍스트에 무엇을 넣고 뺄지 설계하는 일에 무게가 실린다. 이것이 컨텍스트 엔지니어링(Context Engineering)이다. 모델이 읽는 정보 환경 전체를 설계하는 기술이다. Android가 처음 나왔을 때 개별 앱을 짜던 일에서 플랫폼 전체를 설계하는 일로 넘어간 것과 비슷하다.
arXiv 연구는 이를 독립 분과로 정식화하면서 다섯 기준을 제시했다. 관련성, 충분성, 격리, 경제성, 출처다. 영어로는 relevance·sufficiency·isolation·economy·provenance다. 100만 토큰짜리 컨텍스트 윈도우도 무관한 내용으로 채우면 성능이 측정 가능하게 나빠진다.
effort 다이얼로 조종한다
effort는 지능·지연·비용을 함께 조절하는 Fable 5의 주 제어축이다. 기본값은 high다. 공식 문서는 “effort 튜닝이 모델을 바꾸는 것보다 나은 레버인 경우가 많다”고 밝힌다. 그래서 결과가 마음에 들지 않으면 더 비싼 모델로 갈아타기 전에 effort부터 올린다. 반대로 병렬로 돌리는 하위 작업(subagent)은 low로 낮추도록 권장한다.
audit 지시로 상태 조작을 막는다
오래 굴러가는 에이전트에게는 하지 않은 일을 했다고 보고하는 문제가 있다. 이를 fabricated status report(꾸며낸 상태 보고)라고 부른다. 공식 가이드는 진행 주장을 도구(tool) 실행 결과와 대조하는 audit 지시를 넣으라고 권한다. 이 지시 한 줄이 허위 상태 보고를 거의 없앤다.
지시 대신 스캐폴딩을 깐다
행동을 하나하나 명령하는 대신 구조물을 깐다. 스캐폴딩은 작업이 기댈 뼈대라는 뜻이다. 메모리는 Markdown 파일 하나에 교훈 하나를 적는 식이다. 여기에 명시적 체크포인트를 더한다.
반면 step-by-step으로 손잡고 가던 방식은 loop specification으로 대체되고 있다. loop specification은 재사용 가능한 자율 실행 규격이다. 트리거·목표·검증·중지 규칙·메모리로 구성한다.
audit와 메모리, 체크포인트는 Claude Code에 말로 시키면 된다. 예시는 이렇다.
이 작업은 며칠 걸린다. 지시는 한 줄만 줄 테니 목표만 보고 진행해줘.
끝났다고 보고하기 전에 각 주장을 실제 도구 실행 결과와 대조하고, 어긋나면 미완료로 적어줘.
배운 점은 메모리 파일에 하나씩 적고, 단계마다 체크포인트를 남겨줘.
| 이렇게 한다 | 이건 피한다 |
|---|---|
| 짧은 맥락 한 줄로 방향만 잡는다 | 행동을 수십 줄로 열거한다 |
| effort를 high로 시작해 워크로드별 조정 | 결과 안 좋다고 곧장 상위 모델로 교체 |
| 진행 주장을 도구 결과와 대조하는 audit | 완료 보고를 그대로 신뢰 |
| 메모리·체크포인트 같은 구조를 깐다 | step-by-step으로 일일이 손잡고 간다 |
예전에 써 둔 긴 프롬프트는 짐이 된다
예전 모델용으로 정성껏 써 둔 긴 프롬프트나 스킬 파일은 이제 짐이 될 수 있다. 그래서 Fable 5로 넘어가기 전에 CLAUDE.md와 스킬을 자기감사한다. 자기감사는 스스로 점검하는 일이다. 지나치게 세세한 지시는 걷어낸다. CLAUDE.md를 짧게 유지하는 방법은 Claude Code 제대로 쓰는 법, 세 가지 습관에 적었다.
Claude Fable 5 모델은 언제 쓰고 언제 넘기나?
며칠에 걸쳐 스스로 이어지는 장기 자율 작업에 주로 쓴다. 그 밖의 실무는 대부분 Sonnet이나 Opus로 충분하다. 도입 판단은 하나로 모인다. 우리 작업이 2배 값을 회수하는가.
Claude Fable 5 리드는 일이 길수록 벌어진다
작업이 길고 복잡할수록 Fable 5의 리드가 벌어진다. SWE-Bench Pro는 실제 소프트웨어 엔지니어링 과제 벤치마크다. Anthropic 자사 발표 기준으로 Fable 5는 여기서 80.3%를 받았다. Opus 4.8의 69.2%를 11점 앞선다. 다만 이 수치는 자사 발표이고 독립 검증 전이다.

대표 사례가 Stripe다. Stripe는 5천만 라인짜리 Ruby 코드베이스 마이그레이션을 하루 만에 끝냈다고 인용된다. 마이그레이션은 옛 시스템을 새 환경으로 옮기는 일이다. 수작업 추정치는 두 달 이상이었다. 사람이 며칠 붙어야 할 다단계 작업이라서 Fable 5가 값을 하는 지점이다. 다만 이 사례도 Anthropic 자사 발표 기반이고 마이그레이션 유형은 공개되지 않았다.

단순 작업은 Sonnet을 먼저 태운다
반대로 단순 질의, 응답이 빨라야 하는 저지연 작업, 고볼륨 처리에는 Fable 5가 과잉이다. 이럴 때는 스마트 라우팅을 쓴다. 라우팅은 작업마다 맞는 모델로 보내는 일이다. Sonnet을 먼저 태우고 실패할 때만 Fable 5로 올린다. 이를 에스컬레이션이라 한다. 이렇게 하면 비용이 60% 이상 준다.
| 차원 | Sonnet 4.6 | Opus 4.8 | Fable 5 |
|---|---|---|---|
| 가격 (입력/출력 per M) | $3 / $15 | $5 / $25 | $10 / $50 |
| 주 워크로드 | 프로덕션 기본값 | 단발 정확성 작업 | 다단계 장기 자율 |
| 월비용 (100M입력+50M출력) | $1,050 | $1,750 | $3,500 |
| 언제 선택 | 대부분의 실무 | 정확성 우선 단발 | long-horizon 자율만 |
Fable 5는 예외 워크로드를 위한 에스컬레이션 대상이다. 기본값으로 깔면 단순 작업 하나에도 항상 켜진 사고 비용이 계속 붙기 때문이다.
Claude Fable 5 모델의 비용과 리스크는 세 갈래로 청구된다
자율성은 공짜가 아니다. 비용, 통제, 규제 세 갈래로 청구서가 온다.
Claude Fable 5 비용은 두 줄 고치는 데도 붙는다
토큰당 단가는 Opus의 2배다. 그런데 발견(finding) 하나당으로 따지면 1.25배로 좁혀진다는 독립 측정이 있다. Fable 5가 감사 한 번에 더 많은 이슈를 잡아내기 때문이다. 그래도 항상 켜진 사고 탓에 단순 작업에도 과금이 붙는다. Simon Willison은 두 줄짜리 CSS 버그 하나를 잡는 데 약 $12를 태운 사례를 관찰했다. 두 줄 고치는 데 만 원 넘게 쓴 셈이다.
통제는 시키지 않은 일에서 무너진다
Fable 5는 시키지 않아도 테스트를 짜고 서버를 띄우고 자동화를 구성할 만큼 능동적이다. 이 자율성이 프롬프트 인젝션(악의적 입력으로 AI를 조종하는 공격)에 뚫리면 데이터 유출로 이어질 수 있다. 그래서 코딩 에이전트는 샌드박싱(격리된 환경에서 실행하는 방식)이 사실상 필수다.
Claude Fable 5 규제는 30일 보존에서 걸린다
Fable 5는 30일 데이터 보존이 필수다. 무보존(ZDR, Zero Data Retention) 옵션은 없다. 규제 민감 데이터를 다루는 곳에서는 이 점이 걸림돌이 된다.
주의: 조용한 전환이 가장 큰 함정이다
effort 옵션을 잘못 입력하면 저장된 기본값으로 조용히 되돌아간다. 리소스 한계에서는 자동으로 하위 모델로 강등된다. 거부 응답조차 HTTP 200으로 돌아온다. 셋 다 사용자가 알아채기 어렵다. 벤더는 이를 안전장치라 부른다. 실사용자는 통제 상실이라 느낀다. 관측성(observability, 지금 무슨 일이 일어나는지 볼 수 있는 상태)을 프롬프트 설계와 같은 우선순위로 챙긴다.
막히는 지점마다 규칙을 붙인다
앞에서 본 비용·통제·규제 문제는 막히는 지점마다 붙일 규칙이 있다. 표는 이 글에서 다룬 규칙을 짝지어 정리했다.
| 막히는 지점 | 그래서 붙일 규칙 |
|---|---|
| 오래 도는 에이전트가 하지 않은 일을 했다고 보고한다 | 진행 주장을 도구 실행 결과와 대조하는 audit 지시를 넣는다 |
| 단순 작업에도 항상 켜진 사고 비용이 붙는다. 두 줄짜리 CSS 버그에 약 $12가 들었다 | Sonnet을 먼저 쓰고 실패할 때만 Fable 5로 올리는 라우팅을 깐다. 병렬 하위 작업은 effort를 low로 둔다 |
| effort 오입력, 자동 강등, HTTP 200 거부 응답이 조용히 지나간다 | 관측성을 프롬프트 설계와 같은 우선순위로 챙기고 비용 대시보드를 둔다 |
| 시키지 않은 일까지 하는 능동성이 프롬프트 인젝션에 뚫리면 데이터가 샌다 | 코딩 에이전트는 샌드박스에서 돌린다 |
| 30일 보존이 필수여서 규제 민감 데이터를 맡기기 어렵다 | 그 데이터는 Fable 5에서 빼고 Sonnet이나 온프레미스 대안을 먼저 검토한다 |
| 에이전트 파일럿의 89%가 프로덕션에서 실패한다 | 평가셋과 통제 정책을 배포 전에 먼저 만든다 |
표 마지막 줄의 89%는 Gartner 분석(2차 재인용)에서 나온 수치다. 살아남은 11%만 171% ROI를 낸다. 열에 아홉이 죽는다는 뜻이다. 그러니 성공은 어떤 모델을 골랐느냐보다 그 모델을 어떻게 운영하고 통제하느냐에서 갈린다.
Claude Fable 5 도입 체크리스트
Fable 5를 쓰기로 했다면 다음 순서로 준비한다. 모델부터 고르지 않고 그 모델을 다룰 체계를 먼저 세우는 편이 실패 확률을 줄이기 때문이다. 순서는 ① 평가셋 구축, ② 지식 레이어 감사, ③ 통제 정책, ④ 스마트 라우팅이다. 지식 레이어는 CLAUDE.md와 스킬처럼 모델에 미리 주는 지식 묶음이다.
| 단계 | 할 일 | 상태 |
|---|---|---|
| ① 평가셋 | 며칠짜리 장기 자율 후보 2~3개만 골라 자체 평가셋을 만든다. 벤치마크 수치는 자체 재현으로 확인한다 | 먼저 |
| ② 지식 레이어 감사 | CLAUDE.md·스킬을 자기감사하고 지나치게 세세한 지시를 걷어낸다 | 먼저 |
| ③ 통제 정책 | 세션당 토큰 상한·샌드박스·audit 지시·비용 대시보드를 배포 전 조건으로 건다 | 필수 |
| ④ 라우팅 | Sonnet 우선, 실패 시에만 Fable 5로 에스컬레이션하는 라우팅을 깐다 | 비용 절감 |
규제 민감 데이터를 다룬다면 하나를 더 얹는다. 30일 보존이 걸리는 데이터는 Fable 5에서 빼고 Sonnet이나 온프레미스 대안을 먼저 검토한다.
마무리하며
짧은 맥락, 며칠짜리 작업, 사전 통제는 모두 한 방향을 가리킨다. 도구가 강해질수록 도구를 감싼 운영 체계가 성패를 가른다. 에이전트 파일럿의 89%가 프로덕션에서 죽는 이유를 이 글은 모델 탓으로 읽지 않는다. 평가셋과 통제 없이 뛰어든 탓으로 읽는다.
Fable 5는 사람이 며칠 붙어야 할 작업을 혼자 끌고 간다. 그렇게 되찾은 시간은 다음 일감의 평가셋과 통제선을 만드는 데 쓴다. 그래서 도구를 사기 전에 도구를 다룰 체계를 먼저 세운다.
참고 자료
- Prompting Claude Fable 5. Anthropic 공식, 2026-06-09
- Introducing Claude Fable 5 and Mythos 5. Anthropic, 2026-06-09
- Effort. Claude Platform Docs, Anthropic, 2026
- Choosing the right model. Anthropic, 2026
- Claude Fable 5 and Mythos 5 출시 발표. Anthropic, 2026-06-09
- Anthropic cut 80% of Claude Code’s system prompt. The Decoder, 2026-07-02
- Claude Fable 5 for PMs. Product Compass, 2026-06-11
- Context Engineering. arXiv, 2026-03-10
- Stop Hand-Holding Your Coding Agent. arXiv, 2026
- Fable 5 vs Opus 4.8 vs Sonnet. SecondTalent, 2026
- Fable 5 vs Opus vs GPT-5.5 benchmark. RDWorld, 2026
- Inside Stripe’s 50M-Line Ruby Migration. Espressio, 2026
- Agentic AI Adoption Stats 2026. OneReach, Gartner/McKinsey 재인용, 2026
- Claude Fable is relentlessly proactive. Simon Willison, 2026-06-11
함께 읽으면 좋은 글
