
모델이 새로 나오면 발표 페이지에는 늘 고객 사례가 실립니다. 오퍼스 5.5도 마찬가지입니다. 프롬프트 38개가 11개로 줄었다, 밤새 혼자 일했다 같은 문장이 이어지니 읽다 보면 우리 팀에서도 그럴지 궁금해집니다. 이 글은 열 곳의 고객 사례를 성격별로 묶어 표로 정리하고, 그 숫자를 읽기 전에 확인할 세 가지를 초보자 눈높이로 풀어 봅니다.
목차
먼저 밝힙니다. 이 글은 Anthropic의 공식 발표 페이지를 읽고 정리한 분석이고, 아래 숫자는 전부 각 회사가 밝힌 자체 보고입니다. 제가 재현하거나 검증한 값이 아닙니다. 제가 직접 확인한 것은 2026년 9월 29일에 발표 페이지의 문장과 숫자를 옮겨 적은 부분까지입니다.
오퍼스 5.5 고객 사례에는 어떤 숫자가 나오나요?
발표 페이지에서 뽑은 열 곳을 표 한 장에 모았습니다. 무엇을 재었는지를 따로 적어 둔 이유는 뒤에서 설명합니다.
| 회사 | 무엇을 재었나 | 보고된 내용 |
|---|---|---|
| Quantium | 시간·프롬프트 수 | 프롬프트 38개, 4일이 걸리던 작업이 프롬프트 11개, 3시간으로 |
| Kiro | 호출 수·토큰 | 호출 약 40% 감소, 토큰은 절반, 공개 CLI 벤치마크에서 더 많이 해결 |
| Lovable | 작업 단계 수 | 단계가 3분의 1에서 절반까지 감소 |
| GitHub | 단계 수·해결 과제 | VS Code에서 터미널 과제를 절반 미만의 단계로 더 많이 해결 |
| Optiver | 턴·시간·비용 | 비슷한 품질에 턴·시간·출력 토큰이 약 절반, 비용은 40~50% 낮음 |
| Clio | 무인 작업 시간 | 저장소 6개에 걸친 작업을 밤새 18시간 넘게 사람 없이 진행 |
| Stripe | 자율 작업 결과 | 쌓인 PR 40개를 리베이스, 세션 하나가 12개 세션을 지휘, 다음 날 오후 전부 CI 통과 |
| Chicago Trading Company | 자율 작업 결과 | 밤사이 버그를 진단하고 고쳐서 아침에 테스트 통과 |
| Hebbia | 채점 점수 | 전문가 채점표 커버리지 86.6%, 이전 모델 오퍼스 5는 60.3% |
| Deloitte | 채점 점수 | 가장 낮은 노력 설정에서 72%, 오퍼스 5는 높은 노력 설정에서 56% |
속도와 효율을 말하는 고객 사례는 무엇을 보여 주나요?

첫 묶음은 같은 일을 더 적은 횟수로 끝냈다는 종류입니다. Quantium은 프롬프트 38개로 나흘 걸리던 일이 11개, 세 시간으로 줄었다고 합니다. 쉽게 말해 AI에게 시킨 말의 횟수와 걸린 시간이 함께 줄었다는 이야기입니다. Kiro와 Lovable, GitHub는 표현이 조금씩 다르지만 공통점이 있습니다. 목표까지 가는 단계가 줄었다는 것입니다.
단계가 줄면 토큰 사용량도 따라 줄어드는 것이 보통이라, Optiver가 밝힌 비용 40~50% 감소와 방향이 맞습니다. 다만 비용은 단계 수만으로 정해지지 않고 모델 단가에도 좌우됩니다. 오퍼스 5.5는 100만 토큰당 입력 4달러, 출력 20달러입니다.
밤새 맡긴 고객 사례는 얼마나 믿을 만한가요?
두 번째 묶음은 사람이 퇴근한 뒤에도 AI가 일을 이어 갔다는 이야기입니다. Clio는 저장소 여섯 개를 오가는 작업을 18시간 넘게 맡겼다고 하고, Stripe는 PR 40개를 다시 얹는 작업에서 세션 하나가 다른 세션 열두 개를 지휘했다고 합니다. Chicago Trading Company는 밤사이 버그를 진단하고 고쳐서 아침에 테스트가 통과했다고 전합니다.
이 묶음의 숫자는 시간과 개수입니다. 표에서 눈에 띄는 것은 결과를 CI 통과나 테스트 통과처럼 기계가 판정하는 기준으로 말했다는 점입니다. 통과했다는 사실과 잘 만들었다는 평가는 다른 문제여서, 코드 리뷰에서 무엇이 오갔는지는 페이지에 나와 있지 않습니다. 이 사례들은 오래 혼자 일하는 것이 가능해졌다는 신호로 읽을 수 있지만, 우리 저장소에서도 같은 성공률이 나온다는 근거로 읽으면 곤란합니다.
점수로 말하는 고객 사례는 어떻게 읽나요?

세 번째 묶음은 채점 점수입니다. Hebbia는 전문가 채점표 커버리지가 86.6%로 오퍼스 5의 60.3%보다 높다고 하고, Deloitte는 가장 낮은 노력 설정으로도 72%를 받아 오퍼스 5가 높은 노력 설정으로 받은 56%를 넘었다고 합니다.
여기서 조심할 것은 비교 대상입니다. 두 곳 모두 새 모델이 아니라 이전 모델과 견준 값입니다. 채점표도 각 회사가 정한 것이라, 다른 회사의 업무에 그대로 옮길 수 있는 점수가 아닙니다. 점수 차이가 크다는 것은 그 회사의 그 채점표에서 그랬다는 뜻입니다.
열 곳의 고객 사례에서 공통으로 보이는 것은 무엇인가요?
표를 다시 보면 열 곳이 서로 다른 잣대를 쓰고 있습니다. 횟수와 시간으로 말한 곳이 다섯, 밤새 무인으로 돌린 결과로 말한 곳이 셋, 채점 점수로 말한 곳이 둘입니다. 잣대가 다르니 열 개 숫자를 평균 내거나 순위를 매기는 것은 의미가 없습니다. 각 묶음을 따로 읽어야 합니다.
눈여겨볼 대목은 Deloitte 사례의 노력 설정입니다. 노력 설정은 모델이 한 번의 답에 얼마나 공을 들일지 정하는 옵션이고, 일반적으로 낮게 두면 시간과 토큰이 덜 듭니다. 가장 낮은 설정에서 이전 모델의 높은 설정을 넘었다는 보고는 성능뿐 아니라 비용 면에서도 의미가 있습니다. 다만 이것 역시 그 회사의 채점표에서 나온 한 곳의 값입니다.
고객 사례의 숫자를 읽는 세 가지 기준
숫자를 볼 때 저는 세 가지를 먼저 확인합니다. 어떤 발표 페이지에도 적용할 수 있는 기준입니다.
- 누가 쟀나: 표의 숫자는 고객이 밝힌 값이고, 제가 독립적으로 검증한 것이 아닙니다. 발표 페이지는 제품을 소개하는 자리라 좋은 결과가 골라 실렸을 가능성도 염두에 둬야 합니다.
- 무엇과 비교했나: 이전 모델과 비교한 값인지, 사람이 하던 방식과 비교한 값인지에 따라 의미가 달라집니다. 페이지에서 비교 대상이 분명한 것은 오퍼스 5와 견준 두 곳뿐이었습니다.
- 숫자에 빠진 것: 실패한 시도, 사람이 다듬은 시간, 좋은 과제만 고르는 선택은 보통 숫자에 드러나지 않습니다.
이 세 가지를 통과해도 고객 사례는 참고 자료일 뿐입니다. 내 일에 맞는지는 내 데이터로 확인하는 수밖에 없습니다.
내 일에서 확인하려면 어떻게 하나요?

거창한 실험은 필요 없습니다. 반복해서 하는 작업 하나만 골라 이렇게 재 보시면 됩니다.
- 자주 하는 작업 하나를 고릅니다. 예를 들어 실패한 테스트 고치기나 문서 요약입니다.
- 이전 모델과 오퍼스 5.5에 같은 지시를 줍니다.
- 프롬프트를 몇 번 주고받았는지, 걸린 시간, 쓴 토큰을 적습니다.
- 결과가 실제로 맞았는지, 사람이 손본 시간이 얼마인지도 적습니다.
- 같은 방식으로 세 번쯤 반복해서 운이 아니었는지 봅니다.
참고로 제가 직접 돌려 본 것은 아레나 형식으로 네 과제를 겨룬 기록뿐이고, 위 열 곳의 고객 사례는 하나도 재현하지 않았습니다. 그 기록은 아레나 네 과제 비교 글에 남겨 두었습니다. 다른 모델의 실제 활용을 정리한 글로는 활용 사례 20가지 정리가 있습니다. 원문은 Anthropic 공식 발표 페이지에서 확인하실 수 있습니다.
자주 묻는 질문
고객 사례의 숫자를 그대로 믿어도 되나요?
참고는 하되 그대로 믿지는 않는 편이 안전합니다. 각 회사가 자기 업무에서 잰 값이고 제가 검증한 것이 아니라서, 내 작업에서 같은 결과가 나온다는 보장은 없습니다.
오퍼스 5.5가 이전 모델보다 항상 빠르다는 뜻인가요?
그렇게 읽으면 과합니다. 표의 사례들은 각자의 조건에서 단계나 시간이 줄었다고 보고했을 뿐이고, 모든 작업에서 항상 그렇다는 근거는 아닙니다.
어떤 고객 사례부터 참고하면 좋을까요?
내 일과 재는 방식이 같은 것부터 보시길 권합니다. 단계 수를 줄이고 싶다면 속도 묶음을, 밤샘 작업이 궁금하다면 자율 작업 묶음을 보시면 됩니다.
오늘 나온 고객 사례 바로가기
- 오퍼스 5.5 발표 원문 — 열 곳의 사례와 단가표가 실린 원문
- AI 자동화 비용 계산 기록 — 자동화 비용을 직접 따져 본 기록
- 아스트라와 붙여 본 기록 — 제가 직접 돌려 본 네 과제
출처
| 항목 | 출처 |
|---|---|
| 고객 사례 열 곳의 숫자 | Anthropic 오퍼스 5.5 발표 페이지의 고객 자체 보고 (2026-09-29 확인) |
| 오퍼스 5.5 출시일·단가 | 같은 페이지 (2026-09-22 출시, 입력 4달러·출력 20달러) |
| 오퍼스 5와의 비교 수치 | 같은 페이지에서 Hebbia·Deloitte가 밝힌 값 |
*2026년 9월 29일 기준으로 공식 발표 페이지를 읽고 정리한 글입니다. 고객 사례는 전부 각 회사의 자체 보고이며 제가 재현하거나 검증하지 않았습니다. 언급한 회사들과는 제휴 관계가 없습니다.*