Claude Opus 5.5
사전지식 없음 · 업무 목록과 문장만 보고 분류 · 실제 시간 재생
10문장까지 · 문장당 0.43초
더 알아보기
사전지식 없는 Claude Opus 5.5와 정본 의사결정 모델에 같은 문장을 주고 업무를 찾게 했습니다. Opus가 10문장을 처리하는 동안 정본이 몇 문장을 처리하는지, 실제 시간으로 보여 드립니다. 정확도는 비슷하고, 속도와 비용, 틀리는 방식이 다릅니다.
사전지식 없음 · 업무 목록과 문장만 보고 분류 · 실제 시간 재생
10문장까지 · 문장당 0.43초
규칙과 작은 의사결정 모델 · 사용자 PC에서 계산
같은 시간 동안 · 문장당 4.8ms
Claude Opus 5.5가 10문장을 처리하는 4.3초 동안 정본은 895문장 약 90배
실제로 걸린 시간 그대로 재생합니다. 문장당 시간은 100문장을 한 묶음으로 처리한 시간을 나눈 것으로, 정본은 문장당 약 4.8ms(1,096문장 평균), Claude Opus 5.5는 effort에 따라 묶음당 28·43·53초(문장당 0.28·0.43·0.53초), 토큰 2.0만·2.2만·6.0만입니다. 실제 서비스처럼 문장마다 따로 부르면 Opus는 문장마다 몇 초가 걸리지만, 따로 재지는 않았습니다. 화면의 문장은 예시입니다.
국내 대학 3곳의 공개 연구비 규정으로 만든 의사결정 모델입니다. 누르면 그 대학의 의사결정 모델이 새 탭에서 열립니다.
각 의사결정 모델은 그 대학의 공개 규정으로 만든 정본화된 문서이며, 해당 대학과 무관하게 정본이 만들었습니다. 안내 문장은 대학 담당자의 검수를 거치지 않은 시연용입니다.
사전지식 없는 Claude Opus 5.5와 같은 수준으로 업무를 찾습니다. 그런데 100배쯤 빠르고, 파일 하나로 돌아갑니다.
| 지표 | 정본 | Opus low | medium | high |
|---|---|---|---|---|
| 1순위 정답되묻기 없이 첫 답이 맞은 비율. Opus에는 되묻는 단계가 없어 아래 ‘한 번 질문 안에’와 같은 값 | 89.9% | 91.5% | 91.6% | 91.0% |
| 한 번 질문 안에 정답확신이 없으면 한 번 되묻고, 그 안에 맞힌 비율 | 93.0% | 91.5% | 91.6% | 91.0% |
| 후보 3개 안에 정답 | 97.6% | 98.4% | 98.5% | 98.8% |
| 처리 시간 (100문장) | 0.48초 | 28초 | 43초 | 53초 |
| 토큰 (100문장) | 0 | 2.0만 | 2.2만 | 6.0만 |
정본은 확신이 없으면 되묻고, 틀려도 지어내지 않습니다. 그리고 그 모든 일이 사용자 PC 안에서 끝납니다.
| 지표 | 정본 | Opus low | medium | high |
|---|---|---|---|---|
| 엉뚱한 업무로 바로 들어감되묻지 않고 틀린 안내를 시작한 비율. 낮을수록 좋음 | 1.4% | 3.9% | 2.6% | 2.4% |
| 바로 들어간 것 중 정답 | 97.6% | 95.2% | 96.5% | 96.9% |
| 범위 밖 문장 걸러냄연구비와 무관한 문장을 업무로 보내지 않은 비율 | 98.2% | 97.4% | 94.7% | 96.5% |
| 같은 문장에 같은 답 | 항상 | 실행마다 달라질 수 있음 | ||
| 규정에 없는 문장이 나올 수 있는지 | 없음 | 있음 (생성형) | ||
2026년 9월 30일 실험, 검증 세트 5개 982문장 기준. 의사결정 모델 점수는 2026년 10월 4일판.