Upstage Solar Pro 4를 네 개의 에이전트 제품에 각각 물리고, 한국어 실무 과제 12개를 830회 돌렸습니다. 코딩 문제가 아니라 보고서, 장부, 정책 문서, 회의록 같은 실제 업무입니다. 두 달 전 같은 벤치와 비교했습니다.
에이전트 종합 점수 · 한국어 실무 과제 12개 · 360회 실행 · macOS
Upstage Solar Pro 4를 네 개의 에이전트 제품에 각각 물리고, 한국어 실무 과제 12개를 830회 돌렸습니다. 코딩 문제가 아니라 보고서, 장부, 정책 문서, 회의록 같은 실제 업무입니다.
6월에 같은 12과제를 돌렸을 때는 그림이 달랐습니다. 에이전트 제품은 그대로 두고 Solar를 새 Pro 4로 바꾸자 네 제품 모두 성공률이 올라갔습니다. 개선폭은 원래 성적이 낮았던 제품일수록 컸습니다.
| 제품 (모두 Solar) | 6월 성공률 | 8월 성공률 | 실패 감소 |
|---|---|---|---|
| OpenCode | 42.0% | 93.3% | 8.7배 |
| Hermes | 71.0% | 90.0% | 2.9배 |
| pi | 78.0% | 98.3% | 13배 |
| Loom | 98.0% | 99.2% | 2.5배 |
과제를 성격별로 묶어 보면 개선이 어디서 일어났는지 보입니다. 순수 텍스트와 코드는 원래도 잘 풀었습니다. 달라진 곳은 문서와 데이터를 다루는 과제, 그리고 가장 어려운 멀티모달 과제입니다.
| 과제군 · 성공률 | OpenCode | Hermes | pi | Loom |
|---|---|---|---|---|
| 일반·코드 (4과제) | 52%→100% | 92%→95% | 100%→100% | 100%→98% |
| 데이터·문서 (5과제) | 36%→88% | 76%→92% | 74%→96% | 96%→100% |
| 멀티모달·특수 (3과제) | 37%→93% | 33%→80% | 57%→100% | 100%→100% |
위 결과는 macOS에서 나왔습니다. 개발 도구가 이미 깔려 있고, 명령줄이 익숙하게 동작하고, 문서 처리 라이브러리를 어렵지 않게 구할 수 있는 환경입니다.
그런데 실제 사무 업무는 대부분 Windows PC에서 벌어집니다. 한글 문서와 엑셀과 PDF를 다루고, 개발 도구는 깔려 있지 않습니다. 그래서 똑같은 12과제를 실제 Windows 노트북으로 옮겨 다시 돌렸습니다.
모델은 그대로입니다. 과제도 그대로입니다. 제품만 다릅니다.
같은 모델을 물렸는데 전체 평균이 45.5점에서 87.6점까지 벌어졌습니다. 모델이 상수이므로, 이 차이는 제품이 만든 것입니다.
| 제품 | 성공률 | 성공 시 평균 | 편차 | 전체 평균 |
|---|---|---|---|---|
| Loom | 96.7% | 89.1 | 11.7 | 87.6 |
| Claude Code | 100.0% | 90.2 | 18.1 | 90.2 |
| Hermes | 60.0% | 85.2 | 17.8 | 61.8 |
| pi | 55.0% | 76.4 | 22.2 | 49.3 |
| OpenCode | 51.7% | 67.1 | 26.3 | 45.5 |
| 과제 (Windows) | Loom | Claude | Hermes | pi | OpenCode |
|---|---|---|---|---|---|
| 정책 문서 병합 (HWP·PDF) | 98.2 | 97.5 | 29.4 | 30.1 | 31.1 |
| 성장전략 보고서 | 93.0 | 95.2 | 35.0 | 31.8 | 42.3 |
| 분기 수익성 집계 | 92.2 | 98.5 | 24.5 | 42.6 | 32.9 |
| 매장 매출 정리 | 90.2 | 98.1 | 41.9 | 45.8 | 36.1 |
Windows 측정에서 Loom은 실무 과제 하나를 평균 3분에, 약 150원에 끝냈습니다. 같은 과제를 Claude Opus 4.8로 처리하면 14배가 듭니다.
| 제품 | 성공 실행당 비용 | 성공 중앙 시간 | 완주율 |
|---|---|---|---|
| Loom | $0.107 | 194초 | 99.2% |
| Claude Code | $1.551 | 349초 | 100.0% |
| Hermes | $0.083 | 728초 | 76.7% |
| pi | $0.082 | 180초 | 88.3% |
| OpenCode | $0.073 | 171초 | 93.3% |
같은 12개 실무 과제를 두 환경에서 반복 실행했습니다. macOS 360회, Windows 470회, 합계 830회를 채점했습니다. 실행 시간 상한은 25분이며 넘긴 실행은 완주 실패로 집계했습니다. 각 실행은 독립된 작업 디렉터리에서 시작하고, 끝나면 전체를 체크섬과 함께 보관했습니다.
성장전략 보고서(HWP 포함), 정책 문서 병합, 장부 대사, 분기 수익성 집계, 회의록 정리, 보도자료 사실검증, 프라이버시 감사, 마이그레이션 런북, 코드 버그 수정 등.
규칙 기반 검증기로 산출물 경로와 수치 정합성, 입력 무결성을 판정하고, 내용 품질은 GPT-5.5와 Claude Opus 4.8 두 계열 심판 패널이 봤습니다.