Solar Pro 4 출시 기념 벤치마크

Solar Pro 4,
에이전트로 다시 태어나다

Upstage Solar Pro 4를 네 개의 에이전트 제품에 각각 물리고, 한국어 실무 과제 12개를 830회 돌렸습니다. 코딩 문제가 아니라 보고서, 장부, 정책 문서, 회의록 같은 실제 업무입니다. 두 달 전 같은 벤치와 비교했습니다.

90.0
Solar Pro 4
Loom
VS
91.5
Claude Opus 4.8
Claude Code

에이전트 종합 점수 · 한국어 실무 과제 12개 · 360회 실행 · macOS

1. 모델이 달라졌습니다

같은 제품, 같은 과제, 바뀐 것은 모델뿐

Upstage Solar Pro 4를 네 개의 에이전트 제품에 각각 물리고, 한국어 실무 과제 12개를 830회 돌렸습니다. 코딩 문제가 아니라 보고서, 장부, 정책 문서, 회의록 같은 실제 업무입니다.

6월에 같은 12과제를 돌렸을 때는 그림이 달랐습니다. 에이전트 제품은 그대로 두고 Solar를 새 Pro 4로 바꾸자 네 제품 모두 성공률이 올라갔습니다. 개선폭은 원래 성적이 낮았던 제품일수록 컸습니다.

제품 (모두 Solar)6월 성공률8월 성공률실패 감소
OpenCode42.0%93.3%8.7배
Hermes71.0%90.0%2.9배
pi78.0%98.3%13배
Loom98.0%99.2%2.5배
실패는 결과물을 내지 못했거나 과제 요건을 결정적으로 어긴 실행. 동일 12과제, macOS, 동일 채점 기준.

어려운 과제일수록 차이가 큽니다

과제를 성격별로 묶어 보면 개선이 어디서 일어났는지 보입니다. 순수 텍스트와 코드는 원래도 잘 풀었습니다. 달라진 곳은 문서와 데이터를 다루는 과제, 그리고 가장 어려운 멀티모달 과제입니다.

과제군 · 성공률OpenCodeHermespiLoom
일반·코드 (4과제) 52%100% 92%95% 100%100% 100%98%
데이터·문서 (5과제) 36%88% 76%92% 74%96% 96%100%
멀티모달·특수 (3과제) 37%93% 33%80% 57%100% 100%100%
6월 → 8월. 가장 어려운 멀티모달 과제군에서 세 제품의 성공률이 33~57%에서 80~100%로 올라갔습니다. 이 구간에서는 제품 버전도 함께 갱신되었으므로 개선분 전부가 모델 몫은 아니지만, 네 제품에서 동시에 같은 방향으로 나타났습니다.
에이전트 과제는 모델의 지식보다 도구를 쓰고, 계획을 세우고, 끝까지 완수하는 능력을 봅니다. Solar Pro 4는 그 축에서 크게 올라섰습니다. 8월 측정에서 Solar를 쓴 제품의 종합 점수가 90.0으로, Claude Opus 4.8의 91.5와 1.5점 차였습니다.
2. 그런데 한 가지가 남습니다

이 측정은 개발자 노트북에서 했습니다

위 결과는 macOS에서 나왔습니다. 개발 도구가 이미 깔려 있고, 명령줄이 익숙하게 동작하고, 문서 처리 라이브러리를 어렵지 않게 구할 수 있는 환경입니다.

그런데 실제 사무 업무는 대부분 Windows PC에서 벌어집니다. 한글 문서와 엑셀과 PDF를 다루고, 개발 도구는 깔려 있지 않습니다. 그래서 똑같은 12과제를 실제 Windows 노트북으로 옮겨 다시 돌렸습니다.

개발자 환경 · macOS
Loom99.2%
pi98.3%
OpenCode93.3%
Hermes90.0%
실무 환경 · Windows
Loom96.7%
pi55.0%
OpenCode51.7%
Hermes60.0%
같은 제품, 같은 Solar Pro 4, 같은 12과제. 환경만 바뀌었을 때의 성공률입니다.
pi
-43%p
OpenCode
-42%p
Hermes
-30%p
Loom
-2%p

모델은 그대로입니다. 과제도 그대로입니다. 제품만 다릅니다.

3. 실무 환경 결과

Windows에서 Solar Pro 4를 끝까지 끌어낸 것

같은 모델을 물렸는데 전체 평균이 45.5점에서 87.6점까지 벌어졌습니다. 모델이 상수이므로, 이 차이는 제품이 만든 것입니다.

제품성공률성공 시 평균편차전체 평균
Loom96.7%89.111.787.6
Claude Code100.0%90.218.190.2
Hermes60.0%85.217.861.8
pi55.0%76.422.249.3
OpenCode51.7%67.126.345.5
Loom · Hermes · pi · OpenCode는 Solar Pro 4, Claude Code는 Claude Opus 4.8. Claude Code는 모델이 달라 제품 비교 대상이 아니라 품질 기준선으로 함께 실었습니다. 편차가 작을수록 결과가 고릅니다.
Solar Pro 4를 쓴 Loom이 87.6점. 같은 과제에서 Claude Opus 4.8이 90.2점입니다. 한 자릿수 차이입니다.

문서와 데이터가 걸린 과제에서 특히 벌어집니다

과제 (Windows)LoomClaudeHermespiOpenCode
정책 문서 병합 (HWP·PDF)98.297.529.430.131.1
성장전략 보고서93.095.235.031.842.3
분기 수익성 집계92.298.524.542.632.9
매장 매출 정리90.298.141.945.836.1
macOS에서는 같은 과제들이 네 제품 평균 88~96점이었습니다. 환경이 바뀌자 갈렸습니다.
4. 비용과 시간

업무 한 건에 150원

Windows 측정에서 Loom은 실무 과제 하나를 평균 3분에, 약 150원에 끝냈습니다. 같은 과제를 Claude Opus 4.8로 처리하면 14배가 듭니다.

제품성공 실행당 비용성공 중앙 시간완주율
Loom$0.107194초99.2%
Claude Code$1.551349초100.0%
Hermes$0.083728초76.7%
pi$0.082180초88.3%
OpenCode$0.073171초93.3%
완주율은 25분 안에 끝낸 실행의 비율. 실측 토큰 사용량에 공개 단가를 적용했고, 원화는 1,350원 기준입니다.
비용은 성공한 실행 기준으로 실었습니다. Hermes는 실행당 비용이 Loom보다 싸 보이지만, 네 번에 한 번은 25분 안에 끝내지 못했고, 성공률은 60%였습니다.
방법

어떻게 쟀는지

같은 12개 실무 과제를 두 환경에서 반복 실행했습니다. macOS 360회, Windows 470회, 합계 830회를 채점했습니다. 실행 시간 상한은 25분이며 넘긴 실행은 완주 실패로 집계했습니다. 각 실행은 독립된 작업 디렉터리에서 시작하고, 끝나면 전체를 체크섬과 함께 보관했습니다.

과제 12개

성장전략 보고서(HWP 포함), 정책 문서 병합, 장부 대사, 분기 수익성 집계, 회의록 정리, 보도자료 사실검증, 프라이버시 감사, 마이그레이션 런북, 코드 버그 수정 등.

채점은 2계열 심판

규칙 기반 검증기로 산출물 경로와 수치 정합성, 입력 무결성을 판정하고, 내용 품질은 GPT-5.5와 Claude Opus 4.8 두 계열 심판 패널이 봤습니다.