Benchmark
Loom 로컬 PII 필터 벤치마크
개인정보를 네트워크로 나가기 전에 사용자 컴퓨터에서 차단합니다.
로컬 컴퓨터원문 PII 차단 / 토큰화
필터된 요청
Loom 웹감사 로그와 정책만 처리
PII 없는 요청
LLM 프로바이더토큰화된 컨텍스트만 수신
반복 호출에서의 속도
에이전트는 작업 하나에 모델을 수십·수백 번 호출하고, 필터는 그 모든 호출의 입·출력 경로에 놓입니다. Loom 필터는 호출당 0.15ms로, 수백 번을 거쳐도 0.1초를 넘지 않고 100KB 문서도 130ms 수준입니다.
Loom규칙 기반 도구ML 모델
가로축은 로그 스케일입니다. ML 모델 지연시간은 일반 사용자 컴퓨터(CPU) 기준이며, 모두 같은 컴퓨터에서 함께 측정했습니다.
0.86
핵심 민감정보 F1
0.94
식별자 13종 F1
0.15ms
짧은 입력 p95 · 모델 1.3MB
스코프별 결과
공개 데이터셋 KDPII의 학습에 쓰지 않은 3,000행으로 측정했습니다.
| 스코프 | 정밀도 | 재현율 | F1 | 무라벨 행 오탐 |
|---|---|---|---|---|
식별자 13종 이메일·전화·카드·주민번호류 등 결정론적 | 0.945 | 0.932 | 0.938 | 0 |
핵심 민감정보 13종 + 실명·차량·우편·생년월일 | 0.869 | 0.847 | 0.857 | 15 |
개인정보 전반 + 주소·속성·소속 등 | 0.879 | 0.582 | 0.700 | 15 |
다른 도구와 비교
같은 컴퓨터에서 같은 데이터·채점 기준으로 함께 측정한 F1.
| 도구 | 식별자 13종 | 핵심 민감정보 | |
|---|---|---|---|
| Loom | 0.938 | 0.857 | p95 0.15ms |
| ko-pii | 0.827 | 0.577 | 한국어 규칙 기반 |
| seungkukim/korean-pii-v2 | 0.663 | 0.442 | 한국어 ML 모델 |
| Piiranha-v1 | 0.476 | 0.448 | ML 모델 · p95 47ms |
| korean-pii-e5-base | 0.402 | 0.487 | 한국어 ML 모델 |
| OpenAI privacy-filter | 0.352 | 0.195 | ML 모델 |
| Presidio | 0.307 | 0.174 | 규칙 기반 |
| GLiNER-PII | 0.111 | 0.068 | 제로샷 ML 모델 |
| scrubadub | 0.055 | 0.030 | 규칙 기반 |
제3자 벤치마크 (REDACT)
외부 연구진이 공개한 다국어 개인정보 벤치마크 REDACT(arXiv:2606.19881)의 한국어 592건을 논문 저자의 채점기로 측정했습니다. 완전히 노출된 식별자(이메일·전화·카드·신분증 등) 재현율 0.957, 전체 51개 항목 기준 F1 0.461. 같은 논문이 전체 언어에서 보고한 수치는 GPT-4.1 0.597, OpenAI Privacy Filter 0.512, GLiNER 0.320, Presidio 0.195입니다. 측정 범위가 서로 달라 직접 순위 비교는 아닙니다.