Benchmark

Loom 로컬 PII 필터 벤치마크

개인정보를 네트워크로 나가기 전에 사용자 컴퓨터에서 차단합니다.

로컬 컴퓨터원문 PII 차단 / 토큰화
필터된 요청
Loom 웹감사 로그와 정책만 처리
PII 없는 요청
LLM 프로바이더토큰화된 컨텍스트만 수신

반복 호출에서의 속도

에이전트는 작업 하나에 모델을 수십·수백 번 호출하고, 필터는 그 모든 호출의 입·출력 경로에 놓입니다. Loom 필터는 호출당 0.15ms로, 수백 번을 거쳐도 0.1초를 넘지 않고 100KB 문서도 130ms 수준입니다.

Loom규칙 기반 도구ML 모델
정확도 대 지연시간 산점도가로축은 호출당 지연시간(로그 스케일), 세로축은 핵심 민감정보 F1입니다. Loom은 0.16ms에 F1 0.857로 왼쪽 위에 홀로 있습니다. 다른 규칙 기반 도구는 빠르지만 F1이 낮고, ML 모델은 F1이 0.07에서 0.49 사이이면서 23에서 237ms로 느립니다.0.00.20.40.60.81.00.1110100호출당 지연시간 (ms, 로그 스케일)핵심 민감정보 F1Loomko-piiPresidioscrubadubkorean-pii-v2Piiranha-v1e5-baseNemotronOpenAI PFGLiNER-PII

가로축은 로그 스케일입니다. ML 모델 지연시간은 일반 사용자 컴퓨터(CPU) 기준이며, 모두 같은 컴퓨터에서 함께 측정했습니다.

0.86
핵심 민감정보 F1
0.94
식별자 13종 F1
0.15ms
짧은 입력 p95 · 모델 1.3MB

스코프별 결과

공개 데이터셋 KDPII의 학습에 쓰지 않은 3,000행으로 측정했습니다.

스코프정밀도재현율F1무라벨 행 오탐
식별자 13종
이메일·전화·카드·주민번호류 등 결정론적
0.9450.9320.9380
핵심 민감정보
13종 + 실명·차량·우편·생년월일
0.8690.8470.85715
개인정보 전반
+ 주소·속성·소속 등
0.8790.5820.70015

다른 도구와 비교

같은 컴퓨터에서 같은 데이터·채점 기준으로 함께 측정한 F1.

도구식별자 13종핵심 민감정보
Loom0.9380.857p95 0.15ms
ko-pii0.8270.577한국어 규칙 기반
seungkukim/korean-pii-v20.6630.442한국어 ML 모델
Piiranha-v10.4760.448ML 모델 · p95 47ms
korean-pii-e5-base0.4020.487한국어 ML 모델
OpenAI privacy-filter0.3520.195ML 모델
Presidio0.3070.174규칙 기반
GLiNER-PII0.1110.068제로샷 ML 모델
scrubadub0.0550.030규칙 기반

제3자 벤치마크 (REDACT)

외부 연구진이 공개한 다국어 개인정보 벤치마크 REDACT(arXiv:2606.19881)의 한국어 592건을 논문 저자의 채점기로 측정했습니다. 완전히 노출된 식별자(이메일·전화·카드·신분증 등) 재현율 0.957, 전체 51개 항목 기준 F1 0.461. 같은 논문이 전체 언어에서 보고한 수치는 GPT-4.1 0.597, OpenAI Privacy Filter 0.512, GLiNER 0.320, Presidio 0.195입니다. 측정 범위가 서로 달라 직접 순위 비교는 아닙니다.