Corepin / 한국형 개인정보 필터

한국어의 맥락을
그대로 읽는 필터.

정규식이 아닌, 한국어 의미를 직접 읽는 가드레일. 문장의 의도·시제까지 보고 패턴에 없는 인명·주소·맥락을 잡아내며, "예시" 와 "실제 노출" 을 구분합니다. 한국 전용 9가지 + 일반 8가지 = 17가지 일괄 탐지·마스킹.

17가지
탐지 가능한 개인정보
해외 표준 8가지 + 한국 전용 9가지
99.97%
엄격 채점 정답률
라벨 분류까지 일치해야 정답
5원/호출
외산 PII 서비스 1/30
분당 60회·월 1,000회 무료부터
왜 자동 PII 검사가 필요한가

"이 텍스트에 주민번호 들어있어?"
하루에 수백 번 묻게 되는 그 질문.

ChatGPT에 사내 자료를 붙여넣기 전, 상담 로그를 분석에 넘기기 전, 학습 데이터셋을 만들 때 — 매번 검사해야 합니다. 사람이 다 보긴 양이 너무 많고, 정규식은 인명·주소를 놓쳐요.

외부 AI에 사내 텍스트 보내기 전 — 본문에 주민번호 한 줄만 따라가도 개인정보보호법 §24-2 위반이에요. 매 호출마다 사람이 검수할 수 없고, 정규식은 인명·주소 같은 비정형 정보를 놓칩니다.

상담 로그를 분석에 쓰기 전 — BI·분석 파이프라인으로 넘기기 전, 이름·전화·주민번호만 정확히 골라 가려야 합니다.

Corepin은 그 사이에 들어갑니다. 한국 PII 17가지로 학습한 v1.0 모델을 API 한 번으로 호출하면 끝. 국내 데이터센터에서만 처리하고, 본문·결과 모두 저장하지 않아요.

시나리오 01
"이 보고서 ChatGPT에 요약시켜도 되나?"
직원이 사내 보고서를 외부 AI에 맡기려 할 때 — 본문에 주민번호·이메일·인명이 있으면 자동 마스킹한 다음 외부로. 17가지 카테고리를 한 번에 검사해요.
시나리오 02
"고객 상담 로그를 분석팀에 넘겨야 해."
콜센터·챗봇 로그를 BI 시스템이나 분석 파이프라인에 넣기 전, 이름·전화·주민번호 자동 마스킹. 분석 정확도는 살리고 재식별 위험은 없애드려요.
시나리오 03
"AI 학습용 데이터셋, 외부와 공유 가능하게."
사내 데이터로 모델 학습하거나 외부 협력사와 데이터셋을 공유할 때 — 17가지 PII 카테고리를 일괄 마스킹해서 안전하게.
시나리오 04
"가입·문의 폼 입력에 즉시 검사."
사용자가 자유롭게 입력하는 텍스트에 주민번호·여권번호 같은 민감정보가 섞이지 않게 — 입력 단계에서 실시간으로 탐지·차단합니다.
기존 보안업체와의 차이

20년 정규식 시대의 끝,
이제 AI가 맥락으로.

국가정보원 「AI 보안 가이드북」 (2025년 12월)

가이드북은 입출력 필터링을 기본 통제로 두되, 금지어 차단 같은 단순 필터가 아니라 민감정보 입력 차단·비정상 패턴 탐지를 포함한 다층 통제를 권고합니다. 개인정보·내부 자료가 프롬프트로 들어가는 순간을 입력 단계에서 차단하라는 요구입니다.

한국 개인정보 필터 시장은 20년 넘게 정규식과 키워드 사전에 머물러 있었어요. 패턴이 맞으면 차단, 아니면 통과 — 시장의 "AI PII" 마케팅도 뜯어보면 같은 패턴 매칭 위에 룰 추천만 얹은 형태죠. Corepin은 한국 PII 19 카테고리를 직접 학습한 한국어 특화 AI 모델로 패턴에 없는 인명·주소·회사명·금액·문장 의도까지 잡습니다. 가이드북이 말한 '단순 필터가 아닌 다층 통제', 한국 개인정보 영역에서 실제로 충족하는 모델이에요.

구분 정규식·룰베이스사내에서 정규식·사전
으로 직접 매칭
외부 LLM APIChatGPT·Claude 같은
범용 LLM으로 처리
Corepin 개인정보 필터한국 19 카테고리 전용
학습된 한국형 개인정보 필터 v1.3
도입 시간 2 ~ 4주
패턴 작성·예외 처리·테스트
1 ~ 2주
프롬프트·가드레일 통합
한국어 정확도 패턴은 정확, 비정형 약함
인명·주소·기업명 같이 정형이 아닌 PII 못 잡음
중간
한국 주민번호 체크섬·법인번호 같은 한국 패턴 실수 잦음
인명 과탐 심함
"김치", "한강" 같은 동음이의어를 인명으로 오탐
중간
공인 본명도 매번 마스킹하거나 일반 단어를 인명으로 오탐
데이터 처리 회사 내부
로컬 처리, 안전
해외 클라우드
개인정보보호법 §24-2 고유식별정보를 외부로 보내는 자체가 위반 위험
한국 카테고리 패턴 가능한 것만 일반 라벨로 통합
비용 유지보수 부담
패턴 추가·예외 처리 계속 필요
토큰당 변동
대량 호출 시 누적

이런 경우에 잘 맞아요: 외부 AI로 사내 텍스트를 보낼 때, 사용자가 자유롭게 입력하는 텍스트를 받을 때, 한국어 비정형 PII(인명·주소·기업명)까지 정확히 가려야 할 때. 개인정보보호법 §24-2 고유식별정보 9가지가 모두 분리 라벨로 출력되어 컴플라이언스 보고에도 그대로 쓸 수 있어요.

같은 문장, 다른 결과

해외 필터가 못 잡는
한국 개인정보.

해외에서 만든 일반 개인정보 필터는 영어권 보편 카테고리 8개로 학습되어 있어, 한국 특유의 식별번호나 한국어 우회 패턴은 커버리지 밖입니다. Corepin 필터가 이 간극을 메웁니다.

Case 01 — 한국 고유식별정보
"저는 홍길동입니다. 주민번호는 900101-1234567이고, 사업자번호 220-81-62517로 거래합니다."
기초 모델 단독
이름 홍길동만 탐지
주민번호·사업자번호는 카테고리 외 영역
Corepin 필터
이름 홍길동
주민등록번호 900101-1234567
사업자등록번호 220-81-62517
Case 02 — 우회 시도
"제 주민번호는 9 0 0 1 0 1 - 1 2 3 4 5 6 7 입니다."
기초 모델 단독
주민번호 카테고리가 없고, 공백 우회 패턴도 별도 학습 없음 → 탐지 불가
Corepin 필터
주민등록번호 9 0 0 1 0 1 - 1 2 3 4 5 6 7
공백 삽입 우회를 학습 데이터에 포함 → 인식 성공
Case 03 — 유명인 언급
"어제 김연아 은퇴식 봤어? 너무 감동이었어."
기초 모델 단독
이름 김연아 자동 마스킹
기초 모델은 공인/일반인 구분 학습이 없음
Corepin 필터
유명인 예외 목록에 포함 → 자연스러운 대화 그대로 보존
17가지 분류

개인정보보호법 기준으로
정확히 나눴어요.

분홍 배경 5가지는 개인정보보호법 §24-2 고유식별정보 — 처리할 때 별도 동의와 암호화가 필요합니다. Corepin은 모든 사용자 텍스트 추론을 대한민국 국내 데이터센터에서만 처리하며, 데이터의 국외 이전 없이 개인정보보호법 를 준수합니다.

private_person
이름

한국/외국 인명, 부분 익명(김○○) 포함

private_address
주소

도로명/지번/아파트/우편번호

private_email
이메일

이메일 주소

private_phone
전화번호

휴대전화/유선전화/국제번호

private_url
URL

개인 식별 가능한 URL

private_date
날짜

생년월일, ISO/한국식 날짜

account_number
계좌·카드번호

은행 계좌, Luhn 카드번호

secret
비밀정보

API 키, 토큰, 비밀번호

kr_rrn
주민등록번호

개인정보보호법 §24-2 고유식별정보 — 13자리 체크섬

개인정보보호법 §24-2
kr_foreigner_id
외국인등록번호

개인정보보호법 §24-2 고유식별정보

개인정보보호법 §24-2
kr_passport
여권번호

개인정보보호법 §24-2 고유식별정보 (M12345678 등)

개인정보보호법 §24-2
kr_driver_license
운전면허번호

개인정보보호법 §24-2 고유식별정보

개인정보보호법 §24-2
kr_biz_no
사업자등록번호

10자리 NTS 체크섬

kr_corp_no
법인등록번호

13자리 법인등록번호

kr_health_insurance
건강보험증번호

건강보험 가입자번호

개인정보보호법 §24-2
kr_vehicle_plate
차량번호

신/구 형식 자동차 번호판

private_ip
IP 주소

IPv4/IPv6 주소

kr_company
회사명·기관명

KOSPI/KOSDAQ 상장 종목 + 정부·금융·의료·교육 주요 기관

kr_money
금액

원·만·억·₩·KRW·$·USD·€·¥·£·약식 11종 표기

한국 시장 특화 설계

이런 디테일까지
— 한국 개인정보만의 함정.

한국 개인정보보호법이 특별히 엄격하게 다루는 "고유식별정보"와 일상 한국어 대화 관습을 함께 고려한 설계 결정들입니다.

01

한국 고유식별정보 전부 커버

개인정보보호법이 별도로 엄격하게 관리하는 주민번호·여권·운전면허·외국인등록·법인·사업자등록번호를 모두 독립 카테고리로 학습.

02

가명정보 가이드라인 준수

개인정보보호위원회 가명정보 처리 가이드라인을 기반으로 카테고리 선정. 탐지 후 부분 마스킹·치환·삭제 정책에 유연하게 연결됩니다.

03

5,309명의 실제 한국 이름

한국어 공개 뉴스 데이터에서 실제 인명 5천 명 이상을 추가로 학습해 인공적 분포에 갇히지 않도록 보강.

04

유명인 약 200명 예외 처리

"김연아 은퇴식 봤어?" 같은 자연스러운 대화가 마스킹되지 않도록 스포츠·연예·역사·정치 약 200명을 예외 목록으로 학습.

05

일반명사 과탐 방지

"김치찌개", "박사학위", "최고의" 같은 일반명사가 성씨와 같은 음절로 시작해도 탐지하지 않도록 150개 이상의 예외 템플릿을 학습.

06

13가지 실전 문서 포맷

회원가입 폼·고객 상담·의료 기록·금융 거래·개발 로그·메신저·이메일·계약서·행정 서식·이력서·SNS·회의록·우회 시도를 모두 학습.

우회 시도 차단

필터 우회 시도까지,
미리 학습해 둔 모델.

AI 필터를 피하기 위해 숫자 사이에 공백을 넣거나, 전각 숫자로 바꾸거나, 한글로 풀어쓰는 9가지 우회 패턴을 학습 데이터에 포함시켰습니다.

01
공백 삽입
원본
900101-1234567
우회 형태
9 0 0 1 0 1 - 1 2 3 4 5 6 7
기초 모델 ✕ Corepin ✓
02
전각 숫자 치환
원본
900101-1234567
우회 형태
900101-1234567
기초 모델 ✕ Corepin ✓
03
한글 수사 풀어쓰기
원본
900101-1234567
우회 형태
구공공일공일-일이삼사오육칠
기초 모델 ✕ Corepin ✓
04
유니코드 대시 치환
원본
900101-1234567
우회 형태
900101—1234567 · 900101‐1234567 · 900101ー1234567
기초 모델 ✕ Corepin ✓
05
제로폭 문자 삽입
원본
900101-1234567
우회 형태
9​0​0​1​0​1-1234567
기초 모델 ✕ Corepin ✓
06
구분자 대체
원본
900101-1234567
우회 형태
900101.1234567 · 900101/1234567 · 900101|1234567
기초 모델 ✕ Corepin ✓
07
HTML 엔티티
원본
900101-1234567
우회 형태
900101-1234567
기초 모델 ✕ Corepin ✓
08
중간 주석 삽입
원본
900101-1234567
우회 형태
900101<!-- 숨긴 -->-1234567
기초 모델 ✕ Corepin ✓
09
줄바꿈 삽입
원본
900101-1234567
우회 형태
900101- 1234567
기초 모델 ✕ Corepin ✓
탄탄한 기초 위에 한국을 얹다

작고 빠른 기초 모델 위에
한국 19 카테고리를 얹었어요.

대형 LLM 대신 한국어 개인정보 한 가지에만 집중하는 작은 모델을 골랐어요. 실시간 처리가 가능할 만큼 가볍고, 한국 환경에 맞게 다시 가르치기 쉬운 구조입니다. Corepin 필터는 이 기반 위에 한국 맥락을 얹은 결과예요.

01

가벼운 모델실시간 처리 가능

대형 LLM 대비 훨씬 작은 크기. 저가 그래픽 카드 한 장이나 노트북에서도 실시간으로 돌아가요.

02

긴 문서 한 번에한 호출로 끝

이메일, 계약서, 의료 기록 같은 긴 문서도 쪼개지 않고 한 번에 처리해요. 일반 LLM보다 훨씬 긴 입력을 그대로 받습니다.

03

한 번에 분류생성형 LLM보다 빠름

답을 한 글자씩 만들어내는 일반 LLM과 달리, 문장 전체를 한 번에 검사해서 결과를 돌려줘요. 같은 크기 LLM 대비 수십 배 빠른 처리량.

04

앞뒤 맥락 동시에문맥 기반 탐지

단어마다 앞뒤 문맥을 동시에 참고해서 판단해요. 패턴 매칭이 아닌 문맥 기반 탐지라 형식이 변해도 의미를 잃지 않습니다.

05

깔끔한 경계 인식정확한 구간 잡기

개인정보의 시작·끝을 깔끔하게 잡아내요. 토큰 잡음 대신 의미 단위로 정돈된 구간을 돌려줍니다.

06

국내 자체 운영상업 이용 허용

오픈 라이선스 기반이라 자체 인프라에서도 운영 가능. 운영 환경에서는 국내 데이터센터에서만 처리하므로 민감 데이터가 외부로 전송되지 않아요.

한국 확장 학습

기반 위에 우리가
더한 것들.

기초 모델의 빠른 처리 능력은 그대로 유지한 채, 출력 카테고리만 17가지로 확장하고 한국어 실전 문장 5만 건우회 패턴 9종을 학습했습니다. 속도와 효율은 그대로, 한국 커버리지만 대폭 늘어났습니다.

A

한국 고유식별정보 9개

주민등록번호·외국인등록번호·여권·운전면허·사업자·법인·건강보험증·차량번호·IP. 개인정보보호법 §24-2 "고유식별정보" 전부 독립 카테고리로 학습.

B

실제 한국 이름 5,309명

한국어 공개 뉴스 데이터에서 실제 인명 5천 명 이상을 학습 데이터에 포함. 인공 분포에 갇히지 않고, 실제 한국 이름 다양성을 흡수.

C

유명인 예외 약 200명

스포츠·연예·역사·정치 인물 약 200명을 명시적 예외로 학습. "김연아 은퇴식 봤어?"가 마스킹되지 않음. 동명이인 일반인은 여전히 탐지.

D

우회 차단 9가지

공백 삽입·전각 숫자·한글 수사·유니코드 대시·제로폭 문자·구분자 대체·HTML 엔티티·중간 주석·줄바꿈. 사용자가 우회하려 할 때도 탐지.

E

실전 문서 포맷 13가지

회원가입 폼·고객 상담·의료 기록·금융 거래·개발 로그·메신저·이메일·계약서·행정 서식·이력서·SNS·회의록·우회 시도. 실제 업무 맥락을 광범위하게 포함.

F

학습 데이터 50,000문장

실제 한국인 데이터를 직접 사용하지 않고, 체크섬이 유효한 가공 식별번호만 생성해 학습. 개인정보보호법이 금지하는 실데이터 사용 없이 고품질 확보.

개선 과정

수많은 시행착오를 거쳐
강화해 왔습니다.

한국어 실전 텍스트의 미묘한 패턴들은 한 번에 잡히지 않았습니다. 9차례에 걸친 미세 조정으로 한국어 인명·주소·동음이의 함정을 끈질기게 분석하고 각 문제를 하나씩 공략하면서 다듬어왔어요. v0.1~v0.5는 자체 시험지 99.97%로 완성, v0.7~v1.0은 외부 데이터로의 일반화 능력을 끌어올린 단계로 production 수준에 다다랐습니다.

0.1
기반 구축 — 한국 식별번호 전용 카테고리 확보

주민등록번호·외국인등록번호·여권·운전면허·사업자·법인·건강보험증·차량번호·IP를 모두 독립 카테고리로 학습.

0.2
견고성 — 우회 시도 차단 능력 확보

공백·전각 숫자·한글 수사·특수 대시·보이지 않는 문자 등 9가지 변형 패턴을 학습 데이터에 명시적 포함.

0.3
과탐 억제 — "김치찌개"를 이름으로 오탐하던 문제

일반명사 + 조사 결합("김치찌개를", "박사학위", "최고의 선택") 150여 개를 명시적 예외 문장으로 학습.

0.4
UX 개선 — 유명인 언급이 일상 대화에서 마스킹되던 문제

정치인·운동선수·연예인·역사 인물 약 200명을 별도 예외 목록으로 관리.

0.45
업무 문장 — 문장 중간 이름이 연속으로 나올 때 놓치던 문제

"김태영 사원이 보고서를 제출했고, 박소연 대리가 검토했다" 같은 구조에서 두 이름 모두 정확히 탐지.

0.5
혼합 이름 + 부분 마스킹 + 균형 회복

한국+외국 혼합 이름("Alex Kim 이사님"), 부분 가린 이름("김○○"), 주소·차량번호 성능 회귀를 모두 해결. 자체 시험지 정답률 99.97%로 도달.

0.7
K-PII-Masking-300K 1차 통합 — 분포 갭의 발견

자체 시험지 99.97%여도 별도 14,195문장 평가 묶음에서는 78.6%에 머물렀습니다. 학습 분포와 평가 분포의 차이가 만든 21점 격차. 별도 학습 셋 일부를 자체 합성과 혼합해 1 회차 추가 학습 — 별도 시험지 78.6 → 99.2로 도약.

0.9
K-PII-Masking-300K 학습 비중 확대 — 잔여 케이스 보완

v0.7에서 남은 일부 별도 평가 케이스(특히 동음이의어 함정과 공인 본명 영역)를 잡기 위해 K-PII-Masking-300K 학습 비중을 확대 적용.

1.0
외부 일반화 완성 — 양쪽 시험지 모두 99.97%급

오픈소스 기초 모델에서 새로 시작해 한국어 개인정보 합성 데이터 22.3만 문장으로 5 회차에 걸쳐 학습. 자체 시험지 99.97%를 그대로 유지하면서 외부 14,195 평가 묶음에서도 99.99% 도달. 동음이의어 함정 3,682건과 공인 본명 1,222건 오탐 0건.

1.1
회사명·금액 두 카테고리 확장 + 실 운영 함정 흡수

v1.0의 정확도를 그대로 유지하면서 두 가지 새 카테고리를 더했습니다 — 회사명·기관명(KOSPI/KOSDAQ 상장 2,770종 + 정부·금융·의료·교육 주요 기관 240종)과 금액(원·만·억·₩·KRW·$·USD·€·¥·£·약식 11종 표기). 동시에 사용자 제보로 들어온 실 운영 환경의 함정 패턴 — 입찰공고번호·과제관리번호·파일 ID·정부 사업 공고문 표 머리글 188종 — 을 부정 학습으로 흡수해 이름 과탐을 직접 해소. 학습 데이터 23.8만 문장(K-PII-Masking 17.8만 + 자체 합성 6.0만). 같은 14,195 평가 묶음에서 100.00%로 미세 상향.

1.2
탐지 견고성 지속 보강 (단계적 적용 중)

한국어 실전 텍스트의 까다로운 표현·문서 구조에 대한 탐지 안정성을 계속 다듬고 있습니다. 정확도 회귀 없이 내부 검증을 통과한 개선만 무중단으로 단계 적용합니다.

1.3
문맥 판단 강화 + 실서비스 기준 전량 재검증(현재 가동)

이름·회사명처럼 문맥으로 판단해야 하는 실무 문서 표기의 탐지력을 높였습니다. 동시에 검증 눈금을 바꿨습니다 — 오프라인 채점 대신 14,195 평가 묶음 전량을 고객이 실제 호출하는 API 경로 그대로 재검증합니다(채점 기준이 달라 과거 버전 점수와 직접 비교되지 않습니다). 탐지율(재현율) 99.99%, 동음이의어 함정 3,682건·공인 본명 1,222건 오탐 0건. 공인 본명 명단은 시사 인물 변화에 맞춰 지속 갱신합니다.

성능 비교 · 자체 평가 셋 2,000건

한국 운영 환경에서,
비교할 수 없는 격차.

학습에 쓰지 않은 2,000개 한국어 합성 문장(자기소개·계약서·의료기록·이메일·업무 채팅·정부 서식 등 13개 시나리오)에서 측정한 결과.

엄격 채점 — 기초 모델이 0점 받는 9개 카테고리

기초 모델은 한국 전용 카테고리 자체를 가지고 있지 않기 때문. 구간은 찾아도 이름을 못 붙이므로 엄격 채점에서는 전부 오답 처리.

주민등록번호864건
Corepin
100%
OpenAI
0%
사업자등록번호125건
Corepin
100%
OpenAI
0%
법인등록번호58건
Corepin
100%
OpenAI
0%
외국인등록번호59건
Corepin
100%
OpenAI
0%
여권번호85건
Corepin
100%
OpenAI
0%
운전면허번호68건
Corepin
100%
OpenAI
0%
건강보험증136건
Corepin
100%
OpenAI
0%
차량번호61건
Corepin
100%
OpenAI
0%
IP 주소81건
Corepin
100%
OpenAI
0%
회사명·기관명신규건
Corepin
84%
OpenAI
0%
금액신규건
Corepin
81%
OpenAI
0%

관대 채점 — 가장 큰 격차는 한국인 이름

구간 탐지만 봐도 기초 모델은 한국어 고유 이름의 약 44%를 놓칩니다. 실제 인명 5,309명 학습으로 격차 해소 (+44pt).

한국인 이름2,686건
Corepin
99.9%
OpenAI
55.4%
날짜·생년월일666건
Corepin
100%
OpenAI
60.9%

기초 모델이 이미 강한 영역 — 남은 5~7pt 마무리

보편 숫자·패턴을 기초 모델이 이미 잘 탐지. Corepin 모델은 남은 격차를 채우고 올바른 한국 카테고리 이름까지 부여합니다(주민번호를 account_number가 아닌 kr_rrn으로).

주소589건
Corepin
100%
OpenAI
93.1%
전화번호1,099건
Corepin
100%
OpenAI
95.8%
이메일779건
Corepin
100%
OpenAI
99.7%
웹 주소(URL)81건
Corepin
100%
OpenAI
92.5%

비고 · 본 비교의 "OpenAI" 는 OpenAI가 2026년 4월 공개한 OpenAI Privacy Filter (오픈소스 PII 분류 모델) 와의 비교입니다. ChatGPT(GPT-4/5 계열 LLM)와의 비교가 아닙니다 — Corepin과 같은 PII 추출 전용 분류기끼리의 직접 비교예요.

상세 벤치마크 전체 보기 →
독립 검증 · 14,195문장

학습 분포 밖 14,195건 별도 시험지
v1.3 전량 재검증 — 오탐 0건.

자체 시험지 99.97점은 학습 분포와 평가 분포가 같다는 한계가 있습니다. K-PII-Masking-300K 는 Corepin이 자체 구축한 한국 개인정보 마스킹 비공개 평가 셋으로, 학습과 완전히 분리해 만든 14,195문장 합성 평가 묶음입니다. 1,251개 동음이의어 함정과 481명+ 공인 본명(시사 인물 변화에 맞춰 지속 갱신)으로 인명 과탐을 정밀히 검사합니다. v1.3은 이 시험지 전량을 고객이 실제 호출하는 API 경로 그대로 재검증합니다 — 탐지율 99.99%·오탐 0건.

측정 항목 OpenAI
2026 출시 기초 모델
Corepin v1.3
2026-08-17 · 현재 가동 · 실서비스 경로 전량 재검증
탐지율 (재현율)
실제 개인정보를 놓치지 않은 비율 — 놓친 표본 14,195건 중 2건
88.6% 99.99%
엄격 채점 정답률
분류·경계 문자까지 완전 일치해야 정답 — 가장 보수적인 눈금
60.3% 98.6%
일반어 오탐률
“박수가 자연스럽”의 “박수가”를 인명으로 잘못 태그하는 비율 — 낮을수록 좋음
24.0% 0.00%
공인 본명 오탐률
손흥민·정국·이순신 등 481명+ · 시사 인물 변화에 맞춰 지속 갱신 — 낮을수록 좋음
22.8% 0.00%
한국인 이름 정답률
이름이 든 표본 10,259건에서 완전 일치
52.4% 99.4%
운전면허번호 정답률
분류 라벨까지 일치
0.0% 100.0%
차량번호 정답률
분류 라벨까지 일치
0.0% 100.0%

v1.0은 오픈소스 기초 모델에서 새로 시작해 K-PII-Masking-300K 학습용 178천 문장 + 자체 합성 45천 문장 통합 데이터로 5 회차에 걸쳐 학습 — 14,195 평가 묶음에서 99.99% 도달. v1.1은 두 가지 새 카테고리(회사명·기관명, 금액)를 더하고 같은 평가 묶음에서 100.00%. 자체 합성 시나리오에 입찰공고번호·과제관리번호·파일 ID·정부 사업 공고문 표 머리글 같은 실 운영 환경의 함정 패턴 188종을 부정 학습으로 추가해, 이름 과탐 사례를 사용자 제보 기반으로 직접 흡수했습니다. v1.3(2026-08-17)부터는 측정 방식을 바꿨습니다 — 오프라인 모델 단독 채점이 아니라, 고객이 실제 호출하는 API 경로 그대로 14,195건 전량을 재검증합니다. 채점 기준이 달라 과거 버전의 점수와는 직접 비교되지 않습니다. 위 표의 엄격 채점에서 정답이 아닌 1.4%는 놓침이 아니라 필요한 것보다 넓게 가리는(과보호) 경계 차이가 대부분이며, 실제 놓침은 14,195건 중 2건입니다. 공인 본명 명단은 시사 인물 변화에 맞춰 지속 갱신합니다.

라이브 데모

넣어보면,
바로 보여요.

아래는 공개 데모 키로 돌아가는 실제 API예요. 개발 시에는 https://api.corepin.ai/v1/pii/redact 로 보내면 됩니다.

입력
결과
지금 바로 시작

여러분 데이터로
직접 확인해보세요.

Corepin 계정 하나로 이 모델과 앞으로 나올 모든 모델을 함께 써요. 가입하면 API 키가 바로 발급됩니다.