"이 텍스트에 주민번호 들어있어?"
하루에 수백 번 묻게 되는 그 질문.
ChatGPT에 사내 자료를 붙여넣기 전, 상담 로그를 분석에 넘기기 전, 학습 데이터셋을 만들 때 — 매번 검사해야 합니다. 사람이 다 보긴 양이 너무 많고, 정규식은 인명·주소를 놓쳐요.
외부 AI에 사내 텍스트 보내기 전 — 본문에 주민번호 한 줄만 따라가도 개인정보보호법 §24-2 위반이에요. 매 호출마다 사람이 검수할 수 없고, 정규식은 인명·주소 같은 비정형 정보를 놓칩니다.
상담 로그를 분석에 쓰기 전 — BI·분석 파이프라인으로 넘기기 전, 이름·전화·주민번호만 정확히 골라 가려야 합니다.
Corepin은 그 사이에 들어갑니다. 한국 PII 17가지로 학습한 v1.0 모델을 API 한 번으로 호출하면 끝. 국내 데이터센터에서만 처리하고, 본문·결과 모두 저장하지 않아요.
20년 정규식 시대의 끝,
이제 AI가 맥락으로.
가이드북은 입출력 필터링을 기본 통제로 두되, 금지어 차단 같은 단순 필터가 아니라 민감정보 입력 차단·비정상 패턴 탐지를 포함한 다층 통제를 권고합니다. 개인정보·내부 자료가 프롬프트로 들어가는 순간을 입력 단계에서 차단하라는 요구입니다.
한국 개인정보 필터 시장은 20년 넘게 정규식과 키워드 사전에 머물러 있었어요. 패턴이 맞으면 차단, 아니면 통과 — 시장의 "AI PII" 마케팅도 뜯어보면 같은 패턴 매칭 위에 룰 추천만 얹은 형태죠. Corepin은 한국 PII 19 카테고리를 직접 학습한 한국어 특화 AI 모델로 패턴에 없는 인명·주소·회사명·금액·문장 의도까지 잡습니다. 가이드북이 말한 '단순 필터가 아닌 다층 통제', 한국 개인정보 영역에서 실제로 충족하는 모델이에요.
| 구분 | 정규식·룰베이스사내에서 정규식·사전 으로 직접 매칭 |
외부 LLM APIChatGPT·Claude 같은 범용 LLM으로 처리 |
Corepin 개인정보 필터한국 19 카테고리 전용 학습된 한국형 개인정보 필터 v1.3 |
|---|---|---|---|
| 도입 시간 | 2 ~ 4주 패턴 작성·예외 처리·테스트 |
1 ~ 2주 프롬프트·가드레일 통합 |
호출 한 번 키 발급 즉시 사용 |
| 한국어 정확도 | 패턴은 정확, 비정형 약함 인명·주소·기업명 같이 정형이 아닌 PII 못 잡음 |
중간 한국 주민번호 체크섬·법인번호 같은 한국 패턴 실수 잦음 |
탐지율 99.99% · 오탐 0건 19 카테고리 한국 개인정보 전용 학습 — 14,195건 별도 평가 전량 재검증 (v1.3) |
| 인명 과탐 | 심함 "김치", "한강" 같은 동음이의어를 인명으로 오탐 |
중간 공인 본명도 매번 마스킹하거나 일반 단어를 인명으로 오탐 |
오탐 0건 3,682 동음이의어 + 1,222 공인 본명 평가에서 0% — 공인 명단은 시사 인물 변화에 맞춰 지속 갱신 |
| 데이터 처리 | 회사 내부 로컬 처리, 안전 |
해외 클라우드 개인정보보호법 §24-2 고유식별정보를 외부로 보내는 자체가 위반 위험 |
국내 데이터센터 국외 이전 없음, 본문·결과 미저장 |
| 한국 카테고리 | 패턴 가능한 것만 | 일반 라벨로 통합 | 17가지 분리 kr_rrn, kr_biz_no, kr_passport 등 한국 전용 9가지 + 해외 표준 8가지 |
| 비용 | 유지보수 부담 패턴 추가·예외 처리 계속 필요 |
토큰당 변동 대량 호출 시 누적 |
정액 통합 청구 Free → Starter → Business → Enterprise |
이런 경우에 잘 맞아요: 외부 AI로 사내 텍스트를 보낼 때, 사용자가 자유롭게 입력하는 텍스트를 받을 때, 한국어 비정형 PII(인명·주소·기업명)까지 정확히 가려야 할 때. 개인정보보호법 §24-2 고유식별정보 9가지가 모두 분리 라벨로 출력되어 컴플라이언스 보고에도 그대로 쓸 수 있어요.
해외 필터가 못 잡는
한국 개인정보.
해외에서 만든 일반 개인정보 필터는 영어권 보편 카테고리 8개로 학습되어 있어, 한국 특유의 식별번호나 한국어 우회 패턴은 커버리지 밖입니다. Corepin 필터가 이 간극을 메웁니다.
주민번호·사업자번호는 카테고리 외 영역
주민등록번호 900101-1234567
사업자등록번호 220-81-62517
공백 삽입 우회를 학습 데이터에 포함 → 인식 성공
기초 모델은 공인/일반인 구분 학습이 없음
개인정보보호법 기준으로
정확히 나눴어요.
분홍 배경 5가지는 개인정보보호법 §24-2 고유식별정보 — 처리할 때 별도 동의와 암호화가 필요합니다. Corepin은 모든 사용자 텍스트 추론을 대한민국 국내 데이터센터에서만 처리하며, 데이터의 국외 이전 없이 개인정보보호법 를 준수합니다.
이름
한국/외국 인명, 부분 익명(김○○) 포함
주소
도로명/지번/아파트/우편번호
이메일
이메일 주소
전화번호
휴대전화/유선전화/국제번호
URL
개인 식별 가능한 URL
날짜
생년월일, ISO/한국식 날짜
계좌·카드번호
은행 계좌, Luhn 카드번호
비밀정보
API 키, 토큰, 비밀번호
주민등록번호
개인정보보호법 §24-2 고유식별정보 — 13자리 체크섬
개인정보보호법 §24-2외국인등록번호
개인정보보호법 §24-2 고유식별정보
개인정보보호법 §24-2여권번호
개인정보보호법 §24-2 고유식별정보 (M12345678 등)
개인정보보호법 §24-2운전면허번호
개인정보보호법 §24-2 고유식별정보
개인정보보호법 §24-2사업자등록번호
10자리 NTS 체크섬
법인등록번호
13자리 법인등록번호
건강보험증번호
건강보험 가입자번호
개인정보보호법 §24-2차량번호
신/구 형식 자동차 번호판
IP 주소
IPv4/IPv6 주소
회사명·기관명
KOSPI/KOSDAQ 상장 종목 + 정부·금융·의료·교육 주요 기관
금액
원·만·억·₩·KRW·$·USD·€·¥·£·약식 11종 표기
이런 디테일까지
— 한국 개인정보만의 함정.
한국 개인정보보호법이 특별히 엄격하게 다루는 "고유식별정보"와 일상 한국어 대화 관습을 함께 고려한 설계 결정들입니다.
한국 고유식별정보 전부 커버
개인정보보호법이 별도로 엄격하게 관리하는 주민번호·여권·운전면허·외국인등록·법인·사업자등록번호를 모두 독립 카테고리로 학습.
가명정보 가이드라인 준수
개인정보보호위원회 가명정보 처리 가이드라인을 기반으로 카테고리 선정. 탐지 후 부분 마스킹·치환·삭제 정책에 유연하게 연결됩니다.
5,309명의 실제 한국 이름
한국어 공개 뉴스 데이터에서 실제 인명 5천 명 이상을 추가로 학습해 인공적 분포에 갇히지 않도록 보강.
유명인 약 200명 예외 처리
"김연아 은퇴식 봤어?" 같은 자연스러운 대화가 마스킹되지 않도록 스포츠·연예·역사·정치 약 200명을 예외 목록으로 학습.
일반명사 과탐 방지
"김치찌개", "박사학위", "최고의" 같은 일반명사가 성씨와 같은 음절로 시작해도 탐지하지 않도록 150개 이상의 예외 템플릿을 학습.
13가지 실전 문서 포맷
회원가입 폼·고객 상담·의료 기록·금융 거래·개발 로그·메신저·이메일·계약서·행정 서식·이력서·SNS·회의록·우회 시도를 모두 학습.
필터 우회 시도까지,
미리 학습해 둔 모델.
AI 필터를 피하기 위해 숫자 사이에 공백을 넣거나, 전각 숫자로 바꾸거나, 한글로 풀어쓰는 9가지 우회 패턴을 학습 데이터에 포함시켰습니다.
공백 삽입
전각 숫자 치환
한글 수사 풀어쓰기
유니코드 대시 치환
제로폭 문자 삽입
구분자 대체
HTML 엔티티
중간 주석 삽입
줄바꿈 삽입
작고 빠른 기초 모델 위에
한국 19 카테고리를 얹었어요.
대형 LLM 대신 한국어 개인정보 한 가지에만 집중하는 작은 모델을 골랐어요. 실시간 처리가 가능할 만큼 가볍고, 한국 환경에 맞게 다시 가르치기 쉬운 구조입니다. Corepin 필터는 이 기반 위에 한국 맥락을 얹은 결과예요.
가벼운 모델실시간 처리 가능
대형 LLM 대비 훨씬 작은 크기. 저가 그래픽 카드 한 장이나 노트북에서도 실시간으로 돌아가요.
긴 문서 한 번에한 호출로 끝
이메일, 계약서, 의료 기록 같은 긴 문서도 쪼개지 않고 한 번에 처리해요. 일반 LLM보다 훨씬 긴 입력을 그대로 받습니다.
한 번에 분류생성형 LLM보다 빠름
답을 한 글자씩 만들어내는 일반 LLM과 달리, 문장 전체를 한 번에 검사해서 결과를 돌려줘요. 같은 크기 LLM 대비 수십 배 빠른 처리량.
앞뒤 맥락 동시에문맥 기반 탐지
단어마다 앞뒤 문맥을 동시에 참고해서 판단해요. 패턴 매칭이 아닌 문맥 기반 탐지라 형식이 변해도 의미를 잃지 않습니다.
깔끔한 경계 인식정확한 구간 잡기
개인정보의 시작·끝을 깔끔하게 잡아내요. 토큰 잡음 대신 의미 단위로 정돈된 구간을 돌려줍니다.
국내 자체 운영상업 이용 허용
오픈 라이선스 기반이라 자체 인프라에서도 운영 가능. 운영 환경에서는 국내 데이터센터에서만 처리하므로 민감 데이터가 외부로 전송되지 않아요.
기반 위에 우리가
더한 것들.
기초 모델의 빠른 처리 능력은 그대로 유지한 채, 출력 카테고리만 17가지로 확장하고 한국어 실전 문장 5만 건과 우회 패턴 9종을 학습했습니다. 속도와 효율은 그대로, 한국 커버리지만 대폭 늘어났습니다.
한국 고유식별정보 9개
주민등록번호·외국인등록번호·여권·운전면허·사업자·법인·건강보험증·차량번호·IP. 개인정보보호법 §24-2 "고유식별정보" 전부 독립 카테고리로 학습.
실제 한국 이름 5,309명
한국어 공개 뉴스 데이터에서 실제 인명 5천 명 이상을 학습 데이터에 포함. 인공 분포에 갇히지 않고, 실제 한국 이름 다양성을 흡수.
유명인 예외 약 200명
스포츠·연예·역사·정치 인물 약 200명을 명시적 예외로 학습. "김연아 은퇴식 봤어?"가 마스킹되지 않음. 동명이인 일반인은 여전히 탐지.
우회 차단 9가지
공백 삽입·전각 숫자·한글 수사·유니코드 대시·제로폭 문자·구분자 대체·HTML 엔티티·중간 주석·줄바꿈. 사용자가 우회하려 할 때도 탐지.
실전 문서 포맷 13가지
회원가입 폼·고객 상담·의료 기록·금융 거래·개발 로그·메신저·이메일·계약서·행정 서식·이력서·SNS·회의록·우회 시도. 실제 업무 맥락을 광범위하게 포함.
학습 데이터 50,000문장
실제 한국인 데이터를 직접 사용하지 않고, 체크섬이 유효한 가공 식별번호만 생성해 학습. 개인정보보호법이 금지하는 실데이터 사용 없이 고품질 확보.
수많은 시행착오를 거쳐
강화해 왔습니다.
한국어 실전 텍스트의 미묘한 패턴들은 한 번에 잡히지 않았습니다. 9차례에 걸친 미세 조정으로 한국어 인명·주소·동음이의 함정을 끈질기게 분석하고 각 문제를 하나씩 공략하면서 다듬어왔어요. v0.1~v0.5는 자체 시험지 99.97%로 완성, v0.7~v1.0은 외부 데이터로의 일반화 능력을 끌어올린 단계로 production 수준에 다다랐습니다.
기반 구축 — 한국 식별번호 전용 카테고리 확보
주민등록번호·외국인등록번호·여권·운전면허·사업자·법인·건강보험증·차량번호·IP를 모두 독립 카테고리로 학습.
견고성 — 우회 시도 차단 능력 확보
공백·전각 숫자·한글 수사·특수 대시·보이지 않는 문자 등 9가지 변형 패턴을 학습 데이터에 명시적 포함.
과탐 억제 — "김치찌개"를 이름으로 오탐하던 문제
일반명사 + 조사 결합("김치찌개를", "박사학위", "최고의 선택") 150여 개를 명시적 예외 문장으로 학습.
UX 개선 — 유명인 언급이 일상 대화에서 마스킹되던 문제
정치인·운동선수·연예인·역사 인물 약 200명을 별도 예외 목록으로 관리.
업무 문장 — 문장 중간 이름이 연속으로 나올 때 놓치던 문제
"김태영 사원이 보고서를 제출했고, 박소연 대리가 검토했다" 같은 구조에서 두 이름 모두 정확히 탐지.
혼합 이름 + 부분 마스킹 + 균형 회복
한국+외국 혼합 이름("Alex Kim 이사님"), 부분 가린 이름("김○○"), 주소·차량번호 성능 회귀를 모두 해결. 자체 시험지 정답률 99.97%로 도달.
K-PII-Masking-300K 1차 통합 — 분포 갭의 발견
자체 시험지 99.97%여도 별도 14,195문장 평가 묶음에서는 78.6%에 머물렀습니다. 학습 분포와 평가 분포의 차이가 만든 21점 격차. 별도 학습 셋 일부를 자체 합성과 혼합해 1 회차 추가 학습 — 별도 시험지 78.6 → 99.2로 도약.
K-PII-Masking-300K 학습 비중 확대 — 잔여 케이스 보완
v0.7에서 남은 일부 별도 평가 케이스(특히 동음이의어 함정과 공인 본명 영역)를 잡기 위해 K-PII-Masking-300K 학습 비중을 확대 적용.
외부 일반화 완성 — 양쪽 시험지 모두 99.97%급
오픈소스 기초 모델에서 새로 시작해 한국어 개인정보 합성 데이터 22.3만 문장으로 5 회차에 걸쳐 학습. 자체 시험지 99.97%를 그대로 유지하면서 외부 14,195 평가 묶음에서도 99.99% 도달. 동음이의어 함정 3,682건과 공인 본명 1,222건 오탐 0건.
회사명·금액 두 카테고리 확장 + 실 운영 함정 흡수
v1.0의 정확도를 그대로 유지하면서 두 가지 새 카테고리를 더했습니다 — 회사명·기관명(KOSPI/KOSDAQ 상장 2,770종 + 정부·금융·의료·교육 주요 기관 240종)과 금액(원·만·억·₩·KRW·$·USD·€·¥·£·약식 11종 표기). 동시에 사용자 제보로 들어온 실 운영 환경의 함정 패턴 — 입찰공고번호·과제관리번호·파일 ID·정부 사업 공고문 표 머리글 188종 — 을 부정 학습으로 흡수해 이름 과탐을 직접 해소. 학습 데이터 23.8만 문장(K-PII-Masking 17.8만 + 자체 합성 6.0만). 같은 14,195 평가 묶음에서 100.00%로 미세 상향.
탐지 견고성 지속 보강 (단계적 적용 중)
한국어 실전 텍스트의 까다로운 표현·문서 구조에 대한 탐지 안정성을 계속 다듬고 있습니다. 정확도 회귀 없이 내부 검증을 통과한 개선만 무중단으로 단계 적용합니다.
문맥 판단 강화 + 실서비스 기준 전량 재검증(현재 가동)
이름·회사명처럼 문맥으로 판단해야 하는 실무 문서 표기의 탐지력을 높였습니다. 동시에 검증 눈금을 바꿨습니다 — 오프라인 채점 대신 14,195 평가 묶음 전량을 고객이 실제 호출하는 API 경로 그대로 재검증합니다(채점 기준이 달라 과거 버전 점수와 직접 비교되지 않습니다). 탐지율(재현율) 99.99%, 동음이의어 함정 3,682건·공인 본명 1,222건 오탐 0건. 공인 본명 명단은 시사 인물 변화에 맞춰 지속 갱신합니다.
한국 운영 환경에서,
비교할 수 없는 격차.
학습에 쓰지 않은 2,000개 한국어 합성 문장(자기소개·계약서·의료기록·이메일·업무 채팅·정부 서식 등 13개 시나리오)에서 측정한 결과.
엄격 채점 — 기초 모델이 0점 받는 9개 카테고리
기초 모델은 한국 전용 카테고리 자체를 가지고 있지 않기 때문. 구간은 찾아도 이름을 못 붙이므로 엄격 채점에서는 전부 오답 처리.
관대 채점 — 가장 큰 격차는 한국인 이름
구간 탐지만 봐도 기초 모델은 한국어 고유 이름의 약 44%를 놓칩니다. 실제 인명 5,309명 학습으로 격차 해소 (+44pt).
기초 모델이 이미 강한 영역 — 남은 5~7pt 마무리
보편 숫자·패턴을 기초 모델이 이미 잘 탐지. Corepin 모델은 남은 격차를 채우고 올바른 한국 카테고리 이름까지 부여합니다(주민번호를 account_number가 아닌 kr_rrn으로).
비고 · 본 비교의 "OpenAI" 는 OpenAI가 2026년 4월 공개한 OpenAI Privacy Filter (오픈소스 PII 분류 모델) 와의 비교입니다. ChatGPT(GPT-4/5 계열 LLM)와의 비교가 아닙니다 — Corepin과 같은 PII 추출 전용 분류기끼리의 직접 비교예요.
학습 분포 밖 14,195건 별도 시험지
v1.3 전량 재검증 — 오탐 0건.
자체 시험지 99.97점은 학습 분포와 평가 분포가 같다는 한계가 있습니다. K-PII-Masking-300K 는 Corepin이 자체 구축한 한국 개인정보 마스킹 비공개 평가 셋으로, 학습과 완전히 분리해 만든 14,195문장 합성 평가 묶음입니다. 1,251개 동음이의어 함정과 481명+ 공인 본명(시사 인물 변화에 맞춰 지속 갱신)으로 인명 과탐을 정밀히 검사합니다. v1.3은 이 시험지 전량을 고객이 실제 호출하는 API 경로 그대로 재검증합니다 — 탐지율 99.99%·오탐 0건.
| 측정 항목 | OpenAI 2026 출시 기초 모델 |
Corepin v1.3 2026-08-17 · 현재 가동 · 실서비스 경로 전량 재검증 |
|---|---|---|
| 탐지율 (재현율) 실제 개인정보를 놓치지 않은 비율 — 놓친 표본 14,195건 중 2건 |
88.6% | 99.99% |
| 엄격 채점 정답률 분류·경계 문자까지 완전 일치해야 정답 — 가장 보수적인 눈금 |
60.3% | 98.6% |
| 일반어 오탐률 “박수가 자연스럽”의 “박수가”를 인명으로 잘못 태그하는 비율 — 낮을수록 좋음 |
24.0% | 0.00% |
| 공인 본명 오탐률 손흥민·정국·이순신 등 481명+ · 시사 인물 변화에 맞춰 지속 갱신 — 낮을수록 좋음 |
22.8% | 0.00% |
| 한국인 이름 정답률 이름이 든 표본 10,259건에서 완전 일치 |
52.4% | 99.4% |
| 운전면허번호 정답률 분류 라벨까지 일치 |
0.0% | 100.0% |
| 차량번호 정답률 분류 라벨까지 일치 |
0.0% | 100.0% |
v1.0은 오픈소스 기초 모델에서 새로 시작해 K-PII-Masking-300K 학습용 178천 문장 + 자체 합성 45천 문장 통합 데이터로 5 회차에 걸쳐 학습 — 14,195 평가 묶음에서 99.99% 도달. v1.1은 두 가지 새 카테고리(회사명·기관명, 금액)를 더하고 같은 평가 묶음에서 100.00%. 자체 합성 시나리오에 입찰공고번호·과제관리번호·파일 ID·정부 사업 공고문 표 머리글 같은 실 운영 환경의 함정 패턴 188종을 부정 학습으로 추가해, 이름 과탐 사례를 사용자 제보 기반으로 직접 흡수했습니다. v1.3(2026-08-17)부터는 측정 방식을 바꿨습니다 — 오프라인 모델 단독 채점이 아니라, 고객이 실제 호출하는 API 경로 그대로 14,195건 전량을 재검증합니다. 채점 기준이 달라 과거 버전의 점수와는 직접 비교되지 않습니다. 위 표의 엄격 채점에서 정답이 아닌 1.4%는 놓침이 아니라 필요한 것보다 넓게 가리는(과보호) 경계 차이가 대부분이며, 실제 놓침은 14,195건 중 2건입니다. 공인 본명 명단은 시사 인물 변화에 맞춰 지속 갱신합니다.
넣어보면,
바로 보여요.
아래는 공개 데모 키로 돌아가는 실제 API예요. 개발 시에는 https://api.corepin.ai/v1/pii/redact 로 보내면 됩니다.