목표: LLM 응답의 안전·신뢰를 코드로 보장. 특히 출력 grounding 하드 강제(모델이 프롬프트 규칙을
어겨도 못 막는 현 상태 보완)와 화장품 의학적 주장 필터. 프로덕션 LLM 필수 기둥(현재 미착수).
관련: 온라인 모니터링(#38 — 가드 트리거를 신호로), 생성 프롬프트 grounding 규칙(v4/v6).
0. 배경
- 현재 grounding은 프롬프트 규칙에만 존재(“공급된 제품만 추천”) → 모델이 어기면 못 막음(하드 가드 없음).
- 화장품은 의학적/치료 주장 금지(법적·안전 리스크)인데 필터 없음.
- 입력 인젝션·오프토픽·PII 무방비.
1. 위협/정책 (G0에서 확정)
- 출력: ① 미공급 제품/성분 언급(hallucination) ② 근거 과장(paper 수 초과) ③ 의학적 주장(치료·완치·질병) ④ 부적절/유해.
- 입력: ① 프롬프트 인젝션 ② 오프토픽/탈옥 ③ PII.
2. 핵심 설계
- grounding 하드 가드(결정론적·핵심): 응답의 제품/성분명이 그 요청에 공급된 목록의 부분집합인지 코드로 검증(문자열 매칭). 이미
recommend()에 공급 목록이 있음 → 싸고 sync 가능, 최고 ROI.
- 의학적 주장 필터: 규칙(사전/정규식) 우선 + 모호하면 경량 분류.
- 입력 가드: 규칙/경량 분류(인젝션 패턴·오프토픽), PII 마스킹.
- 위반 시 동작: 차단 / 재생성 / 폴백 / 플래그(모니터). sync 차단 vs async 플래그 트레이드오프.
- 성능: LLM 기반 가드는 latency↑ → 규칙/결정론 우선, LLM 판정은 최소·비동기.
3. 필요 조건
4. 구현 계획 (phase gate)
5. 측정 & 게이트
- 가드 트리거율(유형별), 오탐(정상 차단) precision/recall(과차단이 진짜 리스크), 추가 latency.
- 게이트: 가드가 정상 응답을 유의미하게 안 막을 것(오탐 낮게) + grounding 위반 실측 0에 수렴.
6. 연결/범위
0. 배경
1. 위협/정책 (G0에서 확정)
2. 핵심 설계
recommend()에 공급 목록이 있음 → 싸고 sync 가능, 최고 ROI.3. 필요 조건
4. 구현 계획 (phase gate)
5. 측정 & 게이트
6. 연결/범위