Skip to content

가드레일 / 안전 — 입력·출력 방어 (grounding 하드 강제·의학적 주장 필터) #39

Description

@likell1

목표: LLM 응답의 안전·신뢰를 코드로 보장. 특히 출력 grounding 하드 강제(모델이 프롬프트 규칙을
어겨도 못 막는 현 상태 보완)와 화장품 의학적 주장 필터. 프로덕션 LLM 필수 기둥(현재 미착수).
관련: 온라인 모니터링(#38 — 가드 트리거를 신호로), 생성 프롬프트 grounding 규칙(v4/v6).

0. 배경

  • 현재 grounding은 프롬프트 규칙에만 존재(“공급된 제품만 추천”) → 모델이 어기면 못 막음(하드 가드 없음).
  • 화장품은 의학적/치료 주장 금지(법적·안전 리스크)인데 필터 없음.
  • 입력 인젝션·오프토픽·PII 무방비.

1. 위협/정책 (G0에서 확정)

  • 출력: ① 미공급 제품/성분 언급(hallucination) ② 근거 과장(paper 수 초과) ③ 의학적 주장(치료·완치·질병) ④ 부적절/유해.
  • 입력: ① 프롬프트 인젝션 ② 오프토픽/탈옥 ③ PII.

2. 핵심 설계

  • grounding 하드 가드(결정론적·핵심): 응답의 제품/성분명이 그 요청에 공급된 목록의 부분집합인지 코드로 검증(문자열 매칭). 이미 recommend()에 공급 목록이 있음 → 싸고 sync 가능, 최고 ROI.
  • 의학적 주장 필터: 규칙(사전/정규식) 우선 + 모호하면 경량 분류.
  • 입력 가드: 규칙/경량 분류(인젝션 패턴·오프토픽), PII 마스킹.
  • 위반 시 동작: 차단 / 재생성 / 폴백 / 플래그(모니터). sync 차단 vs async 플래그 트레이드오프.
  • 성능: LLM 기반 가드는 latency↑ → 규칙/결정론 우선, LLM 판정은 최소·비동기.

3. 필요 조건

  • 정책·금지어/패턴 목록(의학적 주장·인젝션) 정의.
  • grounding 가드용 공급 목록 접근(이미 있음).
  • 가드 오탐 평가셋(정상 응답을 잘못 막지 않는지).

4. 구현 계획 (phase gate)

  • G0. 위협모델·정책 확정.
  • G1. 출력 grounding 하드 가드(결정론적) + 위반 메트릭 + 동작(차단/재생성).
  • G2. 의학적 주장·부적절 출력 필터(규칙+경량).
  • G3. 입력 가드(인젝션·오프토픽·PII).
  • G4. 트리거율 측정 + 오탐 eval(정상 응답 과차단 없나).

5. 측정 & 게이트

  • 가드 트리거율(유형별), 오탐(정상 차단) precision/recall(과차단이 진짜 리스크), 추가 latency.
  • 게이트: 가드가 정상 응답을 유의미하게 안 막을 것(오탐 낮게) + grounding 위반 실측 0에 수렴.

6. 연결/범위

Activity

Sign up for free to join this conversation on GitHub. Already have an account? Sign in to comment

Metadata

Metadata

Assignees

No one assigned

    Labels

    No labels
    No labels

    Type

    No type

    Projects

    No projects

      Milestone

      No milestone

      Relationships

      None yet

      Development

      No branches or pull requests

      Issue actions