ToolNavs 유용한 AI 도구 찾기
도구 제출 로그인
돌아가기 AI 정보
vLLM, 무왜곡 텍스트 워터마킹 탑재… 모델 출력 출처 추적 가능, 속도 저하는 거의 없어

vLLM, 무왜곡 텍스트 워터마킹 탑재… 모델 출력 출처 추적 가능, 속도 저하는 거의 없어

AI 정보 • Admin • • 10 회 조회

vLLM이 2026년 9월 24일 공식 블로그에서 추론 엔진에 Gumbel-max 기반 텍스트 워터마킹 기능이 정식으로 탑재됐다고 발표했다. 목표는 명확하다. 모델이 생성한 텍스트의 출처를 추적 가능하게 만드는 것. 게다가 워터마킹을 넣어도 모델의 출력 분포는 바뀌지 않고 추론 속도도 떨어지지 않는다. 공식 실측에 따르면 Qwen3.5-27B에서 워터마킹을 켜도 각종 벤치마크 점수는 오차 범위 안에 머물렀고, 처리량 변화는 −1.1%~+2.0%로 사실상 무시할 수준이다.

워터마킹의 원리: "랜덤"에 표시를 남긴다

언어 모델은 토큰 하나를 생성할 때마다 먼저 각 후보 토큰을 채점한 뒤 무작위로 샘플링한다. 워터마킹의 아이디어는 텍스트를 건드리는 게 아니라 "무작위" 단계에 표시를 남기는 것이다. 비밀키, 최근 컨텍스트 토큰, 후보 토큰의 ID를 의사난수 함수에 통과시켜 재현 가능한 난수값들을 계산하고, 이를 logits에 Gumbel 노이즈로 더한 뒤 최댓값에 해당하는 토큰을 선택한다.

핵심 수학적 성질은 이렇다. Gumbel 노이즈에 대한 argmax는 원래 확률 분포에서의 일반 샘플링과 정확히 동등하다. 즉 어느 한 단계만 보면 워터마킹 유무에 따라 해당 토큰이 선택될 확률은 완전히 동일하다. 출력 분포가 왜곡되지 않고, 모델이 특정 단어나 문체를 체계적으로 선호하지도 않는다. 키를 가진 쪽은 당시의 난수값을 재계산할 수 있고, 키가 없는 사람에게는 그저 평범한 무작위 샘플링으로 보인다.

탐지는 역산 검증

탐지에는 모델 가중치나 logits이 필요 없고, 비밀키와 토크나이저만 있으면 된다. 검사 대상 텍스트를 토큰 ID로 되돌린 뒤, 각 토큰에 대해 그 앞의 컨텍스트와 키로 의사난수값을 재계산한다. 워터마킹이 없는 텍스트라면 이 값들은 균일 무작위, 워터마킹된 텍스트라면 선택된 토큰들이 체계적으로 더 큰 값 쪽으로 치우친다. 각 토큰의 점수를 합하면 감마 분포를 따르므로 p값을 계산할 수 있다. p값이 작을수록 "우연"일 가능성은 낮다.

텍스트가 길고 정보 엔트로피가 높은 단계가 많을수록 신호는 강해진다. 창작 글쓰기라면 약 100 토큰으로 거의 100%에 가까운 탐지율에 도달한다. 문장 전체를 복사·붙여넣기해도 증거는 지워지지 않고, 부분 개작은 편집 부근 토큰의 점수를 흔들지만, 편집이 컨텍스트 윈도우를 벗어나면 나머지 신호는 온전하다.

두 개의 난관: 추론적 디코딩과 다양성

논문을 돌아가는 엔진으로 만드는 과정에서 vLLM은 두 개의 난관을 해결했다. 첫째는 추론적 디코딩(speculative decoding)이다. 드래프트 모델과 타깃 모델이 같은 워터마킹을 쓰면 두 분포의 겹침이 줄어 수락률(acceptance rate)이 떨어진다. vLLM의 해법은 듀얼 키(PR #56122)다. 수락된 드래프트 토큰은 하나의 키로, 타깃 모델의 잔차·보너스 토큰은 다른 키로 처리해 수락률을 지킨다. 대가는 탐지 시 두 키의 점수를 합산해야 하므로 신호가 희석된다는 점이다.

둘째는 출력 다양성이다. 토큰 단위 무왜곡은 "어느 한 단계"의 분포만 보장할 뿐 전체 시퀀스의 분포는 보장하지 않는다. 어떤 컨텍스트가 반복되면 고정된 키가 같은 난수값을 내어 모델이 무한 반복의 수렁에 빠질 수 있다. vLLM은 "생성 시 컨텍스트 중복 제거"(PR #56233)로 해결했다. 컨텍스트가 반복되면 워터마킹을 건너뛰어 시퀀스 레벨 무왜곡을 지키고, 실측 엔드투엔드 처리량 하락은 최대 0.19%였다.

엔지니어링 구현 측면에서는 워터마킹이 Model Runner v2의 샘플링 파이프라인에 직접 연결됐고(PR #54053), 의사난수 생성·Gumbel 변환·argmax가 단일 GPU 커널로 융합돼 거대한 임시 VRAM 오버헤드를 피했다.

누가 먼저 쓰게 될까

첫 수혜자는 vLLM을 셀프 호스팅하는 사업자와 기업이다. 외부에 API를 제공할 때 출력에 검증 가능한 "출생 증명서"를 찍을 수 있다. 출처 추적, 컴플라이언스 기록, 자사 모델과 위장 서비스 구분에 쓸 수 있다. 한계도 분명히 해야 한다. 탐지는 키 보유에 의존해 공개 검증이 안 되고, 짧거나 틀에 박힌 출력은 신호가 약하다. 막을 수 있는 건 "출처 부인"이지, 작심하고 개작하는 상대는 막을 수 없다.

텍스트 출처 추적은 오래전부터 얘기돼 왔지만, vLLM은 이를 추론 엔진 안의 스위치 하나로 만들었다. 무왜곡, 저오버헤드, 실제 운용 가능. 이 한 걸음 뒤에 "AI 생성 콘텐츠는 추적 가능해야 하는가"라는 논쟁은 적어도 기술적으로는 변명 하나를 덜게 됐다.

추천 도구

더보기