Project Beacon은 2026년 10월 9일 Baseten이 공식 블로그에서 발표한 프로젝트로, 파트너는 Goodfire AI다. 목표는 사전 예방적 안전 제어를 오픈 모델 추론 과정 자체에 넣는 것이다. 출력 뒤에 텍스트 필터를 거는 방식이 아니라, 생성 도중 모델의 내부 활성화를 읽어 프로브로 진행 중인 위험 사건을 포착하고, 내용이 사용자나 도구에 닿기 전에 조치한다.
주시하는 네 가지 위험
Baseten이 꼽은 추론 계층 위험에는 문서나 도구 반환값에 숨어 에이전트를 다른 방향으로 끌려는 프롬프트 주입, 사용자나 조직이 허가한 범위를 넘는 행동을 에이전트가 제안하는 경우, 고객이나 회사의 민감 정보가 있어선 안 될 곳에 나타나는 경우, 보안 민감 워크플로에서의 사이버 오용 조짐이 있다. 위험마다 필요한 대응이 다르기 때문에 Beacon은 Goodfire가 특정 행동별로 개발한 모니터 신호를, 애플리케이션이 어떻게 반응할지 결정하는 Baseten의 시스템에 연결한다. 사람의 승인을 요청하거나, 거부하거나, 다른 방안으로 대체하거나, 관리자 검토용으로 기록만 남기는 선택이 가능하다.
모니터링이 생성과 병행되는 이유
구조상 활성화 기반 모니터와 텍스트 모니터가 각 요청을 동시에 분류하고, 둘의 의견이 갈릴 때만 프론티어 모델이 판정에 나선다. 모니터링은 생성과 병행해 돌아가며 응답을 막지 않는다. 기업 고객에게는 중앙에서 적용할 수 있는 안전 기준선, 워크로드별로 조정 가능한 정책, 무엇이 표시됐고 어떻게 처리됐는지에 대한 기록이 계획돼 있다. 개발자에게는 안전 이벤트와 제어가 추론에 쓰는 것과 같은 API와 도구로 전달된다. 제시된 예도 구체적이다. 결제 분쟁을 처리하는 에이전트는 가맹점 메시지와 계정 기록을 읽는데, 악성 내용이 이를 다른 방향으로 끌 수 있고, 잘못된 행동은 데이터 노출이나 송금으로 이어질 수 있다. 또 다른 대형 모델로 모든 단계를 검토하는 방식은 비용과 지연 면에서 규모를 감당할 수 없다.
앞으로 몇 달 동안 Beacon의 기능은 선정된 모델과 모니터링 대상 행동부터 시작해 기업 제어와 개발자 경험으로 확장되고, 먼저 소수의 초기 파트너를 통해 시장에 나온다. 오픈 모델로 에이전트를 만드는 팀에게 이번 업데이트의 신호는 분명하다. 안전 점검은 덧붙이는 필터에서 추론 인프라 자체의 일부로 이동하고 있고, 추론 플랫폼을 비교할 때 모니터링 신호를 자체 정책에서 직접 호출할 수 있는지가 가격, 속도와 함께 비교 항목이 될 것이다.