OpenAI는 미국 CAISI 및 영국 AISI와의 최신 협력 진행 상황을 발표했습니다: ChatGPT 에이전트 및 GPT-5를 중심으로 공동 악 평가 및 엔드투엔드 레드 팀, 주요 취약점 발견 및 수정, 생물 보안 및 제품 보안 스택 반복, "정부×산업" 협업 평가의 새로운 패러다임을 보여줍니다.
1. 요약 정보
1. 협력 레이아웃 및 타임라인
1년 이상 지속된 OpenAI와 CAISI의 모델 보안 평가는 "프록시 보안"으로 확장되었습니다. 영국 AISI와의 생물보안 협력은 5월부터 ChatGPT Agent 및 GPT-5에 대해 모델에서 제품까지 전체 링크를 포괄하는 지속적으로 레드팀으로 진행되었습니다.
2. 키 검색(에이전트 보안)
CAISI는 지난 7월 합동 훈련에서 두 가지 새로운 유형의 취약점을 확인했으며, 이는 특정 조건에서 우회하여 완전한 악용 체인으로 결합될 수 있습니다. OpenAI는 당일 수락하고 영업일 기준 1일 이내에 수리 및 반품을 완료하여 신속한 폐쇄 루프를 형성합니다.
3. 바이오시큐리티 AISI
는OpenAI의 맞춤형 테스트 환경에서 "범용 탈옥" 및 모니터링 취약점에 대한 10개 이상의 세부 보고서를 제출하여 모니터링 스택 및 제품 구성 패치를 촉진하고 악성 콘텐츠 우회 가능성을 줄이고 경고 가시성을 개선했습니다.
2. 중요한 이유
1. "출시 전"에서 "전체 주기"까지의 평가
는 단일 출시 전 검사일 뿐만 아니라 ChatGPT 에이전트 및 GPT-5의 반복적인 지속적인 검증을 동반하여 "발견-수리-재테스트"의 엔지니어링 리즘을 강조합니다.
2. 민관 협력의 심층 모델 정부
연구 기관은 네트워크 보안 및 국가 안보 시나리오에 대한 전문 지식을 제공하고 기업은 시스템 카드 및 프로토타입 환경을 개방하고 양측은 실제 시스템에 대한 기술 합의를 형성하여 업계 보안 기준선을 높입니다.
3. 개발자와 기업에 대한 시사점
에이전트는 라우팅, 이스케이프 방지 및 동작 모니터링을 구축하기 위해 기존 웹/터미널 보안과 병행하여 구축해야 하는 일종의 "조작 가능한 자동화 클라이언트"로 간주됩니다.
3. 랜딩 리스트(직접 적용 가능)
(1) 에이전트 보안 최소 설정
a. 도구 최소화 및 화이트리스트 라우팅
b. 파일 시스템과의 세션 수준 권한 샌드박스 격리
c. 고위험 행동의 2차 확인 및 기록
(2) 레드 팀 및 관찰 가능성
a. "프록시 하이재킹, 프롬프트 주입 및 데이터 유출"의 세 가지 유형의 스크립트 도입
b. 실패 샘플 데이터베이스 구축 및 장면 복원
c. 주요 지표: 가로채기율, 오탐률, 복구 시간
(3) 생물보안 거버넌스
a. 시스템 카드를 참조하여 고기능 도메인의 보호 임계값 설정
b. 검색 및 도구 계층
에 정책 규칙 사전 로드 c. 고위험 요청에 대한 계층적 구현 및 수동 검토
4. AI 팀을 위한 선택 알림
1. 제품 스택
자동화 및 교차 사이트 운영 시나리오의 경우 "시스템 카드 + 외부 평가 기록"(예: ChatGPT 에이전트, GPT-5)를 사용하여 감사 및 규정 준수의 조정을 용이하게 합니다.
2. 프로젝트 스택
CI에 레드 팀 결과 쓰기: 각 버전 업데이트는 탈옥 회귀, 에이전트 도구 권한 회귀 및 콘텐츠 보안 회귀를 트리거합니다.
3.
보안, 법률 업무 및 제품을 구성 및 조정하여 "보안 변경 로그"를 공유하여 발견, 수리 및 재테스트의 추적성을 달성합니다.
자주 묻는 질문(Q&A)
Q: 이번 협력 라운드에서 OpenAI, CAISI 및 AISI는 정확히 무엇을 했습니까?
A: ChatGPT 에이전트와 GPT-5를 중심으로 공동 레드팀 및 시스템 평가를 실시하여 에이전트 수준에서 새로운 취약점을 발견하고 영업일 기준 1일 이내에 수정을 완료하는 동시에 생물보안 모니터링 및 제품 구성 보호를 강화합니다.
Q: ChatGPT 에이전트 또는 GPT-5를 사용하는 팀의 직접적인 가치는 무엇입니까?
A: CAISI와 AISI의 실전 대결 스타일 및 수리 경험을 계승하고 "프록시 하이재킹, 일반 탈옥, 콘텐츠 갈취"와 같은 테스트를 회귀에 통합하여 생산 사고의 위험을 줄일 수 있습니다.
Q: 시스템 카드는 엔지니어링에서 어떻게 사용됩니까?
A: GPT-5 및 ChatGPT Agent의 시스템 카드를 "보안 기능 매뉴얼"로 사용하여 고용량 도메인 임계값, 모니터링 지표 및 비활성화 목록을 실행 가능한 정책 및 테스트 사례로 변환합니다.
Q: 출시 전 침투 테스트만 수행하는 것으로 충분합니까?
A: 충분하지 않습니다. "전체 주기 평가"에 대해서는 이 협력을 참조하십시오: 버전 그레이스케일 - 레드 팀 재등장 - 규칙 구현 - 회귀 검증, 새로운 기능 및 새로운 도구의 공격 표면을 계속 다루십시오.