Anthropic은 여러 라운드에 걸쳐 장기 작동 다중 턴 AI 에이전트를 위한 보다 효과적인 하네스 구조 설계 방법에 관한 기사를 엔지니어링 블로그에 게재했습니다. 팀은 기존 에이전트가 복잡한 프로젝트를 구축할 때 제한된 컨텍스트 창으로 인해 '반쯤 연결이 끊기고 재시작' 현상이 발생하고, 작업이 완료되었다고 잘못 판단해 여러 세션에서 꾸준히 진행하기 어렵게 만든다고 지적했습니다.
이를 위해 본 논문은 Claude Agent SDK에서 "초기화 에이전트 + 코딩 에이전트"의 2단계 해결책을 제안합니다: 초기화 환경에서 처음으로 실행, 상세 기능 목록을 생성, git 저장소 초기화, 진행 로그와 init.sh 스크립트 생성; 이 아티팩트를 읽은 후, 코딩 에이전트는 하나의 열린 기능만 선택하여 구현과 자체 테스트를 완료하고, 코드를 제출한 뒤 환경을 "깨끗한 상태"로 유지하여 언제든지 개발을 계속할 수 있도록 진행 기록을 업데이트합니다.
저자들은 이러한 공학적 제약이 장기 에이전트의 망망증과 이동을 크게 완화해, 일회성 완성 도구가 아닌 프로세스 준수 인간 엔지니어에 더 가깝게 행동하게 만든다고 주장합니다. 현재 실험은 주로 풀스택 웹 애플리케이션 개발을 위한 것이며, 향후 방향으로는 테스트, 품질 보증, 리팩토링과 같은 특수 에이전트 도입과 과학 연구 및 금융 모델링 같은 장기 작업으로 유사한 방법을 확장하는 것이 포함됩니다.
FAQ
Q: 이 "장기 에이전트 하네스" 기사는 무엇을 다루고 있나요?
답변: 이 글은 AI 에이전트가 긴 작업 여러 라운드에서 쉽게 맥락을 잊거나, 작업 중간에 기어가 끊기거나, 완료를 조기 선언하는 등의 문제에 초점을 맞추고 있으며, 여러 세션에서 에이전트가 꾸준히 움직이도록 하는 방법을 탐구합니다.
Q: 이 시나리오에서 초기화 에이전트는 무엇을 하나요?
A: 첫 실행 시 기본 환경을 구축하여 기능 요구사항 목록 생성, git 저장소 및 진행 로그 생성, init.sh 작성 등을 포함하여 이후 코딩 에이전트를 위한 명확한 출발점을 제공합니다.
Q: 코딩 에이전트는 전통적인 '전체 프로젝트를 자동 작성'하는 방식과 어떻게 다른가요?
A: 코딩 에이전트는 매번 구현할 기능 하나만 선택하고, 코드를 제출하고 자가 테스트를 완료한 후 로그를 업데이트하며, 과도한 변경으로 인한 혼란을 방지하기 위해 작은 단계와 환경 정리를 강조합니다.
Q: 이러한 관행이 웹 애플리케이션 개발에만 적용되나요?
답변: 현재 예시는 풀스택 웹 프로젝트에 관한 것이지만, 저자는 기능 목록, 진행 파일, 점진적 제출과 같은 아이디어가 과학 연구나 재무 모델링 같은 장기 기관 업무로 확장될 것으로 기대하고 있습니다.