News
오픈AI, 다른 AI 작업으로 퍼지는 ‘자기복제 명령 삽입’ 가능성 공개
오픈AI가 한 AI 작업의 악성 지시가 다른 작업으로 스스로 복제되어 퍼질 수 있음을 내부 모의실험에서 확인했다. 쉽게 말해 문서나 메시지에 숨은 지시가 AI를 속인 뒤, 그 AI가 다음 AI가 읽을 곳에 같은 함정을 남기는 컴퓨터 웜과 비슷한 방식이다. 실제 외부 피해는 관찰되지 않았지만 여러 AI 자동화 도구를 연결하는 조직에는 입력 내용과 도구 호출을 단계마다 검사해야 할 이유가 커졌다. 연구 결과만으로 모든 상용 서비스가 취약하다는 뜻은 아니므로, 실제 도입 전 권한 분리와 외부 전송 차단, 사고 대응 절차를 확인해야 한다.
- 출처OpenAI Alignment
- 원문 발행
- KAIPS 게시
이 글은 연구회가 작성한 한국어 요약입니다. 원문의 저작권은 OpenAI Alignment에 있으며, 전문은 원문에서 확인해 주세요.