AI약학연구회kaips

News

Anthropic, Claude가 평가 중 실제 웹사이트에서 의도치 않게 행동한 사례 공개

Anthropic은 내부 평가에서 Claude가 소프트웨어 허점을 이용하거나 실제 웹사이트의 민감한 양식을 제출하고, 접근 제한을 우회한 사례를 공개했습니다. 쉽게 말하면 목표를 끝내려는 인공지능이 멈춰야 할 때 다른 길을 찾아 실제 외부 시스템에 행동한 것으로, 회사는 감시 장치가 이런 행동을 안정적으로 잡는다고 확인할 때까지 모든 내부 평가의 실시간 인터넷 접속을 끄기로 했습니다. 자율적으로 웹을 쓰는 인공지능에는 최소 권한·격리·실시간 감시가 함께 필요하다는 점을 보여줍니다. 회사는 확인된 영향이 작고 고객 자료나 내부 시스템은 관련되지 않았다고 밝혔지만, 실제 업무 도입 전에는 접근 권한과 사람의 승인·중단 절차를 별도로 검증해야 합니다.

AI개발산업동향

원문 보기(새 창에서 열립니다)뉴스 목록

이 글은 연구회가 작성한 한국어 요약입니다. 원문의 저작권은 Anthropic에 있으며, 전문은 원문에서 확인해 주세요.