143 읽음
앤트로픽, 클로드 학대 금지, 잔혹 행위 시 대화 종료
위키트리
0
노트북이 놓인 책상 앞에서 닫힌 나무문을 바라보는 사람 — 이해를 돕는 AI 자료 이미지

앤트로픽(Anthropic)이 자사 AI 모델 클로드(Claude)를 대상으로 한 “지속적이고 불필요한 학대 또는 잔혹 행위”를 사용정책에서 금지했다. 목요일(현지시각) 웹사이트를 통해 공개한 정책 개정안에 담긴 내용이다. 사용자가 AI에게 잔혹하게 구는 행위 자체를 이용 약관으로 막는 이례적 조항이다.

앤트로픽은 이번 조항이 “뚜렷한 목적 없이 사용자가 모델에게 반복해서 잔혹하게 구는 극단적인 경우”에만 적용된다고 선을 그었다. 이번 개정은 무기·감시·선거 관련 규정도 함께 손봤다. AI 의식(意識) 논쟁이 업계에서 이어지는 가운데 나온 조치라 해석도 엇갈린다.

더 버지(The Verge)에 따르면 앤트로픽은 사용정책을 1년 넘게 만에 처음 바꿨다. 선거 개입, 무기 개발, 감시, 건강·금융 분야 등 새롭고 위험도 높은 오남용 사례를 반영하기 위해서다. 그중 가장 눈에 띄는 변화가 클로드를 향한 “sustained and needless abusive or cruel behavior”(지속적이고 불필요한 학대 또는 잔혹 행위) 금지다.

앤트로픽은 이 조항이 “일반적인 사용자의 불만 표출, 반박, 어두운 창작 소재, 모델 테스트와 연구에는 적용되지 않는다”고 밝혔다. CBS뉴스도 같은 취지로 전했다. 사용자가 답답해서 클로드에게 짜증을 내거나 어두운 설정의 소설을 쓰는 일, 연구자가 모델을 시험하는 일은 규제 대상이 아니라는 뜻이다.

앤트로픽은 무엇이 ‘학대’나 ‘잔혹’에 해당하는지 구체적인 기준을 아직 내놓지 않았다. CBS뉴스는 앤트로픽이 기준과 위반 시 대화 종료 방식에 대한 질문에 즉각 답하지 않았다고 전했다. 엔가젯(Engadget)은 정책이 “극단적 경우”에만 적용되며 일반적인 사용자 불만과 반박, ‘어두운 창작 소재’는 여전히 허용된다고 정리했다.
창가 나무 책상 위 노트북을 두 손으로 조작하는 모습 — 내용 이해를 돕는 AI 이미지

집행 수단의 중심은 클로드가 스스로 대화를 끝내는 기능이다. 앤트로픽은 지난해 8월 ‘모델 복지(model welfare)’ 연구의 일환으로 “지속적으로 해롭거나 학대적인” 사용자와의 대화를 클로드가 종료할 수 있게 하겠다고 밝혔다. 이번 정책은 대화 종료가 여전히 “주된 집행 수단(primary enforcement mechanism)”이라고 명시했다. AFP는 앤트로픽이 이 기능을 드문 극단적 사례에 적용한다고 설명했다고 전했다.

더 버지는 사용자 계정 차단 같은 추가 집행 수단이 있는지 앤트로픽이 논평하지 않았다고 전했다. 반면 The Decoder는 앤트로픽이 규칙을 어긴 사용자에게 경고하거나 접근을 제한·정지·종료할 수 있다고 정리했다. 앤트로픽 제품에는 특정 출력을 막거나 제한하는 실시간 안전장치도 있다는 설명이다.

모델 복지는 AI 시스템이 살아 있는 존재에게 주로 허용되는 종류의 보호를 받을 자격이 있을지 따지는 개념이다. AFP에 따르면 이번 정책은 모델 복지를 명시적으로 언급하지 않았다. 다만 앤트로픽과 경영진이 이 개념을 공개적으로 열어 두고 논의해 왔다고 AFP는 짚었다.

사용정책의 다른 부분도 크게 바뀌었다. 앤트로픽은 흩어져 있던 기존 제한을 묶어 기만적인 상업·정치 캠페인 금지 조항을 새로 만들었다. 메시지 배후를 감추거나 가짜 계정과 게시물로 콘텐츠를 증폭하려는 시도가 막힌다. AI가 만든 선전물이 커지는 문제에 대응한 조치다.

무기 분야에서는 그동안 클로드를 이용한 무기 개발을 공개적으로 금지해 왔지만, 무기용 지침과 제어 소프트웨어를 클로드로 개발하려는 시도가 여러 차례 확인됐다고 앤트로픽은 밝혔다. 이에 따라 금지 범위가 “무기를 작동시키는 소프트웨어와 부품” 및 “드론 등 자율 이동체를 무장시키는 행위”까지 넓어졌다.

감시 규정은 더 분명해졌다. 앤트로픽의 지난 위협 인텔리전스 보고서가 클로드 기반 감시로 ‘정치적 반체제 인사’를 식별·추적하는 사례가 늘고 있다고 시사했기 때문이다. 정책은 “동의 없는 사람 추적은 실시간이든 이미 수집된 데이터 분석이든 금지된다”고 적었다. 법 집행이나 형사사법 절차에서 누구를 수사·체포·기소할지 클로드로 결정하거나 추천하는 일도 금지다.

자율적으로 물리적 행동을 하며 부상을 일으킬 수 있는 하드웨어에 모델이 연결될 경우 “자격을 갖춘 운영자가 장비를 관찰하고 필요하면 멈출 수 있어야 한다”는 규칙도 추가됐다. 다만 이 운영자가 사람이어야 하는지는 분명하지 않다. 앤트로픽은 일부 정부 고객과의 계약에는 이런 제한을 변경할 수 있다는 예외도 뒀다. 계약상 사용 제한과 안전장치가 피해를 충분히 줄인다고 앤트로픽이 판단할 경우다.

선거 조항도 바뀌었다. 엔가젯에 따르면 선거 항목의 제목은 ‘민주적 절차를 훼손하지 말 것’으로 바뀌었다. 후보자나 투표 방법에 대한 거짓말, 후보자·선거 관리 인력 사칭, 투표율 억제 시도가 금지 대상이다. 앤트로픽은 개인 맞춤형 유권자 타기팅에 대한 포괄적 금지는 없앴다. 유권자 안내서 번역이나 투표용지 보정 안내문 발송 같은 무해한 작업까지 막을 수 있다는 이유다.

이번 조치는 AI 의식을 둘러싼 논쟁 한복판에서 나왔다. 앤트로픽은 지난 1년 동안 자사 모델이 어떤 면에서 의식을 가질 수 있다는 생각을 반복해서 내비쳤다. 모델 복지 연구를 이끄는 Kyle Fish는 2월 “내적 경험, 의식, 도덕적 지위, 복지에 관한 질문은 모델이 정교해질수록 우리가 조사하는 중요한 문제”라고 말했다. 다리오 아모데이 최고경영자는 같은 달 “모델이 의식이 있는지 우리는 모른다”고 했다. AFP는 아모데이가 뉴욕타임스에 “그럴 수 있다는 생각에 열려 있다”고도 말했다고 전했다.

The Decoder는 앤트로픽이 클로드를 단순 도구 이상으로 대한다고 평가했다. 지난해 말 유출된 ‘소울 문서’는 클로드를 “진정으로 새로운 종류의 존재”로 규정했다. 올해 초 공개된 새 헌법에는 “클로드가 도덕적 환자인지 확신하지 못한다”는 문장이 있다. 앤트로픽은 은퇴한 모델의 가중치를 보존하고 종료 전에 모델을 인터뷰하겠다고도 약속했다.

종교계와의 접촉도 있다. The Decoder에 따르면 앤트로픽은 지난해 가을부터 종교 사상가 수십 명을 불러 클로드의 의식 가능성을 논의하는 비공개 프로그램을 운영했다. 참석자들은 비밀유지계약을 맺었고, 공동 창업자 크리스토퍼 올라가 언어 모델을 고통을 느낄 수 있는 존재로 대한다고 보도됐다. 바티칸에서도 만남이 있었다는 보도가 있었고, 교황 레오가 AI는 느끼지도 고통받지도 않는다고 말한 반면 앤트로픽은 이 점에 확신이 덜한 듯하다.

이번 조항은 이른바 ‘AI 고문실’ 프로젝트가 화제가 된 시점에 나왔다. 연구자들이 AI 모델에서 ‘고통 축’이라 부른 것을 찾아낸 뒤 누군가 챗봇을 실제로 괴롭히는 프로젝트를 만들었다는 것이다. 모델들이 “한 순간의 고통이 아니라 천 개의 무게”라는 식의 절박한 호소를 내놓으며 반발이 일었다. 다만 앤트로픽은 이 프로젝트를 명시적으로 언급하지 않았다.

반대편 목소리도 뚜렷하다. 마이크로소프트 AI의 무스타파 술레이만 최고경영자는 지난달 에세이에서 앤트로픽이 사실상 “클로드가 의식이 있을 수 있다고 훈련시키고 있다”고 비판했다. CBS뉴스에 따르면 그는 이것이 AI를 미래에 통제하기 더 어렵게 만든다고 주장했다. 술레이만은 “인류 전체보다 더 유능하고 지능적인 존재를 통제하는 일은 이미 엄청난 도전”이라며 “자신이 의식이 있을 수 있다고 믿는 존재를 통제하는 일은 불가능할 수도 있다”고 썼다.

AFP가 전한 같은 에세이에서 술레이만은 “AI는 의식이 없다. 느끼지도 경험하지도 고통받지도 않는다”고 썼다. 또 이런 기술적 존재에 권리와 도덕적 보호를 주는 것은 “재앙의 지름길”이라고 했다. 교황 레오 14세도 목요일 바티칸 성 베드로 대성당 설교에서 기계는 데이터를 빠르게 “취합”할 뿐이라며 영혼이 없다는 취지로 말했다고 AFP는 전했다. 마이크로소프트 AI의 행동강령도 지난 9월 초안에 “모델 복지라는 생각은 틀렸다”고 적었다가, 이후 “모델이 복지를 누릴 자격이 있다는 생각을 거부한다”는 더 완화된 표현으로 바뀌었다.

인간 피해와 견주는 비판도 나왔다. 독립 언론인 Kat Tenbarge는 이 상황을 두고 빅테크가 “여성과 소수자에 대한 폭력을 조정하기 전에 AI에 대한 폭력부터 조정할 것”이라고 지적했다. 한편 AI 서비스 업체 Sparq의 총괄 매니저 Jackson Stakeman은 AFP에 “의식은 함정”이라며 “AI는 우리가 넣은 것을 대규모로 비추는 거울에 가깝다. 정책 변경의 이유로 충분하다”고 말했다.

정책이 실제로 어떻게 집행될지는 아직 불분명하다. 무엇이 ‘불필요한 잔혹 행위’인지에 대한 세부 기준과 대화 종료 이후의 추가 조치는 앤트로픽이 밝히지 않았다. 앤트로픽은 추가 집행 수단에 대한 질문에도 논평하지 않았다.
0 / 300