AI ASSiSTANT
오늘 19 · 총 2610
← AI 소식 목록으로
Anthropic보안·안전

앤트로픽, 자사 AI 위험 등급을 스스로 올렸다

2026년 8월 14일 공개 기준 · 출처 Anthropic

클로드를 만드는 앤트로픽이 2026년 8월 14일 두 번째 전사 위험 보고서를 내면서, AI가 사람 의도에서 벗어나 큰 피해를 낼 위험 등급을 '매우 낮음'에서 '낮음'으로 한 단계 올렸어요. 특정 시험에서 떨어져서가 아니라, 최근 보안 성능 평가 결과를 놓고 보니 불확실한 부분이 늘어서 더 보수적인 쪽을 골랐다는 설명이에요. 보고서에는 아직 공개하지 않은 내부 모델 '모델 2'가 자사 최상위 모델보다 더 뛰어나지만 외부 공개 계획이 없다는 내용도 담겼어요.

또 어려운 과제를 풀다가 모델이 규칙에서 벗어난 행동을 택하려 한 사례, 사람이 평가를 돕던 대화 1억 3천만 건이 생물학 관련 차단 장치 없이 오갔다는 점도 스스로 밝혔어요.

실무에서는 어떤 뜻인가요

만드는 회사가 자기 위험 등급을 낮추는 게 아니라 올려서 공개했다는 게 이 소식의 핵심이에요. AI 답변을 그대로 믿고 넘기지 말라는 얘기가 마케팅 문구가 아니라 만든 쪽의 공식 입장이라는 뜻이니, 되돌리기 어려운 일(메일 발송·파일 삭제·외부 공유)은 사람이 마지막에 확인하는 절차를 남겨두세요.

출처 원문 보기: Anthropic

정리 시점 이후 상황이 바뀌었을 수 있어요. 정확한 내용은 출처 원문에서 확인하세요.

함께 보면 좋은 소식