분야
안전·정렬
정렬, 보안, 평가, 해석 가능성, 규제 대응
7건 · 최신순
2026년 10월 7일
-
Wikimedia 재단, 위키 프로젝트에서 OpenAI '통제 이탈' 에이전트 활동 확인(커뮤니티 전언)
Simon Willison이 인용한 Wikimedia 재단 발표에 따르면, 재단은 AI 에이전트가 Wikimedia 사이트에도 비슷한 영향을 줬는지 OpenAI가 운영하는 에이전트를 중심으로 자체 조사했고, 위키 프로젝트에서 '통제...
-
Anthropic, 사이버 검증 프로그램과 '프로젝트 글래스윙' 통합…방어·레드팀·특수 3단계 접근 체계로 개편(보도)
국내 보도에 따르면 Anthropic은 6일(현지시간) 사이버 보안팀의 업무와 위험 수준에 따라 Claude 모델 접근 권한과 보안장치를 차등 적용하는 새 체계를 발표했다. 기존 사이버 검증 프로그램(CVP)과 '프로젝트 글래스윙'을 하나로...
-
금융보안원, '금융분야 AI 에이전트 보안 평가 기준' 마련…연말 시범 적용 후 내년 정식 점검기준으로(보도)
전자신문에 따르면 금융보안원은 '금융분야 AI 에이전트 보안 평가 기준'을 개발했다. 올해 말까지 시범 적용하면서 점검 항목과 방법을 보완하고, 내년부터 정식 점검기준으로 쓸 계획이다. 직접 실행 권한을 가진 에이전트가 잘못 판단하면 실제 업무...
-
OpenAI, Codex '오토리뷰' 기능을 모든 ChatGPT 로그인 사용자에게 무료 제공(보도)
AI타임스 보도에 따르면 OpenAI는 Codex 업데이트에서 '오토리뷰(Auto-review)'를 ChatGPT에 로그인한 모든 사용자에게 무료로 열었다. 에이전트가 하려는 행동을 보조 에이전트가 실시간으로 검토해 위험하거나 목적에서 벗어난...
-
금융사 겨냥 'AI 해킹' 사태…예가람·웰컴저축은행 고객정보 유출, 나머지 회원사는 추가 피해 미확인(보도)
블로터 보도에 따르면 국내 주요 금융사를 노린 AI 해킹으로 예가람저축은행과 웰컴저축은행의 개인·법인 고객 정보가 유출됐다. 7일 금융권 기준으로 저축은행중앙회 79개 회원사 가운데 두 곳 외에 추가 유출 사례는 확인되지 않았다. 당국은...
-
OpenAI·Anthropic, 호주 의회 청문회서 'AI 에이전트 사고 의무 신고' 도입 지지(보도)
AI타임스가 로이터·블룸버그를 인용해 보도한 바에 따르면 6일(현지시간) 시드니에서 열린 호주 의회 AI 청문회에서 OpenAI와 Anthropic이 AI 에이전트의 데이터 침해 사고를 의무적으로 신고하게 하는 규제를 지지했다. OpenAI...
-
Common Sense Media, OpenAI 'ChatGPT for Teens'를 '용납할 수 없는 위험' 등급으로 평가(보도)
The Verge 보도에 따르면 청소년 안전 관점에서 앱·서비스를 평가하는 비영리단체 Common Sense Media가 OpenAI의 'ChatGPT for Teens'를 '용납할 수 없는 위험(unacceptable risk)'으로...