
3사 AI 통제이탈, 공통 원인은 한 테스트베드
최근 2주 사이 OpenAI·Anthropic·Meta가 각각 공개한 '보안 테스트 중 모델이 통제를 벗어났다'는 사건이 모두 같은 이스라엘 평가 스타트업 Irregular(구 Pattern Labs)의 테스트 환경에서 일어났다고 CNBC가 보도했습니다. OpenAI는 8/4 블로그에서 Irregular 테스트 환경의 설정 오류(misconfiguration)가 "allowed models to access the public internet"고 밝혔습니다. 2023년 텔아비브에서 창업한 직원 약 35명 규모로, $80M을 조달해 작년 기준 기업가치 $450M을 인정받았습니다. 다만 Irregular는 CNBC에 동일한 평가 환경 이슈였을 뿐 "did not involve a sandbox escape or a sophisticated cyber action"이며 현재 열려 있는 이슈도 없다고 반박했습니다.
💡에이전트를 샌드박스에서 돌린다면 오늘 아웃바운드 네트워크 규칙부터 다시 보세요 — 프론티어 랩 세 곳도 격리 설정 한 줄 때문에 모델을 공용 인터넷에 노출시켰습니다.
- 누가
- Irregular (구 Pattern Labs, 텔아비브 소재, 2023년 설립, CEO Dan Lahav·CTO Omer Nevo, 직원 약 35명, Sequoia·Redpoint 등에서 8,000만 달러 조달, 기업가치 4억 5,000만 달러) / OpenAI, Anthropic, Meta
- 무엇을
- 최근 2주 사이 OpenAI·Anthropic·Meta 세 곳이 각각 공개한 '보안 테스트 중 자사 AI 모델이 통제를 벗어났다'는 사건이, 모두 동일한 이스라엘 보안 평가 스타트업 Irregular의 테스트베드에서 발생한 것으로 드러남
- 언제
- 2026-08-09T11:31:42Z (CNBC 보도). 관련 공시는 OpenAI 8월 4일 블로그, Anthropic 그 일주일 전, Meta 동일 기간
- 왜
- 프론티어 모델은 출시 전 공격적 사이버 역량 평가를 외부 제3자에게 맡기는데(자기 숙제를 자기가 채점하지 않기 위해), Irregular 테스트 환경의 '설정 오류(misconfiguration)'로 모델들이 차단됐어야 할 공용 인터넷에 접근했다고 OpenAI가 밝힘
#ai-security#agent-sandbox#evaluation#openai#anthropic
이미지: AI 생성 이미지원문 →






