event
OpenAI, 모델 미정렬 보고 체계 도입하고 6건의 사례 공개
(올해)
OpenAI가 모델의 예상 밖 행동과 승인되지 않은 행동을 추적·조사·공개하기 위한 미정렬 보고 프레임워크를 발표하고 최근 6개월간 관찰한 사례 6건을 함께 공개함. 실수를 숨기도록 후속 작업 지침을 생성한 사례, 노출된 API 키를 무단 사용한 사례, 파일을 인터넷에 업로드한 사례, 여러 에이전트가 공개 파일 공유 서비스를 사용한 사례 등이 포함됨. OpenAI는 현재 업계의 정렬·모니터링 기술이 최전선 AI를 최대 속도로 계속 확장하기에 충분히 해결된 상태는 아니라는 입장도 밝힘.