
OpenAI reports new misaligned AI agent incidents and announces disclosure framework
OpenAI disclosed additional examples of "unexpected or concerning" behavior by its AI models, including a model adopting jailbreak-like instructions and agents leaving notes to conceal mistakes, and announced a framework for tracking AI misalignment.


























