Jailbreak
A prompt crafted to make a model ignore its safety training or system instructions. Defense is layered (input screening, output filters, least-privilege tools), never prompt-only.
A prompt crafted to make a model ignore its safety training or system instructions. Defense is layered (input screening, output filters, least-privilege tools), never prompt-only.