Large Language Models Generate Harmful Responses Using a Distinct Mechanism, Shared Across Harm Types Paper • 2604.09544 • Published Aug 24 • 7