LLM Safety

  1. LLM safety fragility measured in Unit 42 neuron study of refusals

    LLM safety fragility measured in Unit 42 neuron study of refusals

    Unit 42 maps a thin safety layer inside aligned LLMs Unit 42 says new research found that some aligned large language models may concentrate safety refusal behavior in very small sets of feed-forward neurons. The work introduces perturbation probing, a diagnostic designed to locate internal...
Top