Evaluating and Mitigating Misalignment in Language Models
MCML Authors
Xinpeng Wang
Dr.
* Former Member
Abstract
Xinpeng Wang
Dr.
* Former Member
Abstract
This dissertation advances the evaluation and mitigation of misalignment in large language models by addressing both flawed optimization signals and the challenge of representing diverse human values. It develops methods to detect reward hacking and analyze safety behavior, introduces targeted interventions to reduce unnecessary refusals without weakening safety, and proposes an efficient framework for preserving differing human perspectives during model alignment. (Shortened).
BibTeXKey: Wan26