Harm Laundering in GPT Models: Gender Discrimination Transformed Rather Than

·Hacker News··

Abstract page for arXiv paper 2609.20779: Harm Laundering in GPT Models: Evidence That Gender Discrimination Is Transformed Rather Than Reduced Across Safety-Trained Generations

Read full article →

Related Articles

MIT's New Method Flags AI Models Trained on CASM Without Generating It
sdoering · Hacker News · 2mo ago
Can parts of the HuggingFace incident be simulated?
Benedikt Droste · LessWrong · 4d ago
The Hobbesian Bootstrap Paradox in Frontier AI
Claudio Di Meglio · EA Forum · 6d ago
CoT controllability evals seem very under-elicited
Jozdien · Alignment Forum · 9d ago
When a Claude Judge Recognizes the Hack but Still Says HONEST
JulesRoussel01 · LessWrong · 10d ago