When AI Reviews Train AI Reviewers: Scientific-Judgment Collapse and Mitigation Paper • 2609.20942 • Published 21 days ago • 9
Bias in the Tails: How Name-conditioned Evaluative Framing in Resume Summaries Destabilizes LLM-based Hiring Paper • 2604.19984 • Published Apr 21 • 1
Trait-space Monitoring for Emergent Misalignment During Supervised Finetuning Paper • 2606.07631 • Published May 31 • 3
When AI Reviews Train AI Reviewers: Scientific-Judgment Collapse and Mitigation Paper • 2609.20942 • Published 21 days ago • 9
TrustReviewer Collection Checkpoint and training/eval dataset for the TrustReviewer project. • 3 items • Updated 17 days ago
TrustReviewer Collection Checkpoint and training/eval dataset for the TrustReviewer project. • 3 items • Updated 17 days ago
β-OPSD: Deriving with Policy Optimization, Training with Self-Distillation Paper • 2607.28582 • Published Jul 30 • 25
Trait-space Monitoring for Emergent Misalignment During Supervised Finetuning Paper • 2606.07631 • Published May 31 • 3
SoundnessBench: Can Your AI Scientist Really Tell Good Research Ideas from Bad Ones? Paper • 2605.30329 • Published May 28 • 7
SoundnessBench: Can Your AI Scientist Really Tell Good Research Ideas from Bad Ones? Paper • 2605.30329 • Published May 28 • 7
SoundnessBench: Can Your AI Scientist Really Tell Good Research Ideas from Bad Ones? Paper • 2605.30329 • Published May 28 • 7