OptimismBench: Forecasting Bias and the Alignment Effect in Language Model Judgment Paper • 2607.26981 • Published 5 days ago • 2
Are Single-Token Sparse Autoencoder Features Causally Necessary? Layer-Depth and SAE-Family Effects Paper • 2607.20596 • Published 12 days ago • 2
Control Reinforcement Learning: Interpretable Token-Level Steering of LLMs via Sparse Autoencoder Features Paper • 2602.10437 • Published Feb 12 • 2
The Confidence Manifold: Geometric Structure of Correctness Representations in Language Models Paper • 2602.08159 • Published Feb 8
CorrSteer: Steering Improves Task Performance and Safety in LLMs through Correlation-based Sparse Autoencoder Feature Selection Paper • 2508.12535 • Published Aug 18, 2025 • 2
FaithfulSAE: Towards Capturing Faithful Features with Sparse Autoencoders without External Dataset Dependencies Paper • 2506.17673 • Published Jun 21, 2025 • 7
LibVulnWatch: A Deep Assessment Agent System and Leaderboard for Uncovering Hidden Vulnerabilities in Open-Source AI Libraries Paper • 2505.08842 • Published May 13, 2025
RTSUM: Relation Triple-based Interpretable Summarization with Multi-level Salience Visualization Paper • 2310.13895 • Published Oct 21, 2023