GroundEval: A Deterministic Replacement for LLM-as-Judge in Stateful Agent Evaluation Paper • 2606.22737 • Published Jun 22 • 1
Beyond Similarity Search: Tenure and the Case for Structured Belief State in LLM Memory Paper • 2605.11325 • Published May 11 • 1
OrgForge-IT: A Verifiable Synthetic Benchmark for LLM-Based Insider Threat Detection Paper • 2603.22499 • Published Mar 23 • 1
Sleeping Agents 2 OrgForge Insider Threat Benchmark 🛡 2 Explore insider threat model benchmark rankings
Sleeping Agents 2 OrgForge Insider Threat Benchmark 🛡 2 Explore insider threat model benchmark rankings
Sleeping Agents 2 OrgForge Insider Threat Benchmark 🛡 2 Explore insider threat model benchmark rankings