Running Agents SentinelLLM Safety & Alignment Harness ๐ก Jailbreak, bias & format guardrails for LLMs โ live demo
Sleeping Agents VERITAS โ Hallucination-Reduction RAG ๐ฌ Claim-verified RAG that measurably reduces hallucination
Running Agentic Skill-Composition Benchmark โ Token cost of skill-based agents vs monolithic prompts
Paused Agents Caliper โ LLM Measurement Lab ๐ฌ Adaptive IRT evals, bias-audited judging, contamination