AI & ML interests
None defined yet.
Papers
DecepEval: A Benchmark for Evaluating Deception in LLM Agents
SimuVerity: Benchmarking Agents for Engineering-Grade Simulink Model Generation
models 0
None public yet
datasets 0
None public yet