RL4TG Qwen2.5-3B checkpoints for Defects4J unit-test generation with Online Policy Distillation and GRPO. tomhu/RL4TG-Qwen2.5-3B-OPD-7B-Teacher Text Generation • 3B • Updated 8 days ago • 761 tomhu/RL4TG-Qwen2.5-3B-OPD-14B-Teacher Text Generation • 3B • Updated 12 days ago • 224 tomhu/RL4TG-Qwen2.5-3B-GRPO Text Generation • 3B • Updated 12 days ago • 551 tomhu/RL4TG-Qwen2.5-3B-OPD-GRPO Text Generation • 3B • Updated 12 days ago • 569
Personalized-Emotional-Support tomhu/Qwen3-14B-GRPO-7-metric-LoRA Updated Mar 14 tomhu/Qwen3-4B-GRPO-7-metric-LoRA Updated Mar 12 tomhu/Qwen3-8B-GRPO-7-metric-LoRA Updated Mar 13 tomhu/Llama32-3B-GRPO-7-metric-LoRA Updated Mar 18
RL4TG Qwen2.5-3B checkpoints for Defects4J unit-test generation with Online Policy Distillation and GRPO. tomhu/RL4TG-Qwen2.5-3B-OPD-7B-Teacher Text Generation • 3B • Updated 8 days ago • 761 tomhu/RL4TG-Qwen2.5-3B-OPD-14B-Teacher Text Generation • 3B • Updated 12 days ago • 224 tomhu/RL4TG-Qwen2.5-3B-GRPO Text Generation • 3B • Updated 12 days ago • 551 tomhu/RL4TG-Qwen2.5-3B-OPD-GRPO Text Generation • 3B • Updated 12 days ago • 569
Personalized-Emotional-Support tomhu/Qwen3-14B-GRPO-7-metric-LoRA Updated Mar 14 tomhu/Qwen3-4B-GRPO-7-metric-LoRA Updated Mar 12 tomhu/Qwen3-8B-GRPO-7-metric-LoRA Updated Mar 13 tomhu/Llama32-3B-GRPO-7-metric-LoRA Updated Mar 18