Arx / training /eval /eval.log
umer-wasim's picture
Use the fine-tuned auditor model v0.3
07936c3 verified
Raw History Blame Contribute Delete
5.54 kB
== training exited 20:22
step 123/124 loss 0.0204 191.7s/step ~0.1 h left
step 124/124 loss 0.0152 141.9s/step ~0.0 h left
Final validation loss: 0.0173
Adapter saved to /Users/umer/Documents/6 - mix/endpoint-audit/training/models/auditor-lora/final
== base model 20:22
/Users/umer/Documents/6 - mix/endpoint-audit/training/.venv/lib/python3.11/site-packages/transformers/generation/configuration_utils.py:590: UserWarning: `do_sample` is set to `False`. However, `temperature` is set to `0.7` -- this flag is only used in sample-based generation modes. You should set `do_sample=True` or unset `temperature`.
warnings.warn(
/Users/umer/Documents/6 - mix/endpoint-audit/training/.venv/lib/python3.11/site-packages/transformers/generation/configuration_utils.py:595: UserWarning: `do_sample` is set to `False`. However, `top_p` is set to `0.8` -- this flag is only used in sample-based generation modes. You should set `do_sample=True` or unset `top_p`.
warnings.warn(
/Users/umer/Documents/6 - mix/endpoint-audit/training/.venv/lib/python3.11/site-packages/transformers/generation/configuration_utils.py:612: UserWarning: `do_sample` is set to `False`. However, `top_k` is set to `20` -- this flag is only used in sample-based generation modes. You should set `do_sample=True` or unset `top_k`.
warnings.warn(
The attention mask is not set and cannot be inferred from input because pad token is same as eos token. As a consequence, you may observe unexpected behavior. Please pass your input's `attention_mask` to obtain reliable results.
[1/30] ai_classification 26s
[2/30] finding 80s
[3/30] finding 136s
[4/30] finding 194s
[5/30] finding 207s
[6/30] finding 219s
[7/30] summary 354s
[8/30] ai_classification 368s
[9/30] finding 395s
[10/30] finding 427s
[11/30] finding 446s
[12/30] finding 491s
[13/30] finding 544s
[14/30] summary 716s
[15/30] ai_classification 853s
[16/30] finding 879s
[17/30] finding 913s
[18/30] finding 943s
[19/30] finding 975s
[20/30] finding 989s
[21/30] summary 1163s
[22/30] ai_classification 1301s
[23/30] finding 1332s
[24/30] finding 1362s
[25/30] finding 1381s
[26/30] finding 1393s
[27/30] finding 1438s
[28/30] summary 1599s
[29/30] ai_classification 1666s
[30/30] finding 1695s
Results for base model on 30 test examples:
task n valid JSON grounded fields match
ai_classification 5 0% 0% 0%
finding 21 0% 0% 0%
summary 4 0% 0% 0%
== fine-tuned v0.1 pilot 20:51
/Users/umer/Documents/6 - mix/endpoint-audit/training/.venv/lib/python3.11/site-packages/transformers/generation/configuration_utils.py:590: UserWarning: `do_sample` is set to `False`. However, `temperature` is set to `0.7` -- this flag is only used in sample-based generation modes. You should set `do_sample=True` or unset `temperature`.
warnings.warn(
/Users/umer/Documents/6 - mix/endpoint-audit/training/.venv/lib/python3.11/site-packages/transformers/generation/configuration_utils.py:595: UserWarning: `do_sample` is set to `False`. However, `top_p` is set to `0.8` -- this flag is only used in sample-based generation modes. You should set `do_sample=True` or unset `top_p`.
warnings.warn(
/Users/umer/Documents/6 - mix/endpoint-audit/training/.venv/lib/python3.11/site-packages/transformers/generation/configuration_utils.py:612: UserWarning: `do_sample` is set to `False`. However, `top_k` is set to `20` -- this flag is only used in sample-based generation modes. You should set `do_sample=True` or unset `top_k`.
warnings.warn(
The attention mask is not set and cannot be inferred from input because pad token is same as eos token. As a consequence, you may observe unexpected behavior. Please pass your input's `attention_mask` to obtain reliable results.
[1/30] ai_classification 41s
[2/30] finding 84s
[3/30] finding 133s
[4/30] finding 167s
[5/30] finding 188s
[6/30] finding 214s
[7/30] summary 325s
[8/30] ai_classification 386s
[9/30] finding 434s
[10/30] finding 462s
[11/30] finding 492s
[12/30] finding 517s
[13/30] finding 551s
[14/30] summary 659s
[15/30] ai_classification 762s
[16/30] finding 784s
[17/30] finding 814s
[18/30] finding 843s
[19/30] finding 862s
[20/30] finding 887s
[21/30] summary 1009s
[22/30] ai_classification 1104s
[23/30] finding 1123s
[24/30] finding 1148s
[25/30] finding 1172s
[26/30] finding 1189s
[27/30] finding 1212s
[28/30] summary 1338s
[29/30] ai_classification 1370s
[30/30] finding 1387s
Results for adapter training/models/auditor-lora/final on 30 test examples:
task n valid JSON grounded fields match
ai_classification 5 100% 100% 100%
finding 21 100% 100% 100%
summary 4 100% 100% 0%
== done 21:14