recICL / eval /results.json
devtaji's picture
recICL v0
08646a9
Raw History Blame Contribute Delete
22.4 kB
{
"model": "devtaji/recICL",
"checkpoint_sha256": "661fd3415a0b8f2d727898006e6314dcd273e15f59da3383668f7bc1a3997a3a",
"split": "test",
"protocol": {
"split": "user-level 70/10/20, seed 42; at most 10,000 users sampled into the test split, then users with a single interaction dropped",
"target": "each test user's last item; input = up to 14 preceding items",
"context": "8 sequences from train-split users (retrieval as in 'inference')",
"batch_size": 1,
"ranking": "full item catalog, no candidate sampling, repeated items allowed",
"metrics": [
"HR@10",
"MRR@10"
],
"hardware": "NVIDIA L4, fp32, TF32 off"
},
"baselines": {
"embknn_balanced": "score = dot(mean of the history item embeddings, item embedding); its numbers are close to the EmbKNN column of the RecPFN paper's Table 2 (within about 10% on Arts, Games, Movies, Pantry, Software)",
"embknn_last": "score = dot(last history item embedding, item embedding); the EmbKNN that the RecPFN paper's text describes"
},
"datasets_source": "Amazon Reviews 2018 (McAuley et al.) categories, rebuilt from the raw ratings + metadata: Appliances, Arts_Crafts_and_Sewing, Video_Games, Movies_and_TV, Prime_Pantry, Industrial_and_Scientific, Software",
"paired_differences_note": "model minus baseline, paired bootstrap over test users (2,000 resamples), 95% CI; McNemar exact p on HR@10 hits",
"datasets": {
"Appliances": {
"n_test_users_evaluated": 145,
"n_test_users_in_split": 145,
"flag": "evaluation data differs from the RecPFN paper's (undisclosed filtering)",
"recicl_v0": {
"hr@3": 0.06206896551724138,
"hr@5": 0.06896551724137931,
"hr@10": 0.10344827586206896,
"mrr@3": 0.04827586206896552,
"mrr@5": 0.04965517243434643,
"mrr@10": 0.05434865910431434,
"loss": 9.28750396761401
},
"embknn_balanced": {
"hr@3": 0.027586206896551724,
"hr@5": 0.041379310344827586,
"hr@10": 0.06206896551724138,
"mrr@3": 0.013793103448275862,
"mrr@5": 0.016551724179037688,
"mrr@10": 0.01906951295918432,
"loss": 10.228556942117626
},
"embknn_last": {
"hr@3": 0.09655172413793103,
"hr@5": 0.1103448275862069,
"hr@10": 0.1310344827586207,
"mrr@3": 0.05862068986070567,
"mrr@5": 0.062068965722774636,
"mrr@10": 0.06475095810561345,
"loss": 10.193267019863786
},
"paired_differences_95ci": {
"vs_embknn_last": {
"d_hr@10": -0.027586206896551738,
"d_hr@10_ci": [
-0.06206896551724139,
0.0
],
"d_mrr@10": -0.010402298850574712,
"d_mrr@10_ci": [
-0.023873084291187747,
0.0023036398467432624
],
"mcnemar_p": 0.21875000000000014
},
"vs_embknn_balanced": {
"d_hr@10": 0.041379310344827586,
"d_hr@10_ci": [
0.0,
0.08275862068965519
],
"d_mrr@10": 0.035279146141215106,
"d_mrr@10_ci": [
0.007594074986316366,
0.06752230432402839
],
"mcnemar_p": 0.109375
}
},
"eval_gpu": "NVIDIA L4",
"evaluated_at": "2026-09-29T11:12:17Z",
"context_ablations": {
"no_context": {
"hr@10": 0.05517241379310345,
"mrr@10": 0.020000000092489967,
"pct_change_hr@10": -46.666666666666664,
"pct_change_hr@10_ci95": [
-75.0,
-14.261904761904896
],
"pct_change_mrr@10": -63.200563873888996,
"pct_change_mrr@10_ci95": [
-91.32381136817679,
-33.380598313527344
],
"mean_context_sequences": 0.0
},
"random_context": {
"hr@10": 0.041379310344827586,
"mrr@10": 0.03103448275862069,
"pct_change_hr@10": -60.0,
"pct_change_hr@10_ci95": [
-85.71428571428572,
-33.333333333333336
],
"pct_change_mrr@10": -42.897426964933,
"pct_change_mrr@10_ci95": [
-81.16710629577956,
6.011155432140703
],
"mean_context_sequences": 8.0
}
}
},
"Arts": {
"n_test_users_evaluated": 2997,
"n_test_users_in_split": 10000,
"flag": null,
"recicl_v0": {
"hr@3": 0.1871871871871872,
"hr@5": 0.20186853520186854,
"hr@10": 0.22055388722055388,
"mrr@3": 0.15170726306366053,
"mrr@5": 0.15502724973786303,
"mrr@10": 0.15758139124245177,
"loss": 10.023291922466811
},
"embknn_balanced": {
"hr@3": 0.16049382716049382,
"hr@5": 0.1828495161828495,
"hr@10": 0.20153486820153488,
"mrr@3": 0.131854076474199,
"mrr@5": 0.1367589814198745,
"mrr@10": 0.1393652915019849,
"loss": 12.450908683481558
},
"embknn_last": {
"hr@3": 0.17450784117450785,
"hr@5": 0.19953286619953287,
"hr@10": 0.21788455121788455,
"mrr@3": 0.14547881232447174,
"mrr@5": 0.15100100122374777,
"mrr@10": 0.153521643620274,
"loss": 12.435229098116672
},
"paired_differences_95ci": {
"vs_embknn_last": {
"d_hr@10": 0.0026693360026693314,
"d_hr@10_ci": [
-0.003336670003336678,
0.00934267600934266
],
"d_mrr@10": 0.004059747578266104,
"d_mrr@10_ci": [
0.0016380765686321512,
0.006624263152040991
],
"mcnemar_p": 0.46570744577306067
},
"vs_embknn_balanced": {
"d_hr@10": 0.019019019019019007,
"d_hr@10_ci": [
0.01167834501167836,
0.026359693026359682
],
"d_mrr@10": 0.018216099697581145,
"d_mrr@10_ci": [
0.014113558002446853,
0.022250213176138966
],
"mcnemar_p": 4.3609050114828154e-07
}
},
"eval_gpu": "NVIDIA L4",
"evaluated_at": "2026-09-29T11:15:00Z",
"context_ablations": {
"no_context": {
"hr@10": 0.18618618618618618,
"mrr@10": 0.12968577070408438,
"pct_change_hr@10": -15.582450832072613,
"pct_change_hr@10_ci95": [
-19.082868467410457,
-12.157674772036467
],
"pct_change_mrr@10": -17.702357060325546,
"pct_change_mrr@10_ci95": [
-20.833086015350958,
-14.734061825197962
],
"mean_context_sequences": 0.0
},
"random_context": {
"hr@10": 0.08541875208541876,
"mrr@10": 0.048784234107017994,
"pct_change_hr@10": -61.27080181543116,
"pct_change_hr@10_ci95": [
-64.90455212922173,
-57.557142362952874
],
"pct_change_mrr@10": -69.0418813272441,
"pct_change_mrr@10_ci95": [
-72.615949611093,
-65.57546376581101
],
"mean_context_sequences": 8.0
}
}
},
"Games": {
"n_test_users_evaluated": 10000,
"n_test_users_in_split": 10000,
"flag": null,
"recicl_v0": {
"hr@3": 0.0513,
"hr@5": 0.0588,
"hr@10": 0.0722,
"mrr@3": 0.04260000007748604,
"mrr@5": 0.044295000088214874,
"mrr@10": 0.046121071556210515,
"loss": 10.213145974993706
},
"embknn_balanced": {
"hr@3": 0.02,
"hr@5": 0.0303,
"hr@10": 0.0479,
"mrr@3": 0.011700000071525574,
"mrr@5": 0.014055000084638596,
"mrr@10": 0.01636996045857668,
"loss": 11.093444060993194
},
"embknn_last": {
"hr@3": 0.0506,
"hr@5": 0.0585,
"hr@10": 0.0736,
"mrr@3": 0.03945000005960465,
"mrr@5": 0.04121000007241964,
"mrr@10": 0.04316595249548554,
"loss": 11.0686561044693
},
"paired_differences_95ci": {
"vs_embknn_last": {
"d_hr@10": -0.0013999999999999985,
"d_hr@10_ci": [
-0.004699999999999996,
0.0020000000000000018
],
"d_mrr@10": 0.002955119047619019,
"d_mrr@10_ci": [
0.00160891765873009,
0.004420426587301565
],
"mcnemar_p": 0.43727338509353675
},
"vs_embknn_balanced": {
"d_hr@10": 0.024300000000000002,
"d_hr@10_ci": [
0.019600000000000006,
0.0288
],
"d_mrr@10": 0.029751111111111096,
"d_mrr@10_ci": [
0.026522191468253967,
0.03297455158730153
],
"mcnemar_p": 1.5319468898317913e-25
}
},
"eval_gpu": "NVIDIA L4",
"evaluated_at": "2026-09-29T11:16:13Z",
"context_ablations": {
"no_context": {
"hr@10": 0.0716,
"mrr@10": 0.03594726204872131,
"pct_change_hr@10": -0.8310249307479256,
"pct_change_hr@10_ci95": [
-5.364047361136176,
3.841910853289687
],
"pct_change_mrr@10": -22.058918329965017,
"pct_change_mrr@10_ci95": [
-25.54905745074236,
-18.56859102137774
],
"mean_context_sequences": 0.0
},
"random_context": {
"hr@10": 0.0119,
"mrr@10": 0.004851468288898468,
"pct_change_hr@10": -83.5180055401662,
"pct_change_hr@10_ci95": [
-86.22530832926526,
-80.73741871966297
],
"pct_change_mrr@10": -89.4810156720108,
"pct_change_mrr@10_ci95": [
-91.75046365557786,
-87.02863863527669
],
"mean_context_sequences": 8.0
}
}
},
"Movies": {
"n_test_users_evaluated": 10000,
"n_test_users_in_split": 10000,
"flag": null,
"recicl_v0": {
"hr@3": 0.0951,
"hr@5": 0.1096,
"hr@10": 0.1237,
"mrr@3": 0.06308333349823951,
"mrr@5": 0.06639833351671695,
"mrr@10": 0.0683068653061986,
"loss": 10.933070637273788
},
"embknn_balanced": {
"hr@3": 0.0335,
"hr@5": 0.0491,
"hr@10": 0.0695,
"mrr@3": 0.018566666802763938,
"mrr@5": 0.02212666682302952,
"mrr@10": 0.02482007957994938,
"loss": 12.046554122447967
},
"embknn_last": {
"hr@3": 0.0778,
"hr@5": 0.1049,
"hr@10": 0.1221,
"mrr@3": 0.05258333346545696,
"mrr@5": 0.058868333494663236,
"mrr@10": 0.061181428787857296,
"loss": 12.016274190807342
},
"paired_differences_95ci": {
"vs_embknn_last": {
"d_hr@10": 0.0016000000000000042,
"d_hr@10_ci": [
-0.0011999999999999932,
0.00449999999999999
],
"d_mrr@10": 0.0071254365079365944,
"d_mrr@10_ci": [
0.005697232142857268,
0.008514329365079398
],
"mcnemar_p": 0.3029036319209554
},
"vs_embknn_balanced": {
"d_hr@10": 0.0542,
"d_hr@10_ci": [
0.04870000000000001,
0.05929999999999999
],
"d_mrr@10": 0.04348678571428581,
"d_mrr@10_ci": [
0.0402409722222223,
0.046700817460317574
],
"mcnemar_p": 1.4361709413897885e-91
}
},
"eval_gpu": "NVIDIA L4",
"evaluated_at": "2026-09-29T11:17:56Z",
"context_ablations": {
"no_context": {
"hr@10": 0.102,
"mrr@10": 0.04952440501749516,
"pct_change_hr@10": -17.542441390460805,
"pct_change_hr@10_ci95": [
-20.496807702572312,
-14.590643244107216
],
"pct_change_mrr@10": -27.497177925685023,
"pct_change_mrr@10_ci95": [
-30.157991463516414,
-24.89154990329349
],
"mean_context_sequences": 0.0
},
"random_context": {
"hr@10": 0.0179,
"mrr@10": 0.010642261940985918,
"pct_change_hr@10": -85.52950687146321,
"pct_change_hr@10_ci95": [
-87.47939468293607,
-83.4124518447913
],
"pct_change_mrr@10": -84.419923395284,
"pct_change_mrr@10_ci95": [
-86.68075954394435,
-81.80099004889513
],
"mean_context_sequences": 8.0
}
}
},
"Pantry": {
"n_test_users_evaluated": 3106,
"n_test_users_in_split": 10000,
"flag": null,
"recicl_v0": {
"hr@3": 0.2063747585318738,
"hr@5": 0.2169993560849968,
"hr@10": 0.2347070186735351,
"mrr@3": 0.190759819809345,
"mrr@5": 0.19320669683405298,
"mrr@10": 0.19541504426456927,
"loss": 7.7768060520089834
},
"embknn_balanced": {
"hr@3": 0.19639407598197037,
"hr@5": 0.20927237604636187,
"hr@10": 0.23148744365743723,
"mrr@3": 0.1807791372882268,
"mrr@5": 0.18370895057014702,
"mrr@10": 0.18661793887720748,
"loss": 9.150342638233134
},
"embknn_last": {
"hr@3": 0.20573084352865423,
"hr@5": 0.2189311010946555,
"hr@10": 0.23889246619446233,
"mrr@3": 0.1899012664941074,
"mrr@5": 0.19294376489967205,
"mrr@10": 0.19550230500875407,
"loss": 9.141914023173983
},
"paired_differences_95ci": {
"vs_embknn_last": {
"d_hr@10": -0.004185447520927227,
"d_hr@10_ci": [
-0.008692852543464247,
0.0003219575016097931
],
"d_mrr@10": -8.726070380921103e-05,
"d_mrr@10_ci": [
-0.0011988125900714338,
0.0010856164208545979
],
"mcnemar_p": 0.07894069368148691
},
"vs_embknn_balanced": {
"d_hr@10": 0.0032195750160978753,
"d_hr@10_ci": [
-0.0028976175144880822,
0.009014810045074068
],
"d_mrr@10": 0.008797105448747455,
"d_mrr@10_ci": [
0.0058886282566257536,
0.011998394684123979
],
"mcnemar_p": 0.34814129031920826
}
},
"eval_gpu": "NVIDIA L4",
"evaluated_at": "2026-09-29T11:13:21Z",
"context_ablations": {
"no_context": {
"hr@10": 0.19671603348358016,
"mrr@10": 0.15395381714229958,
"pct_change_hr@10": -16.18655692729768,
"pct_change_hr@10_ci95": [
-19.264387170902758,
-13.167998565647263
],
"pct_change_mrr@10": -21.21700879187991,
"pct_change_mrr@10_ci95": [
-24.17786279642231,
-18.26020458277787
],
"mean_context_sequences": 0.0
},
"random_context": {
"hr@10": 0.15421764327108822,
"mrr@10": 0.1047861795327929,
"pct_change_hr@10": -34.293552812071326,
"pct_change_hr@10_ci95": [
-37.772055176467944,
-30.716229295376298
],
"pct_change_mrr@10": -46.37762925206281,
"pct_change_mrr@10_ci95": [
-49.80445898826904,
-43.037569407074
],
"mean_context_sequences": 8.0
}
}
},
"Scientific": {
"n_test_users_evaluated": 5619,
"n_test_users_in_split": 5619,
"flag": "evaluation data differs from the RecPFN paper's (undisclosed filtering)",
"recicl_v0": {
"hr@3": 0.043602064424274785,
"hr@5": 0.05089873642996975,
"hr@10": 0.06157679302366969,
"mrr@3": 0.030758735298325443,
"mrr@5": 0.032431630840354976,
"mrr@10": 0.033883832448115235,
"loss": 11.270965716363188
},
"embknn_balanced": {
"hr@3": 0.023313756896244882,
"hr@5": 0.029364655632674853,
"hr@10": 0.041110517885744796,
"mrr@3": 0.01319926444651245,
"mrr@5": 0.014614106951011927,
"mrr@10": 0.016231917315561336,
"loss": 11.957719512629879
},
"embknn_last": {
"hr@3": 0.05196654208933974,
"hr@5": 0.06371240434240968,
"hr@10": 0.07492436376579463,
"mrr@3": 0.03336892694547775,
"mrr@5": 0.036029542729849914,
"mrr@10": 0.037563454074025004,
"loss": 11.922406332712196
},
"paired_differences_95ci": {
"vs_embknn_last": {
"d_hr@10": -0.013347570742124941,
"d_hr@10_ci": [
-0.017262858159814917,
-0.009432283324434958
],
"d_mrr@10": -0.003679621578713932,
"d_mrr@10_ci": [
-0.0055008781854083595,
-0.0017209008833408014
],
"mcnemar_p": 1.8819747521132367e-11
},
"vs_embknn_balanced": {
"d_hr@10": 0.020466275137924893,
"d_hr@10_ci": [
0.015127246841074922,
0.025627335824879874
],
"d_mrr@10": 0.017651915129224236,
"d_mrr@10_ci": [
0.01421929070020367,
0.02114898572586773
],
"mcnemar_p": 8.883400844804864e-14
}
},
"eval_gpu": "NVIDIA L4",
"evaluated_at": "2026-09-29T11:14:55Z",
"context_ablations": {
"no_context": {
"hr@10": 0.041110517885744796,
"mrr@10": 0.01950525012033693,
"pct_change_hr@10": -33.23699421965317,
"pct_change_hr@10_ci95": [
-39.64649321266968,
-26.436781609195403
],
"pct_change_mrr@10": -42.43493515615617,
"pct_change_mrr@10_ci95": [
-49.3741780404384,
-35.22245199758977
],
"mean_context_sequences": 0.0
},
"random_context": {
"hr@10": 0.019754404698344902,
"mrr@10": 0.007489329049820195,
"pct_change_hr@10": -67.91907514450867,
"pct_change_hr@10_ci95": [
-73.18456788046039,
-62.63396894784444
],
"pct_change_mrr@10": -77.89704260494068,
"pct_change_mrr@10_ci95": [
-82.35918468816068,
-73.04899679853824
],
"mean_context_sequences": 8.0
}
}
},
"Software": {
"n_test_users_evaluated": 718,
"n_test_users_in_split": 718,
"flag": null,
"recicl_v0": {
"hr@3": 0.10167130919220056,
"hr@5": 0.12256267409470752,
"hr@10": 0.1573816155988858,
"mrr@3": 0.08983286916379477,
"mrr@5": 0.0945682452374182,
"mrr@10": 0.09920911284417827,
"loss": 8.473287451898155
},
"embknn_balanced": {
"hr@3": 0.07242339832869081,
"hr@5": 0.08774373259052924,
"hr@10": 0.1309192200557103,
"mrr@3": 0.029944290316204505,
"mrr@5": 0.03328690872966081,
"mrr@10": 0.0390475092969399,
"loss": 9.862932594373698
},
"embknn_last": {
"hr@3": 0.10306406685236769,
"hr@5": 0.13231197771587744,
"hr@10": 0.1713091922005571,
"mrr@3": 0.08890436407085249,
"mrr@5": 0.09551996299815377,
"mrr@10": 0.10036034862352614,
"loss": 9.816932444452908
},
"paired_differences_95ci": {
"vs_embknn_last": {
"d_hr@10": -0.013927576601671293,
"d_hr@10_ci": [
-0.03203342618384403,
0.005571030640668523
],
"d_mrr@10": -0.0011512357960826308,
"d_mrr@10_ci": [
-0.009422102290312597,
0.00782562618826542
],
"mcnemar_p": 0.20263875106454401
},
"vs_embknn_balanced": {
"d_hr@10": 0.026462395543175504,
"d_hr@10_ci": [
0.0069637883008356605,
0.04596100278551532
],
"d_mrr@10": 0.06016160410310832,
"d_mrr@10_ci": [
0.04537651434761468,
0.07661199263828095
],
"mcnemar_p": 0.01445383353382763
}
},
"eval_gpu": "NVIDIA L4",
"evaluated_at": "2026-09-29T11:12:30Z",
"context_ablations": {
"no_context": {
"hr@10": 0.15459610027855153,
"mrr@10": 0.09153733946237723,
"pct_change_hr@10": -1.7699115044247926,
"pct_change_hr@10_ci95": [
-12.381163084702909,
9.890381895332398
],
"pct_change_mrr@10": -7.732932148935379,
"pct_change_mrr@10_ci95": [
-16.936256020977453,
1.2985526363363442
],
"mean_context_sequences": 0.0
},
"random_context": {
"hr@10": 0.04456824512534819,
"mrr@10": 0.033185767398986314,
"pct_change_hr@10": -71.68141592920354,
"pct_change_hr@10_ci95": [
-80.17665045682287,
-62.59908536585367
],
"pct_change_mrr@10": -66.54967830313211,
"pct_change_mrr@10_ci95": [
-76.83137579538865,
-54.930787982373936
],
"mean_context_sequences": 8.0
}
}
}
},
"macro_mean_7": {
"recicl_v0": {
"hr@10": 0.1390810843398162,
"mrr@10": 0.09355228239514829
},
"embknn_balanced": {
"hr@10": 0.11207443075966694,
"mrr@10": 0.06307460142705772
},
"embknn_last": {
"hr@10": 0.1471064365910456,
"mrr@10": 0.09372087010221936
}
},
"context_ablations_note": "same checkpoint, TEST split and protocol, batch 1; 'no_context' = 0 context sequences, 'random_context' = 8 randomly chosen train-split sequences instead of the retrieved ones. pct_change = % change vs the reported numbers of this model; ci95 = paired bootstrap over test users (2,000 resamples)",
"source_files": "our evaluation outputs for this checkpoint: per-dataset TEST results and metadata; paired differences and n_test from our aggregate tables; context ablations from our ablation run"
}