Update evaluation: official Qwen3-Reranker and KaLM-Reranker-V1-Large-R2 added, seq-cls variants and ettin removed

#3
by yjoonjang - opened
Files changed (2) hide show
  1. README.md +14 -14
  2. assets/pps_vs_ndcg9.png +2 -2
README.md CHANGED
@@ -119,21 +119,22 @@ Evaluation was conducted using the [reranker-simple-benchmark](https://github.co
119
 
120
  <img src="./assets/pps_vs_ndcg9.png" width="700" alt="Reranking performance (mean nDCG@10) vs. throughput (mean PPS)">
121
 
122
- The figure plots mean nDCG@10 against mean PPS across the nine Korean benchmarks, including MLDR. Dot color marks model size. PPS uses each model's own input limit and its best measured batch size, so it measures neither speed at equal token lengths nor end-to-end retrieval latency.
123
 
124
  ### Results — MTEB-ko-retrieval (9 subsets)
125
  <!-- **공식 9개 subset 을 모두 평가한 모델**의 9-subset mean NDCG@10, PPS -->
126
  | Model | Params | Mean NDCG@10 | Mean PPS |
127
  |---|---|---|---|
128
- | tomaarsen/Qwen3-Reranker-8B-seq-cls | 7.6B | 0.9004 | 15.1 |
129
- | tomaarsen/Qwen3-Reranker-4B-seq-cls | 4.0B | 0.8956 | 24.3 |
 
130
  | **nlpai-lab/KURE-Reranker-base** | 1.7B | 0.8849 | 55.1 |
131
  | **nlpai-lab/KURE-Reranker-nano** | 149M | 0.8808 | 473.7 |
132
  | zeroentropy/zerank-2-reranker | 4.0B | 0.8695 | 29.4 |
133
  | lightonai/LightOn-rerank-PW-4B | 4.5B | 0.8664 | 15.0 |
134
  | mixedbread-ai/mxbai-rerank-large-v2 | 1.5B | 0.8661 | 65.2 |
135
  | BAAI/bge-reranker-v2-m3 | 568M | 0.8586 | 404.1 |
136
- | tomaarsen/Qwen3-Reranker-0.6B-seq-cls | 596M | 0.8585 | 99.6 |
137
  | nvidia/llama-nemotron-rerank-1b-v2 | 1.2B | 0.8522 | 127.3 |
138
  | nlpai-lab/LAMAR-600m | 568M | 0.8406 | 408.8 |
139
  | dragonkue/bge-reranker-v2-m3-ko | 568M | 0.8263 | 401.5 |
@@ -141,9 +142,8 @@ The figure plots mean nDCG@10 against mean PPS across the nine Korean benchmarks
141
  | upskyy/ko-reranker-8k | 568M | 0.8085 | 404.0 |
142
  | Dongjin-kr/ko-reranker | 560M | 0.7950 | 482.8 |
143
  | telepix/PIXIE-Spell-Reranker-Preview-0.6B | 596M | 0.7806 | 99.6 |
144
- | cross-encoder/ettin-reranker-1b-v1 | 1.0B | 0.6901 | 49.7 |
145
 
146
- PPS is measured on a single NVIDIA RTX A6000 48GB per model and averaged over the nine benchmarks. Inputs are length-sorted and dynamically padded within each batch.
147
 
148
  `jinaai/jina-reranker-v3` and `jinaai/jina-reranker-v3.5` are listwise rerankers that cannot be compared under the same 8,192-token condition on MLDR, so they are excluded from the 9-subset table and their MLDR cells are left blank below.
149
 
@@ -151,8 +151,9 @@ PPS is measured on a single NVIDIA RTX A6000 48GB per model and averaged over th
151
 
152
  | Model | Params | Ko-StrategyQA | AutoRAGRetrieval | PublicHealthQA | BelebeleRetrieval | MIRACLRetrieval | MrTidyRetrieval | MultiLongDocRetrieval | SQuADKorV1Retrieval | LawIRKo |
153
  |---|---|---|---|---|---|---|---|---|---|---|
154
- | tomaarsen/Qwen3-Reranker-8B-seq-cls | 7.6B | 0.8679 | 0.9546 | 0.8893 | 0.9907 | 0.8490 | 0.8409 | 0.8220 | 0.9880 | 0.9014 |
155
- | tomaarsen/Qwen3-Reranker-4B-seq-cls | 4.0B | 0.8733 | 0.9707 | 0.8685 | 0.9906 | 0.8533 | 0.8321 | 0.8105 | 0.9861 | 0.8752 |
 
156
  | **nlpai-lab/KURE-Reranker-base** | 1.7B | 0.8548 | 0.9762 | 0.8716 | 0.9880 | 0.8371 | 0.7970 | 0.8163 | 0.9891 | 0.8343 |
157
  | **nlpai-lab/KURE-Reranker-nano** | 149M | 0.8582 | 0.9741 | 0.8475 | 0.9830 | 0.8400 | 0.8011 | 0.7966 | 0.9895 | 0.8368 |
158
  | jinaai/jina-reranker-v3.5 | 597M | 0.8539 | 0.9838 | 0.8094 | 0.9733 | 0.8565 | 0.8194 | — | 0.9887 | 0.8545 |
@@ -161,7 +162,7 @@ PPS is measured on a single NVIDIA RTX A6000 48GB per model and averaged over th
161
  | lightonai/LightOn-rerank-PW-4B | 4.5B | 0.8567 | 0.9321 | 0.8693 | 0.9882 | 0.8072 | 0.8091 | 0.7609 | 0.9803 | 0.7938 |
162
  | mixedbread-ai/mxbai-rerank-large-v2 | 1.5B | 0.8563 | 0.9531 | 0.8772 | 0.9778 | 0.7939 | 0.8771 | 0.6787 | 0.9681 | 0.8130 |
163
  | BAAI/bge-reranker-v2-m3 | 568M | 0.8487 | 0.9663 | 0.8475 | 0.9853 | 0.8129 | 0.8222 | 0.6690 | 0.9853 | 0.7906 |
164
- | tomaarsen/Qwen3-Reranker-0.6B-seq-cls | 596M | 0.8336 | 0.9308 | 0.8489 | 0.9779 | 0.8507 | 0.7359 | 0.7813 | 0.9808 | 0.7867 |
165
  | nvidia/llama-nemotron-rerank-1b-v2 | 1.2B | 0.8536 | 0.9480 | 0.8491 | 0.9883 | 0.8182 | 0.8026 | 0.6719 | 0.9858 | 0.7527 |
166
  | nlpai-lab/LAMAR-600m | 568M | 0.8461 | 0.9591 | 0.8225 | 0.9835 | 0.8214 | 0.7975 | 0.5679 | 0.9850 | 0.7822 |
167
  | dragonkue/bge-reranker-v2-m3-ko | 568M | 0.8232 | 0.9684 | 0.8708 | 0.9769 | 0.7573 | 0.6776 | 0.7061 | 0.9846 | 0.6721 |
@@ -169,14 +170,14 @@ PPS is measured on a single NVIDIA RTX A6000 48GB per model and averaged over th
169
  | upskyy/ko-reranker-8k | 568M | 0.8143 | 0.9230 | 0.8388 | 0.9291 | 0.7249 | 0.6998 | 0.5975 | 0.9718 | 0.7770 |
170
  | Dongjin-kr/ko-reranker | 560M | 0.8468 | 0.9014 | 0.7675 | 0.9759 | 0.8017 | 0.7772 | 0.3721 | 0.9785 | 0.7343 |
171
  | telepix/PIXIE-Spell-Reranker-Preview-0.6B | 596M | 0.8329 | 0.9794 | 0.8534 | 0.9777 | 0.8449 | 0.7650 | 0.1829 | 0.9850 | 0.6042 |
172
- | cross-encoder/ettin-reranker-1b-v1 | 1.0B | 0.6624 | 0.8901 | 0.7461 | 0.6914 | 0.7004 | 0.6659 | 0.3651 | 0.9590 | 0.5306 |
173
 
174
  ### Per-dataset PPS
175
 
176
  | Model | Params | Ko-StrategyQA | AutoRAGRetrieval | PublicHealthQA | BelebeleRetrieval | MIRACLRetrieval | MrTidyRetrieval | MultiLongDocRetrieval | SQuADKorV1Retrieval | LawIRKo |
177
  |---|---|---|---|---|---|---|---|---|---|---|
178
- | tomaarsen/Qwen3-Reranker-8B-seq-cls | 7.6B | 16.6 | 7.3 | 17.5 | 19.4 | 24.9 | 26.5 | 0.7 | 10.6 | 12.3 |
179
- | tomaarsen/Qwen3-Reranker-4B-seq-cls | 4.0B | 26.1 | 11.8 | 28.4 | 31.5 | 40.0 | 42.4 | 1.1 | 17.2 | 20.0 |
 
180
  | **nlpai-lab/KURE-Reranker-base** | 1.7B | 59.2 | 27.3 | 64.6 | 71.1 | 89.1 | 97.1 | 2.6 | 39.1 | 45.7 |
181
  | **nlpai-lab/KURE-Reranker-nano** | 149M | 475.4 | 233.2 | 569.7 | 630.9 | 765.8 | 855.2 | 16.5 | 330.8 | 386.0 |
182
  | jinaai/jina-reranker-v3.5 | 597M | 141.0 | 38.6 | 148.6 | 174.6 | 277.3 | 295.7 | — | 68.4 | 86.7 |
@@ -185,7 +186,7 @@ PPS is measured on a single NVIDIA RTX A6000 48GB per model and averaged over th
185
  | lightonai/LightOn-rerank-PW-4B | 4.5B | 16.2 | 7.3 | 18.6 | 19.5 | 23.4 | 26.1 | 0.7 | 10.7 | 12.4 |
186
  | mixedbread-ai/mxbai-rerank-large-v2 | 1.5B | 70.0 | 32.9 | 76.8 | 84.1 | 104.2 | 113.6 | 3.2 | 47.0 | 54.7 |
187
  | BAAI/bge-reranker-v2-m3 | 568M | 420.7 | 195.6 | 471.3 | 545.3 | 653.2 | 724.8 | 9.3 | 271.6 | 345.5 |
188
- | tomaarsen/Qwen3-Reranker-0.6B-seq-cls | 596M | 107.1 | 49.6 | 118.0 | 129.3 | 159.5 | 173.9 | 4.2 | 71.8 | 82.9 |
189
  | nvidia/llama-nemotron-rerank-1b-v2 | 1.2B | 133.7 | 54.4 | 146.9 | 163.0 | 220.0 | 243.1 | 3.9 | 84.9 | 95.9 |
190
  | nlpai-lab/LAMAR-600m | 568M | 418.0 | 196.5 | 480.5 | 557.2 | 656.7 | 742.5 | 9.2 | 275.0 | 343.8 |
191
  | dragonkue/bge-reranker-v2-m3-ko | 568M | 416.9 | 195.1 | 467.2 | 540.7 | 653.4 | 716.7 | 9.2 | 271.9 | 342.7 |
@@ -193,7 +194,6 @@ PPS is measured on a single NVIDIA RTX A6000 48GB per model and averaged over th
193
  | upskyy/ko-reranker-8k | 568M | 411.8 | 195.6 | 474.3 | 551.4 | 649.3 | 726.0 | 9.2 | 275.1 | 342.8 |
194
  | Dongjin-kr/ko-reranker | 560M | 520.8 | 258.0 | 510.1 | 554.8 | 747.6 | 765.2 | 272.7 | 334.4 | 381.2 |
195
  | telepix/PIXIE-Spell-Reranker-Preview-0.6B | 596M | 104.6 | 49.4 | 117.8 | 129.8 | 160.5 | 175.6 | 4.3 | 72.1 | 82.6 |
196
- | cross-encoder/ettin-reranker-1b-v1 | 1.0B | 52.4 | 19.9 | 51.4 | 65.6 | 92.7 | 97.2 | 3.8 | 31.2 | 33.4 |
197
 
198
  Batch size starts at 8 and doubles until an out-of-memory error. Samples are repeated to fill complete batches. After warmup, three full passes are timed with CUDA events. Throughput is the total number of processed pairs divided by the accumulated GPU forward time. The highest-throughput successful batch is reported. Tokenization, data loading, and CPU preprocessing are excluded. The batch-search approach is informed by the [Ettin reranker speed benchmark](https://huggingface.co/blog/ettin-reranker#speed).
199
 
 
119
 
120
  <img src="./assets/pps_vs_ndcg9.png" width="700" alt="Reranking performance (mean nDCG@10) vs. throughput (mean PPS)">
121
 
122
+ The figure plots mean nDCG@10 against mean PPS across the nine Korean benchmarks, including MLDR. Dot color marks model size. PPS uses each model's own input limit and its best measured batch size, so it measures neither speed at equal token lengths nor end-to-end retrieval latency. The x-axis is a non-uniform log scale that stretches 20–26 and compresses 26–50 pairs/s so that nearby points stay readable.
123
 
124
  ### Results — MTEB-ko-retrieval (9 subsets)
125
  <!-- **공식 9개 subset 을 모두 평가한 모델**의 9-subset mean NDCG@10, PPS -->
126
  | Model | Params | Mean NDCG@10 | Mean PPS |
127
  |---|---|---|---|
128
+ | Qwen/Qwen3-Reranker-8B | 8.2B | 0.9030 | 15.2 |
129
+ | KaLM-Embedding/KaLM-Reranker-V1-Large-R2 | 7.5B | 0.8960 | 25.3 |
130
+ | Qwen/Qwen3-Reranker-4B | 4.0B | 0.8957 | 24.3 |
131
  | **nlpai-lab/KURE-Reranker-base** | 1.7B | 0.8849 | 55.1 |
132
  | **nlpai-lab/KURE-Reranker-nano** | 149M | 0.8808 | 473.7 |
133
  | zeroentropy/zerank-2-reranker | 4.0B | 0.8695 | 29.4 |
134
  | lightonai/LightOn-rerank-PW-4B | 4.5B | 0.8664 | 15.0 |
135
  | mixedbread-ai/mxbai-rerank-large-v2 | 1.5B | 0.8661 | 65.2 |
136
  | BAAI/bge-reranker-v2-m3 | 568M | 0.8586 | 404.1 |
137
+ | Qwen/Qwen3-Reranker-0.6B | 596M | 0.8577 | 100.2 |
138
  | nvidia/llama-nemotron-rerank-1b-v2 | 1.2B | 0.8522 | 127.3 |
139
  | nlpai-lab/LAMAR-600m | 568M | 0.8406 | 408.8 |
140
  | dragonkue/bge-reranker-v2-m3-ko | 568M | 0.8263 | 401.5 |
 
142
  | upskyy/ko-reranker-8k | 568M | 0.8085 | 404.0 |
143
  | Dongjin-kr/ko-reranker | 560M | 0.7950 | 482.8 |
144
  | telepix/PIXIE-Spell-Reranker-Preview-0.6B | 596M | 0.7806 | 99.6 |
 
145
 
146
+ PPS is measured on a single NVIDIA RTX A6000 48GB per model and averaged over the nine benchmarks. For each benchmark, every model is timed on the same ~550 sampled query–document pairs (whole queries, fixed seed). Inputs are length-sorted and dynamically padded within each batch. Models run in bf16 with flash_attention_2, except `KaLM-Embedding/KaLM-Reranker-V1-Large-R2`, which uses sdpa because transformers does not support flash_attention_2 for T5Gemma2.
147
 
148
  `jinaai/jina-reranker-v3` and `jinaai/jina-reranker-v3.5` are listwise rerankers that cannot be compared under the same 8,192-token condition on MLDR, so they are excluded from the 9-subset table and their MLDR cells are left blank below.
149
 
 
151
 
152
  | Model | Params | Ko-StrategyQA | AutoRAGRetrieval | PublicHealthQA | BelebeleRetrieval | MIRACLRetrieval | MrTidyRetrieval | MultiLongDocRetrieval | SQuADKorV1Retrieval | LawIRKo |
153
  |---|---|---|---|---|---|---|---|---|---|---|
154
+ | Qwen/Qwen3-Reranker-8B | 8.2B | 0.8720 | 0.9653 | 0.8899 | 0.9908 | 0.8513 | 0.8416 | 0.8255 | 0.9897 | 0.9013 |
155
+ | KaLM-Embedding/KaLM-Reranker-V1-Large-R2 | 7.5B | 0.8796 | 0.9415 | 0.8956 | 0.9936 | 0.8382 | 0.8500 | 0.7970 | 0.9863 | 0.8824 |
156
+ | Qwen/Qwen3-Reranker-4B | 4.0B | 0.8733 | 0.9630 | 0.8702 | 0.9904 | 0.8559 | 0.8298 | 0.8161 | 0.9861 | 0.8766 |
157
  | **nlpai-lab/KURE-Reranker-base** | 1.7B | 0.8548 | 0.9762 | 0.8716 | 0.9880 | 0.8371 | 0.7970 | 0.8163 | 0.9891 | 0.8343 |
158
  | **nlpai-lab/KURE-Reranker-nano** | 149M | 0.8582 | 0.9741 | 0.8475 | 0.9830 | 0.8400 | 0.8011 | 0.7966 | 0.9895 | 0.8368 |
159
  | jinaai/jina-reranker-v3.5 | 597M | 0.8539 | 0.9838 | 0.8094 | 0.9733 | 0.8565 | 0.8194 | — | 0.9887 | 0.8545 |
 
162
  | lightonai/LightOn-rerank-PW-4B | 4.5B | 0.8567 | 0.9321 | 0.8693 | 0.9882 | 0.8072 | 0.8091 | 0.7609 | 0.9803 | 0.7938 |
163
  | mixedbread-ai/mxbai-rerank-large-v2 | 1.5B | 0.8563 | 0.9531 | 0.8772 | 0.9778 | 0.7939 | 0.8771 | 0.6787 | 0.9681 | 0.8130 |
164
  | BAAI/bge-reranker-v2-m3 | 568M | 0.8487 | 0.9663 | 0.8475 | 0.9853 | 0.8129 | 0.8222 | 0.6690 | 0.9853 | 0.7906 |
165
+ | Qwen/Qwen3-Reranker-0.6B | 596M | 0.8336 | 0.9321 | 0.8477 | 0.9779 | 0.8470 | 0.7325 | 0.7819 | 0.9804 | 0.7865 |
166
  | nvidia/llama-nemotron-rerank-1b-v2 | 1.2B | 0.8536 | 0.9480 | 0.8491 | 0.9883 | 0.8182 | 0.8026 | 0.6719 | 0.9858 | 0.7527 |
167
  | nlpai-lab/LAMAR-600m | 568M | 0.8461 | 0.9591 | 0.8225 | 0.9835 | 0.8214 | 0.7975 | 0.5679 | 0.9850 | 0.7822 |
168
  | dragonkue/bge-reranker-v2-m3-ko | 568M | 0.8232 | 0.9684 | 0.8708 | 0.9769 | 0.7573 | 0.6776 | 0.7061 | 0.9846 | 0.6721 |
 
170
  | upskyy/ko-reranker-8k | 568M | 0.8143 | 0.9230 | 0.8388 | 0.9291 | 0.7249 | 0.6998 | 0.5975 | 0.9718 | 0.7770 |
171
  | Dongjin-kr/ko-reranker | 560M | 0.8468 | 0.9014 | 0.7675 | 0.9759 | 0.8017 | 0.7772 | 0.3721 | 0.9785 | 0.7343 |
172
  | telepix/PIXIE-Spell-Reranker-Preview-0.6B | 596M | 0.8329 | 0.9794 | 0.8534 | 0.9777 | 0.8449 | 0.7650 | 0.1829 | 0.9850 | 0.6042 |
 
173
 
174
  ### Per-dataset PPS
175
 
176
  | Model | Params | Ko-StrategyQA | AutoRAGRetrieval | PublicHealthQA | BelebeleRetrieval | MIRACLRetrieval | MrTidyRetrieval | MultiLongDocRetrieval | SQuADKorV1Retrieval | LawIRKo |
177
  |---|---|---|---|---|---|---|---|---|---|---|
178
+ | Qwen/Qwen3-Reranker-8B | 8.2B | 16.5 | 7.4 | 17.6 | 19.4 | 25.0 | 26.6 | 0.7 | 10.8 | 12.4 |
179
+ | KaLM-Embedding/KaLM-Reranker-V1-Large-R2 | 7.5B | 28.6 | 12.4 | 28.5 | 33.7 | 39.6 | 43.8 | 0.8 | 18.7 | 21.4 |
180
+ | Qwen/Qwen3-Reranker-4B | 4.0B | 26.2 | 11.8 | 28.2 | 31.1 | 40.1 | 42.8 | 1.1 | 17.1 | 19.9 |
181
  | **nlpai-lab/KURE-Reranker-base** | 1.7B | 59.2 | 27.3 | 64.6 | 71.1 | 89.1 | 97.1 | 2.6 | 39.1 | 45.7 |
182
  | **nlpai-lab/KURE-Reranker-nano** | 149M | 475.4 | 233.2 | 569.7 | 630.9 | 765.8 | 855.2 | 16.5 | 330.8 | 386.0 |
183
  | jinaai/jina-reranker-v3.5 | 597M | 141.0 | 38.6 | 148.6 | 174.6 | 277.3 | 295.7 | — | 68.4 | 86.7 |
 
186
  | lightonai/LightOn-rerank-PW-4B | 4.5B | 16.2 | 7.3 | 18.6 | 19.5 | 23.4 | 26.1 | 0.7 | 10.7 | 12.4 |
187
  | mixedbread-ai/mxbai-rerank-large-v2 | 1.5B | 70.0 | 32.9 | 76.8 | 84.1 | 104.2 | 113.6 | 3.2 | 47.0 | 54.7 |
188
  | BAAI/bge-reranker-v2-m3 | 568M | 420.7 | 195.6 | 471.3 | 545.3 | 653.2 | 724.8 | 9.3 | 271.6 | 345.5 |
189
+ | Qwen/Qwen3-Reranker-0.6B | 596M | 105.9 | 49.4 | 117.9 | 130.3 | 162.6 | 177.4 | 4.3 | 70.8 | 83.6 |
190
  | nvidia/llama-nemotron-rerank-1b-v2 | 1.2B | 133.7 | 54.4 | 146.9 | 163.0 | 220.0 | 243.1 | 3.9 | 84.9 | 95.9 |
191
  | nlpai-lab/LAMAR-600m | 568M | 418.0 | 196.5 | 480.5 | 557.2 | 656.7 | 742.5 | 9.2 | 275.0 | 343.8 |
192
  | dragonkue/bge-reranker-v2-m3-ko | 568M | 416.9 | 195.1 | 467.2 | 540.7 | 653.4 | 716.7 | 9.2 | 271.9 | 342.7 |
 
194
  | upskyy/ko-reranker-8k | 568M | 411.8 | 195.6 | 474.3 | 551.4 | 649.3 | 726.0 | 9.2 | 275.1 | 342.8 |
195
  | Dongjin-kr/ko-reranker | 560M | 520.8 | 258.0 | 510.1 | 554.8 | 747.6 | 765.2 | 272.7 | 334.4 | 381.2 |
196
  | telepix/PIXIE-Spell-Reranker-Preview-0.6B | 596M | 104.6 | 49.4 | 117.8 | 129.8 | 160.5 | 175.6 | 4.3 | 72.1 | 82.6 |
 
197
 
198
  Batch size starts at 8 and doubles until an out-of-memory error. Samples are repeated to fill complete batches. After warmup, three full passes are timed with CUDA events. Throughput is the total number of processed pairs divided by the accumulated GPU forward time. The highest-throughput successful batch is reported. Tokenization, data loading, and CPU preprocessing are excluded. The batch-search approach is informed by the [Ettin reranker speed benchmark](https://huggingface.co/blog/ettin-reranker#speed).
199
 
assets/pps_vs_ndcg9.png CHANGED

Git LFS Details

  • SHA256: 5b10c89e253670c6d812bd652cee8c9b9591983ede58a9d7ce7472fde6653c95
  • Pointer size: 131 Bytes
  • Size of remote file: 113 kB

Git LFS Details

  • SHA256: 8ecd1b0fb6e76331af76672d4ccf542f3395f0e57ef8ce85aae3abb36af76b47
  • Pointer size: 131 Bytes
  • Size of remote file: 144 kB