- LHC-0 W4 — نظام استرجاع EN↔AR بمعمارية معرفية بلا طبقات مكدَّسة
- 1) ما الذي يفعله النظام فعليًا
- 2) بيانات التدريب (مجمّع 3,605,197 زوجًا من 16 مجموعة — التدريب الفعلي على 300K مثال)
- 3) منهجية التقييم
- 4) النتائج الرئيسية (n=300، المرشحون=300، seed=41)
- 5) المقارنة الخارجية على مجموعات التقييم الذهبية (n=300)
- 6) المتانة العربية (تشوهات مُصنَّعة اصطناعيًا — موسومة كذلك)
- 7) السرعة (محدَّث 2026-10-03 — المُرمِّز الدفعي v3)
- 8) الثقة والموثوقية (محدَّثة بإعادة تقييم v2)
- 9) القيود الصادقة
- 10) إعادة الإنتاج
- 11) الرخصة والبيانات (مُحدَّثة 2026-10-03 بعد مراجعة التراخيص)
- 12) English summary (neutral)
- 1) ما الذي يفعله النظام فعليًا
LHC-0 W4 — نظام استرجاع EN↔AR بمعمارية معرفية بلا طبقات مكدَّسة
نظام استرجاع ثنائي اللغة (إنجليزي↔عربي) مبني على معمارية مستوحاة من الفص الأيسر: صفر طبقات مكدَّسة (العمق عبر التكرار الزمني فقط)، يتكوّن من مرمّز تبايني مُدرَّب، وذاكرة معرفة، وحاسبة رمزية، ومراقبة ثقة معرفية.
تسمية صادقة: أسماء المكوّنات (بروكا، فيرنيكه، الحُصين…) استعارات وظيفية تربط كل مكوّن بمنطقة معروفة في الشق الأيسر — وليست ادعاءً بيولوجيًا. و«المراقبة المعرفية» تعني وصولًا وظيفيًا لحالات النظام الداخلية؛ لا ادعاء بqualia ولا بتجربة ذاتية.
1) ما الذي يفعله النظام فعليًا
- الاسترجاع هو مسار الإجابة:
answer()= ترميز السؤال → تشابه جيبي مقابل الذاكرة → أعلى نتيجة (top-1). لا توليد نصوص. - المرمّز: مصفوفة
W: 32768×128(≈4.2M وسيط) على ميزات مجزّأة (hashed slot features)، مُدرَّبة بـInfoNCE + تنافر الأشقاء على 300,000 مثال مُجسَّد مسحوب ببذرة ثابتة من مجمّع 3,605,197 زوجًا (40% منها أزواج موازية حقيقية). - الذاكرة: قاعدة معرفة (243 حقيقة، 151KB) + استرجاع جيبي.
- الحاسبة: محلل BODMAS رمزي مكتوب يدويًا — غير متعلَّم؛ «العمق» خطوات إجرائية متتابعة بميزانية خطوات، وليس حسابًا عصبيًا.
- الثقة:
conf = ½·top1 + ½·gap(عتبة 0.45)، أو مسار معايَر (Platt) عند تمريرcalibrator.
حالة الاستخدام المقصودة (خطة v2): بحث دلالي عربي↔إنجليزي فوق قاعدة معرفة خاصة (استرجاع فوق مستندات/معرفة المستخدم). النظام ليس مترجمًا آليًا ولا مولّد نصوص.
2) بيانات التدريب (مجمّع 3,605,197 زوجًا من 16 مجموعة — التدريب الفعلي على 300K مثال)
| الدلو | المصادر | الادعاء |
|---|---|---|
| A — عام | NLLB 400K · UNPC 300K · CCMatrix 300K · CCAligned 150K · MultiUN 150K · wikimedia 100K · XLEnt 100K + المزيج الأصلي (TED2020/QED/News-Commentary/Wikipedia/GlobalVoices/TED2013/KDE4/WikiMatrix ≈ 2.1M) | تعميم عابر للمجالات |
| B — كلاسيكي | ATHAR 30K (عربية كلاسيكية) | استهداف مجال — موسوم صراحةً |
| لا يُدرَّب أبدًا | Tanzil · bible-uedin · NeuLab-TedTalks | تقييم فقط (حارس آلي) |
المجموع أعلاه مُثبت من phase_w4_data.py الأصلي (CCMatrix=300K، CCAligned=150K).
دقة الصياغة: المجمّع 3,605,197 زوجًا، لكن ما يُدرَّب فعليًا 300,000 مثال مُجسَّد
(LHC_W4_NEX=300000) يُسحب منه ببذرة ثابتة (توزيع: 40% أزواج موازية + 25% معزولة
مُعزَّزة + 20% slot-aware + 15% حماية صناعية)، ثم 40,000 خطوة × دفعة 128 (≈5.12M عرض).
تنبيه إفصاح (تدقيق v8 — «توافر» ≠ «تعرّض» ≠ «حفظ»، 2026-10-03):
- التوافر (قناع v7، مسح معكوس كامل): نسبة عناصر التقييم التي يشابه نصها صفوفًا في المجمّع: Tanzil 9.4% · Bible 3.9% · NeuLab-TED 99.2% · FLORES 0.2% (إنجليزي فقط).
- التعرّض الفعلي (إعادة تشغيل منطق أمثلة التدريب بنفس البذور من المجمّع ذاته): معدل سحب أي صف إلى الأمثلة = 119,961/3,608,654 = **3.32%**؛ وبمطابقة النصوص الحرفية مع عناصر التقييم: Tanzil 8 عناصر (0.04%) · Bible 5 (0.03%) · TED 1,448 (7.2%) · FLORES 0 — التوافر أوسع من التعرّض بمقدار ~100–200× في Tanzil/Bible. (تقدير احتمالي مستقل: 3.1 / 4.8 / 2,438 / 0.1 — نفس الرتبة.)
- فجوة النتيجة (مموّه−نظيف): +0.05 (Tanzil) و+0.18 (Bible) لـar→en بدلالة إحصائية — لكن اختبار التحكم بنموذج e5-small غير المُدرَّب على هذه المجموعات يُظهر فجوة مماثلة أو أكبر على نفس العناصر ⇒ الفجوة اختيار عناصر بالأساس، ولا تُنسب للحفظ.
- الخلاصة العملية: أرقام Tanzil/Bible/FLORES المعروضة للتقييم هي أرقام العناصر النظيفة (القسم 4.2)؛ أرقام TED غير قابلة للتعميم (مهمة سهلة نسبيًا حتى للمراجع القوية). لا دليل قائمًا على «حفظ مادي» مؤثر في المجموعات الثلاث الأولى.
3) منهجية التقييم
- المهمة: twin-retrieval ثنائي الاتجاه: تُسترجع الجملة التوأم الحقيقي من بين 300 مرشح (التوأم + 299 مشتّتًا من نفس المجموعة)؛ النجاح = نص التوأم المُرجَّع يطابق الحقيقي.
- العينة (محدَّثة): البروتوكول الأساسي الآن الكتل الكاملة: كل مجموعة (20,000) تُقسَّم إلى 66 كتلة × 300 عنصرًا (بذرة 41) ويُقيَّم كل عنصر داخل كتلته (R@1، WTA). تبقى أرقام n=300 (seed=41) للتوافق مع قياسات المراجع، وALL يُعاد تعريفه صراحةً (ALL-بدون-TED-نظيف) بدل المدمج الثلاثي.
- حمولة التقييم الفعلية: 20,000 زوجًا لكل مجموعة (حد التنزيل في
download_corpus). - الفواصل: ويلسون 95% لكل رقم (الجدول الكامل في
wilson_table.md).
4) النتائج الرئيسية (n=300، المرشحون=300، seed=41)
⚠ هذا الجدول على المجموعات الكاملة (قبل التنقية) — لعرض الحد الأعلى/المقارنة مع النشر السابق. الأرقام المعتمدة للتقييم هي العناصر النظيفة بكتل 300 في §4.2.
| المجموعة | W4 | 95% CI (ar→en / en→ar) | W4.1-Robust |
|---|---|---|---|
| Tanzil | 0.230/0.247 | [0.186–0.281] / [0.201–0.298] | 0.240/0.243 |
| Bible | 0.497/0.477 | [0.440–0.553] / [0.421–0.533] | 0.560/0.520 |
| NeuLab-TED † | 0.917/0.903 | [0.889–0.939] / [0.871–0.929] | 0.913/0.910 |
| ALL | 0.590/0.610 | [0.534–0.644] / [0.554–0.663] | 0.623/0.597 |
† استرجاع ذاكرة (توافر 99.2%، تعرّض فعلي 7.2%) — لا يُحتسب تعميمًا (انظر القسم 2). ‡ «ALL» هنا = المدمج الثلاثي (يشمل TED)؛ رقم التعميم البديل: 0.393/0.367 (انظر §4.2).
FLORES-101 devtest (n=1,012؛ فحص التسرّب: الجانب العربي 0/1012 في كل الطبقات — الجانب الإنجليزي جملتان متطابقتان حرفيًا 0.2% موثّقتان):
| النظام | ar→en R@1 / R@5 / MRR | en→ar R@1 / R@5 / MRR |
|---|---|---|
| LHC-0 W4 | 0.9358 / 0.9802 / 0.9561 | 0.9338 / 0.9832 / 0.9549 |
| LHC-0 W4.1 | 0.9348 / 0.9802 / 0.9545 | 0.9476 / 0.9792 / 0.9636 |
| LaBSE (مرجع) | 0.9980 / 0.9990 / 0.9985 | 0.9990 / 0.9990 / 0.9990 |
| multilingual-e5-small (مرجع) | 0.9417 / 0.9921 / 0.9637 | 0.9684 / 0.9970 / 0.9802 |
| fastText+Procrustes (مُدرَّب على نفس الـ3.6M) | 0.9101 / 0.9704 / 0.9379 | 0.6818 / 0.8498 / 0.7599 |
ملاحظة إتمام القياس: نواة Kaggle (ج) أكملت التدريب والمحاذاة (‖XW−Y‖=0.513) لكنها انكسرت قبل التقييم (مسار FLORES)؛ أُعيد إنتاج خط الأنابيب محليًا بنفس النصوص والبذور (11 و41) من مخرجات النواة نفسها، وطابق المُتبقّي (residual) بالضبط 0.513 — الأرقام أعلاه من التشغيل المحلي المتحقّق (recon/fasttext_local_eval.py).
⚠️ تحذير مجال (مهم للقراءة): FLORES تتقاطع موضوعيًا مع بيانات تدريبنا (Wikipedia والأخبار: WikiMatrix/Wikipedia/News-Commentary) — فهي مجموعة «مريحة» نسبيًا لنموذجنا، وقربه من e5-small عليها لا يعني قربًا مماثلًا خارج المجال. على المجموعات الأصعب (ALL على Tanzil/Bible/TED غير المنقّاة) الفارق لصالح e5-small واضح (0.680 مقابل 0.590).
قراءة إحصائية مقترنة — McNemar الدقيق على نفس الـ1,012 جملة (2026-10-03): (لا نستنتج من تداخل فواصل ويلسون لبيانات مقترنة.)
| المقارنة | Δ | b01/b10 | McNemar p | Bootstrap مقترن 95% | الحكم |
|---|---|---|---|---|---|
| W4 − e5-small، ar→en | −0.006 | 51/45 | 0.610 | [−0.025, +0.013] | غير دال |
| W4.1 − e5-small، ar→en | −0.007 | 53/46 | 0.547 | [−0.027, +0.013] | غير دال |
| W4 − e5-small، en→ar | −0.035 | 62/27 | 2.7×10⁻⁴ | [−0.053, −0.017] | دال |
| W4.1 − e5-small، en→ar | −0.021 | 49/28 | 0.022 | [−0.038, −0.004] | دال |
| W4 − fastText+Proc، ar→en | +0.026 | 51/77 | 0.027 | [+0.004, +0.047] | دال (لصالحنا) |
| W4.1 − fastText+Proc، ar→en | +0.025 | 52/77 | 0.034 | [+0.003, +0.046] | دال (لصالحنا) |
| W4 − fastText+Proc، en→ar | +0.252 | 26/281 | <10⁻³⁰⁰ | [+0.222, +0.283] | دال (لصالحنا) |
| W4.1 − fastText+Proc، en→ar | +0.266 | 19/288 | <10⁻³⁰⁰ | [+0.236, +0.295] | دال (لصالحنا) |
- ar→en: الفرق الصغير لا يصل للدلالة (p≈0.55–0.61) — العدد الحقيقي للمقارنة هو الإصابات المتقاطعة (b01/b10) وليس تداخل الفواصل.
- en→ar: e5-small متقدم بدلالة إحصائية موثوقة (+0.021 إلى +0.035).
- مقابل fastText+Procrustes (مرجع قوي من عائلته المعجمية ذاتها): LHC-0 متقدم بدلالة في الاتجاهين (+0.025/+0.026 بـp≈0.03 في ar→en — وهو الفرق الصغير الذي لم يصل للدلالة ضد e5 — و+0.25/+0.27 بـp≈0 في en→ar) ⇒ معنويات محدودة بـ128 بُعدًا ومحاذاة خطية تتفوق على fastText 128بُعدًا بمحاذاة Procrustes مُشرَفة على 250K زوجًا.
- الملفات الخام:
results/mcnemar_flores.json+results/mcnemar_fasttext.json+ صفائف الإصابات فيflores_per_item_hits.npz.
4.2) التقييم النظيف — بكتل 300 على كل العناصر (بلا عيّنة 300)
المنهجية (محدَّثة وفق المراجعة): كل مجموعة كاملة (20,000) تُقسَّم إلى 66 كتلة × 300 عنصرًا (خلط بذرة 41) ويُقيَّم كل عنصر داخل كتلته، ثم نفصل: عناصر مموّهة (توافر تدريبي) مقابل نظيفة ⇒ اختبار فجوة التسرب.
| المجموعة (W4) | كامل (66×300) | مموّه | نظيف | فجوة التسرب 95% |
|---|---|---|---|---|
| Tanzil | 0.2194/0.2138 | 0.2641/0.2582 | 0.2148/0.2092 | +0.049 [+0.029, +0.070] p<10⁻⁵ |
| Bible | 0.5159/0.4907 | 0.6863/0.6876 | 0.5089/0.4826 | +0.177 [+0.144, +0.210] p<10⁻¹⁰ |
| NeuLab-TED | 0.9098/0.9043 | 0.9097/0.9047 | 0.8896/0.8571 (n=154) | +0.02/+0.05 غير دال (تشبّع) |
| FLORES (3×300) | 0.9711/0.9678 | — (n=2) | 0.9710/0.9677 | لا يُقاس (n=2) |
(W4.1 نظيف — كتل 300: Tanzil 0.2174/0.2180 · Bible 0.5489/0.5247.)
- اختبار التحكم الحاسم: e5-small (لم يُدرَّب على هذه المجموعات) على نفس العناصر: فجوته مموّه−نظيف على Bible = +0.127/+0.142 مقابل +0.084/+0.058 لـLHC على نفس الكتل ⇒ الفجوة اختيار عناصر بالأساس لا حفظ خاص بـLHC؛ نُبقي الأرقام النظيفة لأنها الأقل تحيّزًا، ونعرض الفجوة كما هي بدل نسبتها للحفظ.
- مقارنات مقترنة على العناصر النظيفة فقط (McNemar مقابل e5-small؛ 4 كتل/مجموعة): Tanzil: ar→en لصالح e5 (Δ=−0.035، p=0.043) وen→ar لصالحنا (Δ=+0.059، p=4×10⁻⁴)؛ Bible: e5 متقدم بوضوح (Δ=−0.164 و−0.328، p≈0)؛ FLORES (كتل 300): ar→en لصالحنا (Δ=+0.023، p=0.009)، en→ar متعادل (p=0.11).
- LaBSE على نفس الكتل النظيفة (أُنجز — نفس 4 كتل/مجموعة ونفس العناصر، تحقق آلي من تطابق القناع):
| المجموعة | LaBSE نظيف | LHC-0 W4 نظيف | Δ (LHC−LaBSE) | p |
|---|---|---|---|---|
| Tanzil | 0.5184/0.7284 | 0.2376/0.2449 | −0.281/−0.483 | <10⁻¹⁰ (n=483/607) |
| Bible | 0.9402/0.9692 | 0.5031/0.4820 | −0.437/−0.487 | <10⁻¹⁰ |
| NeuLab-TED (نظيف=13) | 0.923/1.000 | 0.923/0.923 | 0.000/−0.077 | غير دال (n≤2) |
| FLORES | 0.9989/0.9989 | 0.9710/0.9677 | −0.028/−0.031 | 2×10⁻⁷ (n=25/28) |
⇒ الصورة النظيفة الصحيحة: LaBSE (470M) متقدم علينا في كل المجموعات (بدلالة)، لكن الفجوة تتفاوت جذريًا: ~2.8–3.1 نقطة على FLORES (≈97% من LaBSE، بمعامل 1% من الحجم) مقابل ~28–49 نقطة على Tanzil/Bible (مصادر شبه مؤكد أنها في بيانات تدريب LaBSE).
- اختبار ضبط إضافي (فجوة القناع عند LaBSE نفسه): مموّه−نظيف = +0.122/+0.079 (Tanzil)، +0.060/+0.031 (Bible)، +0.0011 (FLORES) ⇒ نموذج خارجي كبير يُظهر فجوة مماثلة على المجموعتين الملوّثتين وصفرًا على FLORES — تأكيد مستقل بأن القناع يقيس تداخلًا حقيقيًا في بيانات التدريب، ومع ذلك تبقى نسبة الفجوة إلى الحفظ غير محدَّدة (اختبار e5 أعلاه).
- LaBSE نفسه يفقد نقاطًا على العناصر النظيفة (Tanzil 0.530→0.518) — دليل على أن التقارير غير النظيفة تُنفخ لأي نموذج، لا لنا فقط.
- «ALL»: لا يُقدَّم المدمج (0.590/0.610) كرقم تعميم — تركيبه يضم TED. الرقم المعتمد للمركّب: **ALL-بدون-TED-نظيف = 0.393/0.367 (W4) و0.407/0.390 (W4.1)**؛ الفرق عن 0.590/0.610 يعكس التركيب وسهولة TED (وليست حفظًا مُثبتًا — انظر الإفصاح §2).
- حساسية العتبة (0.35→0.65): نظيف Tanzil 17,078→19,251 وBible 19,043→19,518 —
والأداء مستقر ضمن الضجيج. خام:
results/threshold_sweep_v2.json+clean_eval_blocks.json. - استدعاء مولّد المرشحين (مكررات مزروعة، 353 جملة + تشوهات): v7 يلتقط 100%
(تنقيط/تشكيل/تطبيع/خلط/تبديل كلمة) و≥99.7% عند تغيير نصف الكلمات؛ فلتر v6 القديم
(simhash≤4): 28% عند كلمة و2–7% عند كلمتين (هذا سبب تفويت v6 المُكتشف)؛ منحنى
القرار متدرّج (شامل: 100% حتى كلمتين → 83% عند 4 → 70% عند 5).
خام:
results/recall_planted_sweep.json.
5) المقارنة الخارجية على مجموعات التقييم الذهبية (n=300)
† عمود ALL في الجدول أعلاه مبني على المدمج الثلاثي (يشمل TED) — للمقارنات التركيبية فقط، وليس رقم تعميم؛ رقم التعميم المعتمد: ALL-بدون-TED-نظيف = 0.393/0.367 (W4).
| النموذج | Tanzil | Bible | NeuLab-TED † | ALL ‡ |
|---|---|---|---|---|
| LHC-0 W4 (4.2M وسيطًا) | 0.230/0.247 | 0.497/0.477 | 0.917/0.903 | 0.590/0.610 |
| LaBSE (~470M) | 0.667/0.847 | 0.973/1.000 | 0.980/0.990 | 0.857/0.923 |
| multilingual-e5-small (~118M) | 0.413/0.340 | 0.803/0.863 | 0.930/0.973 | 0.680/0.673 |
| fastText+Procrustes (same-3.6M، مرجعنا الأدنى) ‡ | 0.123/0.050 | 0.473/0.163 | 0.827/0.447 | 0.507/0.230 |
- e5-small أعلى من LHC-0 في الاتجاهات الثمانية كلها على هذه المجموعات الكاملة (فروق تتجاوز تداخل الفواصل هنا، بخلاف حالة FLORES). لكن على العناصر النظيفة المقترنة (McNemar، §4.2) تنقلب الصورة جزئيًا: LHC يتقدم في Tanzil en→ar (p=4×10⁻⁴) وFLORES ar→en بكتل 300 (p=0.009)، ويتعادلان en→ar/FLORES؛ وe5 يفوز في Bible والتشكيل. الفرق الأساسي: LaBSE/e5 لم يُقاسا بعد على نفس العينات النظيفة الكاملة (LaBSE مؤجَّل، e5 جزئي) — الانقلاب الجزئي مشروط بإتمامهما.
- حُذفت نسب «من LaBSE على ALL» واستُبدلت بأرقام نظيفة مقيسة فعليًا (جدول §4.2): على FLORES النظيفة (لا تداخل لأي من الطرفين) = 97.2%/96.9% من LaBSE؛ على Tanzil/Bible النظيفة = 45.9%/33.6% و53.5%/49.7% من LaBSE. أي نسبة «من LaBSE» تُذكر مصحوبة دائمًا بالمجموعة والاتجاه وحجم العينة، ولا تُذكر أبدًا على «ALL» المدمج.
- ‡ قيم TED لهذا المرجع منخفضة لأن أزواج TED محفوظة في تدريبه بنسبة 99.2% — لكن قياسه مدرَج للأمانة ولأن جلّ أرقامه (Tanzil 0.123، Bible 0.473، FLORES en→ar 0.682) تُظهر فجوة كبيرة بكلا الاتجاهين.
6) المتانة العربية (تشوهات مُصنَّعة اصطناعيًا — موسومة كذلك)
محدَّثة: على ALL-نظيف (Tanzil-نظيف + Bible-نظيف، 37,332 عنصرًا؛ TED مستثناة لأن النظيف منها 154 عنصرًا — قيد معلن). متوسط±انحراف على 10 بذور تشويه (0–9)، عيّنة seed=41:
| الحالة (ALL-نظيف) | W4 | W4.1 |
|---|---|---|
| نظيف | 0.393/0.367 | 0.407/0.390 |
| تشكيل اصطناعي | 0.167±0.013 / 0.171±0.015 | 0.291±0.020 / 0.247±0.019 |
| تطبيع (أ/ة/ى/أرقام) | 0.323/0.333 | 0.410/0.380 (حتمي، ع=0) |
| إطالة (tatweel) | 0.344±0.021 / 0.312±0.011 | 0.387±0.015 / 0.353±0.016 |
| مجمّع | 0.138±0.010 / 0.158±0.013 | 0.279±0.018 / 0.236±0.018 |
| لهجة مصرية (test 865، W4.1) | — | 0.280/0.303 |
- الأرقام السابقة (تشكيل 0.496±0.017 على ALL الملوَّث) كانت مرتفعة بسبب تركيب ALL (TED السهلة) — الأرقام أعلاه على النظيف هي المعتمدة.
- التطبيع حتمي ومعامل تغايره صفر (تحقق مستقل من بروتوكول القياس). بذور معلنة (0–9).
- خام:
results/robust_clean.json(+robust_10seed_v2.jsonللملوَّث كمرجع).
7) السرعة (محدَّث 2026-10-03 — المُرمِّز الدفعي v3)
المكسب المُنجَز (قياس داخلي موثوق — نفس العملية، أدنى 3 جولات):
recon/features_v3.py — مخزون تجزئة على مستوى الكلمة/الثنائية + تراكم numpy دفعي
(بدل MD5 لكل ميزة في كل استدعاء):
| السيناريو | الأساسي | v3 الدفعي | التسريع |
|---|---|---|---|
| 1000 استعلام — بارد | 0.199 ث | 0.170 ث | 1.17× |
| 1000 استعلام — ساخن (مخزون مُعمَّر) | 0.189 ث | 0.052 ث | 3.63× |
| مجموعة كاملة 20,000 نص | 4.65 ث | 1.87 ث | 2.49× |
- التكافؤ بايت-بايت مُثبَت: 10,032/10,032 نص مطابق عنصر-بعنصر، والمتجهات النهائية بـ0.0 فرق (W4 وW4.1)، وإصابات FLORES الفعلية مطابقة 100% للأرشيف (947/945/946/959).
- رحلة التحسين الصادقة: matmul دفعي = 44.7× على الضرب وحده لكن 1.08× e2e
(التجزئة ≈97%)؛
features_fast= 1.27–1.64×؛ v3 = الحسم — عنق الزجاجة كان التجزئة نفسها، وقُطع بمخزون + متجهات. - خام:
results/speed_bench_v3_final.json+speed_bench_v3_corpus.json+verify_v3.py(سكربت الإثبات).
المقارنة الخارجية (تنبيه منهجي مهم): الأرقام المنشورة سابقًا (e5-small 0.62–0.92 وLaBSE 0.90–3.54 ث/1000) قِيست على عتاد Colab وبجمل Tatoeba القصيرة — لا تُقارن مباشرة بقياسات CPU هنا. قياس إعادة بنفس الجلسة/النصوص (1000 جملة عربية من مجموعات التقييم، حاوية 2 vCPU) أعطى e5-small ≈21–22 ث/1000 (أي فارق يزيد عن مئة ضعف لصالحنا هنا) — لكن الحاوية متغيّرة الإنتاجية (نفس القياس تذبذب 5.5–26 ث/1000 حسب الحمل)، لذلك **لا يُنشر أي رقم خارجي جديد قبل قياس مضبوط على عتاد ثابت (نواة Kaggle، جولة واحدة)**؛ وهو مدرَج كخطوة تالية. الأرقام الداخلية أعلاه هي المتينة والقابلة للنشر.
8) الثقة والموثوقية (محدَّثة بإعادة تقييم v2)
- إعادة تقييم v2 (924 حالة، 8 فئات) عند العتبة الافتراضية 0.45: القاعدة الأصلية 100% قبول (وصحيح)، المعزَّزة 64.7% قبول (وصحيح)، القوالب الجديدة 6.5% فقط (ومن قبِل منها 16.7% فقط كان صحيحًا)، **العامية المصرية 0%**، وكل فئات OOD (جمل FLORES حقيقية عربية/إنجليزية، أسئلة مصنوعة، هراء) 0% تسريب.
- المقايضة المقيسة: عتبة 0.35 → قبول أوسع (15.1% للقوالب الجديدة) مقابل تسريب 0.7%.
- المعاير (Platt) عند فصل ضبط حقيقي (نصف/نصف): رفض OOD 45.2% وقبول in-KB 43.1% — أضعف من العتبة الخام؛ أرقامه القديمة (ECE=0.026) لا تُستنسخ على المجموعة الأصعب → يُوسم تجريبيًا.
- التحذير القديم (n=42) يبقى موثقًا: عيّنته صغيرة ولا تُعمَّم.
9) القيود الصادقة
- ليس نموذجًا توليديًا — استرجاع + ذاكرة؛ لا يولّد نصًا حرًا.
- أرقام TED: تُعرض للتتبع فقط. توافر 99.2% لكن **التعرّض الفعلي 7.2%**؛ والمهمة نفسها سهلة نسبيًا (LaBSE 0.98/e5 0.93/fastText 0.83) — لا تصلح كمقياس تعميم صعب.
- مكاسب Tanzil/Bible: مزيج تعميم عام + استهداف مجال (ATHAR) — تجربة المحاذاة (بدون ATHAR) لم تُظهر دليلًا حاسمًا على اعتماد المكاسب على ATHAR (فروق ±0.05 بعلامات متعارضة بين الاتجاهين؛ تشخيص واحد لكل ضلع — يلزم تعدد بذور).
- فروق FLORES مقابل e5-small: محسومة اختبار McNemar — ar→en غير دالة (p≈0.55–0.61)، en→ar دالة لصالح e5-small؛ ومقابل fastText+Procrustes نحن متقدمون بدلالة (إفصاح أعلاه).
- التقييم استرجاع توائم (300 مرشحًا) — وليس ترجمة توليدية، ولا يقيس الطلاقة.
- الفجوة مقابل المراجع الكبيرة (إفصاح صريح): LaBSE (470M) يتقدم LHC-0 (4.2M) في كل المجموعات النظيفة بدلالة إحصائية؛ الفجوة ضئيلة على FLORES (2.8–3.1 نقطة) وواسعة على Tanzil/Bible (وهما مصدران شبه مؤكد وجودهما في تدريب LaBSE نفسه).
- بنود مؤجّلة معلنة (لا تُفسَّر النتائج بدلًا عنها): (أ) توسيع مقارنة e5/LaBSE النظيفة من 4 كتل/مجموعة إلى 66 كتلة/مجموعة؛ (ب) قياس السرعة الخارجية المضبوط على عتاد ثابت (Kaggle) — الأرقام الخارجية القديمة لا تُنشر؛ (ج) إعادة بناء التعرّض تحققت بنسبة 99.26% (نصوص فريدة 579,457 مقابل 583,763) — الأرقام تقديرية بنفس الرتبة، ومصدر الفرق نسخة مجمّع/ترتيب مختلف جوهريًا في جلسة التدريب؛ (د) ترميز LaBSE بُتر عند 128 رمزًا (قيد ذاكرة الحاوية: 2GB/2 vCPU) — القيد معلن وقد يخفض أرقامه قليلًا على الجمل الطويلة.
10) إعادة الإنتاج
LHC0_Reproduce_Colab.ipynb— دفتر مستقل يعيد إنتاج 38 قيمة منشورة بتأكيدات آلية (24 جدول ذهبي + 12 FLORES + 2 متانة) من أوزان HF الحالية؛ مُختبَر على بيئة نظيفة (كود المشروع الأصلي 100%).CONFIDENCE_PACK.md+wilson_table.md— فواصل الثقة لكل رقم + جدول الرخص- قيود الاستخدام قبل النشر.
LEAK_AUDIT_REPORT.md— تقرير تدقيق التسرب (Tanzil/Bible/TED/FLORES ضد كامل بيانات التدريب 3,605,197 زوجًا).
11) الرخصة والبيانات (مُحدَّثة 2026-10-03 بعد مراجعة التراخيص)
⚠️ تغيير وسم الترخيص: الأوزان ليست Apache-2.0 — خليط بيانات التدريب يفرض قيودًا.
الوسم الآن other، والاستخدام بحثي غير تجاري حتى تُراجع التراخيص قانونيًا.
- غير تجاري/مقيَّد: Tanzil (تقييم — «لأغراض غير تجارية فقط»)، QED (445K، «لأغراض البحث فقط»)، TED-domain (TED2020/TED2013/NeuLab-TedTalks — سياسة TED).
- CC BY-SA 4.0 (نسب + مشاركة بالمثل): FLORES-101 (تقييم — تصحيح: المستودع
الرسمي
facebook/floresيذكر CC-BY-SA 4.0، وليس CC BY-NC-SA كما ادّعت مرآة Kaggle)، ATHAR، Wikipedia/WikiMatrix/wikimedia/GlobalVoices. - بلا رخصة نصية معلنة: CCMatrix (300K زوجًا) — مخاطرة قانونية تحتاج تسوية.
- نسب إلزامي: الأمم المتحدة (UNPC/MultiUN)، TED، OPUS ومؤلفو المجموعات.
- إعادة التوزيع: مستودع
lhc-w4-dataيعيد حاليًا توزيع shards تشمل QED وTED وCCMatrix — يجب حذف هذه الشاردات الثلاث أو تقييدها والاكتفاء بسكربتات التنزيل من المصادر الأصلية (خطة التنفيذ فيCONFIDENCE_PACK.md§2.4). - أمني (معلَّق): توكن HF القديم مذكور نصًّا في نسخة
phase_w4_data.pyداخل مخرجات نواة Kaggle الخاصة — يجب تدويره قبل النشر العام، مع التأكد من عدم وجود نسخ في أي مستودع عام. - مجموعات التقييم لا تُعاد توزيعًا هنا — تُحمَّل من مصادرها الرسمية مباشرة.
12) English summary (neutral)
LHC-0 W4 is a retrieval-based EN↔AR system — not an LLM, not generative, not a translation engine: a 4.2M-parameter contrastive hashed-feature encoder (32768×128) trained on 300K distilled examples sampled from a 3.6M-pair pool (40% real parallel pairs) with InfoNCE + sibling repulsion, a 151KB knowledge memory, a hand-written symbolic BODMAS calculator, and metacognitive confidence scoring — zero stacked layers. Intended use case (v2 plan): Arabic↔English semantic search over a private knowledge base.
Evaluation integrity (2026-10 audit, three distinct notions measured separately):
availability (fuzzy text overlap in the pool): Tanzil 9.4%, Bible 3.9%, TED 99.2%,
FLORES 0.2%; actual exposure (exact texts inside the sampled 300K examples, 3.32%
per-row sampling rate): Tanzil 8 items (0.04%), Bible 5 (0.03%), TED 1,448 (7.2%),
FLORES 0; score gap (masked−clean) is +0.05/+0.18 (Tanzil/Bible, significant) but a
control with e5-small, which never trained on these corpora, shows comparable or larger
gaps on the same items — so the gap is mostly item selection, not proven memorization.
Clean-set headline numbers (full 300-block evaluation of all items): Tanzil 0.215/0.209,
Bible 0.509/0.483, TED 0.890/0.857 (n=154), FLORES 0.971/0.968 (300-candidate blocks);
ALL-without-TED-clean = 0.393/0.367 (W4) / 0.407/0.390 (W4.1). Paired McNemar on clean
items: vs e5-small the picture is mixed (Tanzil en→ar favors LHC p=4e-4, ar→en favors e5;
Bible favors e5; FLORES blocks favor LHC ar→en p=0.009, tie en→ar); vs LaBSE (now
measured on the identical clean items) LaBSE leads in every set — but the margin varies
by an order of magnitude: 2.8–3.1 points on fully-clean FLORES (≈97% of LaBSE at 1% of
its parameter count) versus 28–49 points on Tanzil/Bible (sources almost certainly
present in LaBSE's own training data). LaBSE itself also loses points on masked-out items
(Tanzil 0.530→0.518) and shows a mask gap of +0.122/+0.079 there versus +0.0011 on FLORES
— independent confirmation that the mask tracks genuine training-data overlap.
Controlled cross-model speed remains a declared deferred item; LaBSE encoding was
truncated at 128 tokens (2GB/2-vCPU sandbox limit). Candidate-
generator recall, measured with planted near-duplicates, is ≥99.7% (the old simhash
filter caught only 2–28% of 1-2-word edits — the reason audit v6 under-reported).
Robustness is reported as 10-seed mean±std on the clean pool. Component names are
functional metaphors; no qualia claims. Full CIs, license table (weights tagged other,
mixed-sources research use), leakage/exposure audit, and the standalone reproduction
notebook ship alongside this card.
الملف المرجعي: sayed125/lhc-0-brain (التقرير التقني) — والنسخة الإنجليزية
من هذا البطاقة أعلاه.