Download code/baseline_labse_blocks.py from sayed125/lhc-0-brain: direct link, hf CLI and curl.
- Browser
- Download file 5.72 kB
-
https://huggingface.co/sayed125/lhc-0-brain/resolve/main/code/baseline_labse_blocks.py
- Command line
-
hf download hf://sayed125/lhc-0-brain/code/baseline_labse_blocks.py
-
curl -L -o baseline_labse_blocks.py https://huggingface.co/sayed125/lhc-0-brain/resolve/main/code/baseline_labse_blocks.py
5.72 kB
| #!/usr/bin/env python3 | |
| # -*- coding: utf-8 -*- | |
| """baseline_labse_blocks.py — LaBSE على نفس كتل e5 (بذرة 41، 4 كتل×300 لكل مجموعة) | |
| نفس عناصر e5 بالضبط (تحقق صارم من تطابق القناع) + McNemar مقترن على النظيف فقط. | |
| LaBSE متناظر ⇒ ترميز واحد لكل نص (بلا بادئات).""" | |
| import os, sys, json, time | |
| import numpy as np | |
| sys.path.insert(0,"/home/user/lhc/code"); sys.path.insert(0,"/home/user/lhc/recon") | |
| from phase_w1_data import download_corpus | |
| from scipy.stats import binomtest | |
| import torch | |
| from transformers import AutoTokenizer, AutoModel | |
| torch.set_num_threads(2) | |
| T0=time.time(); log=lambda *a: print(f"[{time.time()-T0:6.1f}s]", *a, flush=True) | |
| R="/home/user/lhc/results"; BS=300; KBLOCKS=4 | |
| M=json.load(open(f"{R}/masks_v2.json")); masks={cn:set(M["masks_strong"][cn]) for cn in M["masks_strong"]} | |
| DD="/home/user/lhc/data/opus" | |
| OPUS=[("Tanzil","https://object.pouta.csc.fi/OPUS-Tanzil/v1/moses/ar-en.txt.zip",20000), | |
| ("Bible","https://object.pouta.csc.fi/OPUS-bible-uedin/v1/moses/ar-en.txt.zip",20000), | |
| ("NeuLab-TED","https://object.pouta.csc.fi/OPUS-NeuLab-TedTalks/v1/moses/ar-en.txt.zip",20000)] | |
| pairs={n:download_corpus(n,u,l,DD) for n,u,l in OPUS} | |
| DEV="/home/user/lhc/data/flores101_dataset/devtest" | |
| ld=lambda p:[l.strip() for l in open(p,encoding="utf-8") if l.strip()] | |
| pairs["FLORES"]=[{"ar":a,"en":e} for a,e in zip(ld(f"{DEV}/ara.devtest"),ld(f"{DEV}/eng.devtest"))] | |
| def blocks(n,seed=41): | |
| rng=np.random.RandomState(seed); idx=rng.permutation(n) | |
| return [idx[i:i+BS] for i in range(0,n-BS+1,BS)] | |
| tok=AutoTokenizer.from_pretrained("/var/tmp/labse"); model=AutoModel.from_pretrained("/var/tmp/labse").eval() | |
| def enc(texts, bs=16): | |
| out=[] | |
| with torch.no_grad(): | |
| for i in range(0,len(texts),bs): | |
| t=tok(texts[i:i+bs],padding=True,truncation=True,max_length=128,return_tensors="pt") | |
| h=model(**t).last_hidden_state; m=t["attention_mask"].unsqueeze(-1).float() | |
| out.append(((h*m).sum(1)/m.sum(1)).numpy()) | |
| return np.vstack(out) | |
| norm=lambda X: X/np.maximum(np.linalg.norm(X,axis=1,keepdims=True),1e-9) | |
| zh=np.load(f"{R}/block_hits.npz") | |
| out={"baseline":"LaBSE (sentence-transformers/LaBSE)","blocks_per_set":KBLOCKS,"block_size":BS,"seed":41, | |
| "protocol":"نفس عناصر e5 في baseline_clean_blocks.json (تحقق تطابق القناع)","subsets":{}} | |
| store={} | |
| for cn in ("Tanzil","Bible","NeuLab-TED","FLORES"): | |
| P=pairs[cn]; bl=blocks(len(P))[:KBLOCKS]; items=[int(i) for b in bl for i in b] | |
| ar=[P[i]["ar"] for i in items]; en=[P[i]["en"] for i in items] | |
| inmask=np.array([i in masks[cn] for i in items],bool) | |
| log(f"{cn}: {len(items)} عنصرًا — ترميز LaBSE ...") | |
| A=norm(enc(ar)); E=norm(enc(en)) | |
| s1=A@E.T; pred_aen=s1.argmax(1) # ar→en: لكل العربي، أقرب إنجليزي | |
| s2=E@A.T; pred_ear=s2.argmax(1) # en→ar | |
| hit_ae=np.array([en[pred_aen[i]]==en[i] for i in range(len(items))],bool) | |
| hit_ea=np.array([ar[pred_ear[j]]==ar[j] for j in range(len(items))],bool) | |
| n_used=KBLOCKS*BS | |
| lhc_ae=zh[f"{cn}|W4|ar_en"][:n_used]; lhc_ea=zh[f"{cn}|W4|en_ar"][:n_used]; lhc_m=zh[f"{cn}|W4|mask"][:n_used] | |
| assert np.array_equal(lhc_m,inmask), "عدم تطابق قناع مع e5/LHC!" | |
| c=~inmask | |
| res={"n":len(items),"n_clean":int(c.sum()),"n_masked":int(inmask.sum()), | |
| "labse":{"r1_ar_en":round(float(hit_ae.mean()),4),"r1_en_ar":round(float(hit_ea.mean()),4), | |
| "clean_ar_en":round(float(hit_ae[c].mean()),4),"clean_en_ar":round(float(hit_ea[c].mean()),4), | |
| "masked_ar_en":round(float(hit_ae[inmask].mean()),4) if inmask.any() else None, | |
| "masked_en_ar":round(float(hit_ea[inmask].mean()),4) if inmask.any() else None}, | |
| "lhc_w4":{"r1_ar_en":round(float(lhc_ae.mean()),4),"r1_en_ar":round(float(lhc_ea.mean()),4), | |
| "clean_ar_en":round(float(lhc_ae[c].mean()),4),"clean_en_ar":round(float(lhc_ea[c].mean()),4), | |
| "masked_ar_en":round(float(lhc_ae[inmask].mean()),4) if inmask.any() else None, | |
| "masked_en_ar":round(float(lhc_ea[inmask].mean()),4) if inmask.any() else None}} | |
| for dname,a,b in (("ar_en",lhc_ae[c],hit_ae[c]),("en_ar",lhc_ea[c],hit_ea[c])): | |
| b01=int(np.sum(~a&b)); b10=int(np.sum(a&~b)); n=b01+b10 | |
| p=float(binomtest(b01,n,0.5).pvalue) if n>0 else 1.0 | |
| res[f"mcnemar_clean_{dname}"]={"delta_lhc_minus_labse":round(float(a.mean()-b.mean()),4), | |
| "b01_labse_only":b01,"b10_lhc_only":b10,"p":round(p,6) if n>0 else None,"n_discordant":n} | |
| # فجوة التحكم لـLaBSE (مموّه−نظيف) — على نفس عناصر e5 | |
| res["labse_gap_masked_minus_clean"]={"ar_en":round(float(hit_ae[inmask].mean()-hit_ae[c].mean()),4) if inmask.any() else None, | |
| "en_ar":round(float(hit_ea[inmask].mean()-hit_ea[c].mean()),4) if inmask.any() else None} | |
| out["subsets"][cn]=res | |
| store[f"{cn}_labse_ar_en"]=hit_ae; store[f"{cn}_labse_en_ar"]=hit_ea; store[f"{cn}_items"]=np.array(items) | |
| log(f" LaBSE: كامل {res['labse']['r1_ar_en']}/{res['labse']['r1_en_ar']} | نظيف {res['labse']['clean_ar_en']}/{res['labse']['clean_en_ar']} | LHC نظيف {res['lhc_w4']['clean_ar_en']}/{res['lhc_w4']['clean_en_ar']}") | |
| for dname in ("ar_en","en_ar"): | |
| m=res[f"mcnemar_clean_{dname}"]; log(f" McNemar-نظيف [{dname}]: Δ={m['delta_lhc_minus_labse']:+.4f} p={m['p']} (b01={m['b01_labse_only']},b10={m['b10_lhc_only']})") | |
| np.savez_compressed(f"{R}/baseline_blocks_labse.npz", **store) | |
| json.dump(out, open(f"{R}/baseline_labse_blocks.json","w"), ensure_ascii=False, indent=1) | |
| log("SAVED results/baseline_labse_blocks.json + baseline_blocks_labse.npz") | |