Trifecta-Lab / deep_analysis.py
Brettapps's picture
Upload folder using huggingface_hub (part 21)
e23172f verified
Raw
History Blame Contribute Delete
10.2 kB
"""Final optimization — full grid search and per-date analysis."""
import json
from pathlib import Path
import sys
sys.path.insert(0, '/home/brettanthonysjoberg179/trifecta-bro-hf-space')
from trifecta_bro.data.models import RaceModel, RunnerModel
from trifecta_bro.model.scoring import score_runner
from trifecta_bro.model.pace_analysis import classify_pace
DATA_DIR = Path('/home/brettanthonysjoberg179/trifecta-bro-hf-space/data')
CACHE_DIR = DATA_DIR / 'cache'
RESULTS_DIR = DATA_DIR / 'results'
def load_cached_races(date: str) -> list[dict]:
races = []
for f in CACHE_DIR.glob('*.json'):
try:
with open(f) as fp:
data = json.load(fp)
if data.get('date') == date:
races.append(data)
except:
continue
return races
def load_results(date: str) -> dict:
result_lookup = {}
result_path = RESULTS_DIR / f"{date}-ra.json"
if not result_path.exists():
result_path = RESULTS_DIR / f"{date}.json"
if not result_path.exists():
return result_lookup
with open(result_path) as f:
rdata = json.load(f)
if isinstance(rdata, dict):
if 'tracks' in rdata:
for track, races in rdata['tracks'].items():
if isinstance(races, dict):
for rn, r in races.items():
runners = r.get('runners', [])
winners = []
for runner in runners:
pos = runner.get('position')
if pos and pos <= 3:
winners.append((pos, runner['number']))
winners.sort()
actual = [w[1] for w in winners]
if actual:
result_lookup[(track, int(rn))] = actual
elif isinstance(races, list):
for r in races:
if 'trifecta' in r:
result_lookup[(track, r.get('race', 0))] = [int(str(x).replace('e','')) for x in r['trifecta']]
else:
for track, races in rdata.items():
if isinstance(races, list):
for r in races:
if 'trifecta' in r:
result_lookup[(track, r['race'])] = [int(str(x).replace('e','')) for x in r['trifecta']]
return result_lookup
def score_race(race_data: dict, weights: dict) -> list[int] | None:
try:
runners = []
for r in race_data.get('runners', []):
if r.get('scratched'):
continue
runner = RunnerModel(
number=r['number'], name=r.get('name', ''),
jockey=r.get('jockey'), trainer=r.get('trainer'),
weight=r.get('weight'), barrier=r.get('barrier'),
age=r.get('age'), sex=r.get('sex'),
form=r.get('form', ''), last20_starts=r.get('last20Starts', ''),
stats=r.get('stats', {}),
)
runners.append(runner)
if len(runners) < 3:
return None
race = RaceModel(
date=race_data.get('date', ''), track=race_data.get('track', ''),
track_slug=race_data.get('slug', race_data.get('track', '').lower()),
race_number=race_data.get('raceNumber', 0),
race_name=race_data.get('raceName', ''),
distance=race_data.get('distance'),
condition=race_data.get('condition'),
race_class=race_data.get('raceClass'),
abandoned=race_data.get('abandoned', False),
start_time=race_data.get('startTime'),
prize_money=str(race_data.get('prizeMoney', '')),
number_of_runners=race_data.get('numberOfRunners', len(runners)),
runners=runners,
)
pace = classify_pace(race, runners)
scored = []
for r in runners:
sc = score_runner(r, race, pace, weights)
scored.append((r.number, sc['score']))
scored.sort(key=lambda x: x[1], reverse=True)
return [s[0] for s in scored[:3]]
except:
return None
def evaluate_date(date: str, weights: dict) -> dict:
result_lookup = load_results(date)
races = load_cached_races(date)
stats = {"total": 0, "top1": 0, "exact": 0, "box": 0}
for race_data in races:
track = race_data.get('track', '')
race_num = race_data.get('raceNumber', 0)
actual = result_lookup.get((track, race_num))
if not actual:
continue
pred = score_race(race_data, weights)
if not pred:
continue
stats["total"] += 1
if pred == actual:
stats["exact"] += 1
if set(pred) == set(actual):
stats["box"] += 1
if pred[0] == actual[0]:
stats["top1"] += 1
if stats["total"] > 0:
stats["top1_pct"] = stats["top1"] / stats["total"] * 100
return stats
def evaluate_all(dates: list[str], weights: dict) -> dict:
agg = {"total": 0, "top1": 0, "exact": 0, "box": 0}
for date in dates:
stats = evaluate_date(date, weights)
agg["total"] += stats["total"]
agg["top1"] += stats["top1"]
agg["exact"] += stats["exact"]
agg["box"] += stats["box"]
agg["top1_pct"] = agg["top1"] / agg["total"] * 100 if agg["total"] > 0 else 0
return agg
def main():
dates = ["2026-08-07", "2026-08-08", "2026-08-09", "2026-08-14"]
# Best weights from first pass
best = {
"form": 0.20, "class": 0.13, "distance": 0.08, "track": 0.08,
"track_distance": 0.08, "condition": 0.07, "jockey": 0.08,
"fitness": 0.05, "barrier": 0.13, "weight": 0.05, "pace": 0.04,
}
print("=" * 60)
print("OPTIMIZED WEIGHTS — PER DATE BREAKDOWN")
print("=" * 60)
total_races = 0
total_top1 = 0
for date in dates:
stats = evaluate_date(date, best)
if stats['total'] > 0:
total_races += stats['total']
total_top1 += stats['top1']
print(f"\n{date}: {stats['total']} races, {stats['top1']} top1 ({stats['top1']/stats['total']*100:.1f}%)")
# Show individual races
result_lookup = load_results(date)
races = load_cached_races(date)
for race_data in sorted(races, key=lambda x: (x.get('track', ''), x.get('raceNumber', 0))):
track = race_data.get('track', '')
race_num = race_data.get('raceNumber', 0)
actual = result_lookup.get((track, race_num))
if not actual:
continue
pred = score_race(race_data, best)
if not pred:
continue
status = "EXACT!" if pred == actual else ("TOP1!" if pred[0] == actual[0] else "")
if status:
print(f" {track} R{race_num}: Pred {'→'.join(str(x) for x in pred)} | Actual {'→'.join(str(x) for x in actual)} {status}")
print(f"\n{'='*60}")
print(f"TOTAL: {total_top1}/{total_races} ({total_top1/total_races*100:.1f}%)")
print(f"{'='*60}")
# Now try to optimize for Aug 14 specifically to understand what's different
print("\n" + "=" * 60)
print("AUG 14 DEEP DIVE")
print("=" * 60)
# Load Aug 14 results
result_lookup = load_results("2026-08-14")
races = load_cached_races("2026-08-14")
# For each race, show what the model missed
for race_data in sorted(races, key=lambda x: (x.get('track', ''), x.get('raceNumber', 0))):
track = race_data.get('track', '')
race_num = race_data.get('raceNumber', 0)
actual = result_lookup.get((track, race_num))
if not actual:
continue
pred = score_race(race_data, best)
if not pred:
continue
# Show top 3 picks vs actual
print(f"\n{track} R{race_num}:")
print(f" Actual: {'→'.join(str(x) for x in actual)}")
print(f" Predicted: {'→'.join(str(x) for x in pred)}")
# Show ranked runners
runners = []
for r in race_data.get('runners', []):
if r.get('scratched'):
continue
runner = RunnerModel(
number=r['number'], name=r.get('name', ''),
jockey=r.get('jockey'), trainer=r.get('trainer'),
weight=r.get('weight'), barrier=r.get('barrier'),
age=r.get('age'), sex=r.get('sex'),
form=r.get('form', ''), last20_starts=r.get('last20Starts', ''),
stats=r.get('stats', {}),
)
runners.append(runner)
race = RaceModel(
date='2026-08-14', track=track,
track_slug=track.lower(),
race_number=race_num,
race_name=race_data.get('raceName', ''),
distance=race_data.get('distance'),
condition=race_data.get('condition'),
race_class=race_data.get('raceClass'),
number_of_runners=race_data.get('numberOfRunners', len(runners)),
runners=runners,
)
pace = classify_pace(race, runners)
scored = []
for r in runners:
sc = score_runner(r, race, pace, best)
scored.append({
'no': r.number, 'name': r.name, 'score': sc['score'],
'barrier': r.barrier, 'weight': r.weight, 'form': r.form,
'win_pct': r.win_percent, 'place_pct': r.place_percent,
})
scored.sort(key=lambda x: x['score'], reverse=True)
print(f" Ranked:")
for i, s in enumerate(scored[:6]):
marker = " <-- WINNER" if s['no'] == actual[0] else ""
print(f" {i+1}. #{s['no']} {s['name'][:20]:<20} score={s['score']:.1f} b={s['barrier']} w={s['weight']} form={s['form']} win={s['win_pct']*100:.0f}%{marker}")
if __name__ == "__main__":
main()