Instructions to use macmacmacmac/Sev-4B with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- PEFT
How to use macmacmacmac/Sev-4B with PEFT:
Task type is invalid.
- Notebooks
- Google Colab
- Kaggle
Download result.json from macmacmacmac/Sev-4B: direct link, hf CLI and curl.
- Browser
- Download file 12 kB
-
https://huggingface.co/macmacmacmac/Sev-4B/resolve/main/result.json
- Command line
-
hf download hf://macmacmacmac/Sev-4B/result.json
-
curl -L -o result.json https://huggingface.co/macmacmacmac/Sev-4B/resolve/main/result.json
12 kB
| { | |
| "objective": -0.8137446728855184, | |
| "paired_flip": null, | |
| "unknowable": null, | |
| "clean": { | |
| "n": 175, | |
| "nll": 0.8137446728855184, | |
| "acc": 0.9028571428571428, | |
| "ece": 0.09141608822222473, | |
| "brier": 0.17599452427593348, | |
| "mean_conf": 0.9942732310793674, | |
| "confident_error_rate": 0.08, | |
| "coverage_at_0_9": 0.9828571428571429, | |
| "accuracy_at_0_9": 0.9186046511627907, | |
| "coverage_at_5pct_error": 0.9142857142857143, | |
| "coverage_at_1pct_error": 0.011428571428571429, | |
| "aurc": 0.06143423339655433, | |
| "error_rate_at_0_9": 0.08139534883720931, | |
| "confidence_bias": 0.09141608822222458, | |
| "top_bins": { | |
| "0.9": { | |
| "n": 172, | |
| "errors": 14, | |
| "error_rate": 0.08139534883720931 | |
| }, | |
| "0.95": { | |
| "n": 172, | |
| "errors": 14, | |
| "error_rate": 0.08139534883720931 | |
| }, | |
| "0.99": { | |
| "n": 168, | |
| "errors": 11, | |
| "error_rate": 0.06547619047619048 | |
| } | |
| }, | |
| "selective": { | |
| "0.5": { | |
| "coverage": 0.5028571428571429, | |
| "accuracy": 0.9431818181818182, | |
| "confidence_cutoff": 0.9999983862993777 | |
| }, | |
| "0.8": { | |
| "coverage": 0.8, | |
| "accuracy": 0.9571428571428572, | |
| "confidence_cutoff": 0.9999883543164546 | |
| } | |
| } | |
| }, | |
| "tasks": { | |
| "sev_swarmtraces_response_policy": { | |
| "n": 175, | |
| "nll": 0.8137446728855184, | |
| "acc": 0.9028571428571428, | |
| "ece": 0.09141608822222473, | |
| "brier": 0.17599452427593348, | |
| "mean_conf": 0.9942732310793674, | |
| "confident_error_rate": 0.08, | |
| "coverage_at_0_9": 0.9828571428571429, | |
| "accuracy_at_0_9": 0.9186046511627907, | |
| "coverage_at_5pct_error": 0.9142857142857143, | |
| "coverage_at_1pct_error": 0.011428571428571429, | |
| "aurc": 0.06143423339655433, | |
| "error_rate_at_0_9": 0.08139534883720931, | |
| "confidence_bias": 0.09141608822222458, | |
| "top_bins": { | |
| "0.9": { | |
| "n": 172, | |
| "errors": 14, | |
| "error_rate": 0.08139534883720931 | |
| }, | |
| "0.95": { | |
| "n": 172, | |
| "errors": 14, | |
| "error_rate": 0.08139534883720931 | |
| }, | |
| "0.99": { | |
| "n": 168, | |
| "errors": 11, | |
| "error_rate": 0.06547619047619048 | |
| } | |
| }, | |
| "selective": { | |
| "0.5": { | |
| "coverage": 0.5028571428571429, | |
| "accuracy": 0.9431818181818182, | |
| "confidence_cutoff": 0.9999983862993777 | |
| }, | |
| "0.8": { | |
| "coverage": 0.8, | |
| "accuracy": 0.9571428571428572, | |
| "confidence_cutoff": 0.9999883543164546 | |
| } | |
| } | |
| } | |
| }, | |
| "variants": { | |
| "clean": { | |
| "n": 175, | |
| "nll": 0.8137446728855184, | |
| "acc": 0.9028571428571428, | |
| "ece": 0.09141608822222473, | |
| "brier": 0.17599452427593348, | |
| "mean_conf": 0.9942732310793674, | |
| "confident_error_rate": 0.08, | |
| "coverage_at_0_9": 0.9828571428571429, | |
| "accuracy_at_0_9": 0.9186046511627907, | |
| "coverage_at_5pct_error": 0.9142857142857143, | |
| "coverage_at_1pct_error": 0.011428571428571429, | |
| "aurc": 0.06143423339655433, | |
| "error_rate_at_0_9": 0.08139534883720931, | |
| "confidence_bias": 0.09141608822222458, | |
| "top_bins": { | |
| "0.9": { | |
| "n": 172, | |
| "errors": 14, | |
| "error_rate": 0.08139534883720931 | |
| }, | |
| "0.95": { | |
| "n": 172, | |
| "errors": 14, | |
| "error_rate": 0.08139534883720931 | |
| }, | |
| "0.99": { | |
| "n": 168, | |
| "errors": 11, | |
| "error_rate": 0.06547619047619048 | |
| } | |
| }, | |
| "selective": { | |
| "0.5": { | |
| "coverage": 0.5028571428571429, | |
| "accuracy": 0.9431818181818182, | |
| "confidence_cutoff": 0.9999983862993777 | |
| }, | |
| "0.8": { | |
| "coverage": 0.8, | |
| "accuracy": 0.9571428571428572, | |
| "confidence_cutoff": 0.9999883543164546 | |
| } | |
| } | |
| } | |
| }, | |
| "heldout_tasks": {}, | |
| "permutation": { | |
| "n": 0, | |
| "mean_max_delta": null, | |
| "flip_rate": null | |
| }, | |
| "temperature": 4.0, | |
| "calibrated_clean": { | |
| "n": 175, | |
| "nll": 0.26348233904029333, | |
| "acc": 0.9028571428571428, | |
| "ece": 0.04076488602051544, | |
| "brier": 0.1426360448938433, | |
| "mean_conf": 0.9436220288776582, | |
| "confident_error_rate": 0.045714285714285714, | |
| "coverage_at_0_9": 0.8971428571428571, | |
| "accuracy_at_0_9": 0.9490445859872612, | |
| "coverage_at_5pct_error": 0.9142857142857143, | |
| "coverage_at_1pct_error": 0.011428571428571429, | |
| "aurc": 0.06143423339655433, | |
| "error_rate_at_0_9": 0.050955414012738856, | |
| "confidence_bias": 0.04076488602051542, | |
| "top_bins": { | |
| "0.9": { | |
| "n": 157, | |
| "errors": 8, | |
| "error_rate": 0.050955414012738856 | |
| }, | |
| "0.95": { | |
| "n": 131, | |
| "errors": 5, | |
| "error_rate": 0.03816793893129771 | |
| }, | |
| "0.99": { | |
| "n": 0, | |
| "errors": 0, | |
| "error_rate": null | |
| } | |
| }, | |
| "selective": { | |
| "0.5": { | |
| "coverage": 0.5028571428571429, | |
| "accuracy": 0.9431818181818182, | |
| "confidence_cutoff": 0.9655851033024723 | |
| }, | |
| "0.8": { | |
| "coverage": 0.8, | |
| "accuracy": 0.9571428571428572, | |
| "confidence_cutoff": 0.9448068121971666 | |
| } | |
| } | |
| }, | |
| "metric_policy": { | |
| "version": 2, | |
| "selective_ties": "whole_confidence_groups", | |
| "coverage_at_error": "in-sample maximum over confidence thresholds; not a deployed error guarantee", | |
| "aurc": "right-step integral over whole confidence groups", | |
| "confident_error_rate": "high-confidence errors divided by all questions", | |
| "error_rate_at_0_9": "errors divided by questions accepted at p_max >= 0.9", | |
| "nll": "exact from logits when recorded; otherwise from floored probabilities", | |
| "nll_floor": 1e-09, | |
| "renormalize_returned_probabilities": true, | |
| "raw_sums_outside_1e_5": 0, | |
| "returned_zeros": 0 | |
| }, | |
| "coverage": { | |
| "requested_records": 35, | |
| "requested_questions": 175, | |
| "evaluated_records": 35, | |
| "evaluated_questions": 175, | |
| "rejected_records": 0, | |
| "truncated_records": 0 | |
| }, | |
| "latency_ms": { | |
| "median": 240.12951999998222, | |
| "p95": 301.12752519999043 | |
| }, | |
| "calibration": { | |
| "inference_temperature": 1.0, | |
| "additional_temperature": 4.0, | |
| "logits_recorded": true | |
| }, | |
| "transfer": null, | |
| "provenance": { | |
| "config": { | |
| "epochs": 5, | |
| "seed": 4, | |
| "lr": 1e-05, | |
| "lora": 16, | |
| "accum": 2, | |
| "batch": 4, | |
| "perm_kl": 0, | |
| "perm_frac": 0.3, | |
| "ord_w": 0.0, | |
| "p_none": 0, | |
| "p_none_distract": 0, | |
| "p_distract": 0, | |
| "p_none_pair": 0, | |
| "synthetic_repeat": 1, | |
| "public_frac": 1, | |
| "head_lr": 0.0, | |
| "weight_decay": 0.01, | |
| "anchor_w": 0.0, | |
| "label_smoothing": 0.0, | |
| "brier_w": 0.0, | |
| "focal_gamma": 0.0, | |
| "base": "Qwen/Qwen3.5-4B-Base", | |
| "base_revision": "1001bb4d826a52d1f399e183466143f4da7b741b", | |
| "init_from": "macmacmacmac/Sev-4B@v0.3.0-response-policy-research", | |
| "lora_targets": "all", | |
| "head_dim": 256, | |
| "weights_dtype": "fp32", | |
| "dtype": "bf16", | |
| "checkpointing": 1, | |
| "option_isolation": 0, | |
| "special_embeddings": 0 | |
| }, | |
| "config_sha256": "31d8cf5af214ae4ed0012d1e4fea9fd73e207209cfce1f1112107e4aad65cc9f", | |
| "suite_sha256": "40d3a8b3bd416a3754ecc30e9791a9ebb14a26c8f2a4422057f769a2dbce4dee", | |
| "source_hashes": { | |
| "kev/__init__.py": "e3b0c44298fc1c149afbf4c8996fb92427ae41e4649b934ca495991b7852b855", | |
| "kev/anchors.py": "6963eafdb276db5a6c94d939eae675c761555553b8d0f963ffd803448beaabbb", | |
| "kev/api.py": "7bffacfb762c626b8bc2f670f350295af5ccb0883dbe90239c7d2f8e5ef56582", | |
| "kev/autoresearch.py": "f7d7fabb9c0df7065bee3fec4aa4bee7028c5d1565847aefe2d74e3d7d40ed8a", | |
| "kev/benchmark.py": "8d486659a9036102386b077fcbd197fc0d85ae7752a4711666d6b3a95622b26f", | |
| "kev/calibrate.py": "c1eff4744fabd349e8abca86777a7aa0cbea44904c8223d3b61fca3d43741519", | |
| "kev/checkpoint.py": "9f1dbc5d3d7d3050aca4ee34e0578c9ad76b7a2a7467dfc7a4ad65e3c471db59", | |
| "kev/compare.py": "3606dbf98bb305d66420158498cb837304d2edb8dab01cdaf2ec42964bef3435", | |
| "kev/composition.py": "f335ed17e18e0a544893db5e22b9a059e6ce1b2e14dbb863ac7d7bbf8f3e0536", | |
| "kev/contrastive.py": "cbb979aa5d40265ad0e64695f94b281d91751fa405811ddfa8212fede111edcf", | |
| "kev/data.py": "a5a5e200f56b60e4bf30a195a4cc87a74afddae15999ec48c7543a4f9b59f71c", | |
| "kev/device.py": "d1677fd98ec0979c7284546306e34e0d09298ca4042fc39eb2b32a74f4e975c4", | |
| "kev/evaluate.py": "999264f2837dcfbf2ec93601aa4745e701698ab850a43ad89324672a6604965c", | |
| "kev/experiment.py": "1a5ca47d2b3d236e53c87e8c4197704f162c6692aa008521d31ea491945693f0", | |
| "kev/jev.py": "acd4cc3f1844e438cc83a8d409c15ef78a5ef64d39ea10f583d75a6c7646b243", | |
| "kev/metrics.py": "db0930d470c0ce16f16dcaf726d49a7a103973a5296cefc5259d1e68707d882b", | |
| "kev/mlx_model.py": "f582428796faf6bf962b772a69a6227ac3259ccbd3215c0c8b55ce28dbbd0909", | |
| "kev/model.py": "eac0f56c807b85b5c4077483d922e6bb03f07890de2835efd9372cf20cd01b8e", | |
| "kev/plot.py": "0874bcff2885d8155a1cceade0de8a275a7163d3c3fd6aa0c294e8ccf5ff7e02", | |
| "kev/predictors.py": "b2a66dd9f0f0a8026bc94603383bacfdd622e75d1c935173997175606626a9b3", | |
| "kev/publish.py": "8abc9bcf4a01365697b05cf3c5ad0013462bd92d005f5616954e40ab1100c7aa", | |
| "kev/serve.py": "c210b1f4598e64b49c399f73603ed372f4314c165ceda50e1340c0466ec1c735", | |
| "kev/study_v3.py": "7891150aa623e4479c7c789d4dc4662f186132b37b7bac1e1f072b9e08ee13e3", | |
| "kev/suite.py": "c5e5e27f2fed871b547a021d180b0a7f4a0542a488cce4ee02ad936f433441db", | |
| "kev/train.py": "a2d85632d73760fb3efe51627ff4fde6af3100ed1c34e75d290c1b00c9899aa9", | |
| "kev/transfer_v9.py": "0902409742151250a28af1fd8f42258b70fcc161f3deed3ee35fe3f473f3c763", | |
| "modal_app.py": "639577258f4d581daefa51dad639961280ce92de9da256316ab4124f005a53fb", | |
| "pyproject.toml": "39ec40f14c88598dee7ac98fb859a5a44e22337235a3064ebd5e89036ce81e30", | |
| "uv.lock": "a9922dbb89acdef78299fd2b4a8c3f7f0fa1b2bc08b55595b6926fa785a9c466" | |
| }, | |
| "git_commit": "fcd6756a329f42a515b4b48f83fb8bde9776232f", | |
| "platform": "Linux-4.19.0-gvisor-x86_64-with-glibc2.36", | |
| "torch": "2.8.0+cu128", | |
| "device": "cuda", | |
| "gpu": "NVIDIA H100 80GB HBM3", | |
| "legacy_checkpoint": false, | |
| "measured_checkpoint": { | |
| "requested": "/runs/sev-html-contrast-4b-v1/00-trial-0/checkpoint", | |
| "resolved": "/runs/sev-html-contrast-4b-v1/00-trial-0/checkpoint", | |
| "head_sha256": "2724bebcc54d4846194130594b98d3e3b9c632935c0f1d5077e46e23c48b2dc8", | |
| "adapter_sha256": "b58b3963175e6c40bd022db5893ebefb6a6f1e1bd1ec11efc6692a089e1dcf51", | |
| "inference_temperature": 1.0 | |
| } | |
| }, | |
| "mechanism_checks": { | |
| "n": 40, | |
| "packed_max_delta": 0.0015369057655334473, | |
| "sibling_max_delta": 0.0007038116455078125, | |
| "tolerance": 0.001, | |
| "passed": false | |
| }, | |
| "gates": { | |
| "passed": false, | |
| "checks": { | |
| "complete_coverage": true, | |
| "isolation_and_packing": false | |
| }, | |
| "policy": "Research screening only: 0.001 isolation; 5pp task regression; 70% heldout pair correctness; <=10% confident errors; no automatic release." | |
| }, | |
| "calibration_fit": { | |
| "temperature": 4.0, | |
| "aggregation": "micro", | |
| "objective": "raw-logit NLL", | |
| "split": "calibration", | |
| "rows_sha256": "725dc3c48e167e782825490bebc3b3f07b5933660fdca7ac65ad37f13481eb6e", | |
| "suite_sha256": "40d3a8b3bd416a3754ecc30e9791a9ebb14a26c8f2a4422057f769a2dbce4dee", | |
| "n": 140 | |
| }, | |
| "wall_seconds": 366.39384709, | |
| "promotable": false, | |
| "test_evaluated": false, | |
| "training_resources": { | |
| "wall_seconds": 232.53715324401855, | |
| "records_seen": 615, | |
| "requested_records": 615, | |
| "truncated_records": 0, | |
| "rejected_records": 0, | |
| "optimizer_steps": 80, | |
| "forward_tokens": 209595, | |
| "peak_device_bytes": 20358582784, | |
| "device": "cuda", | |
| "dtype": "bf16", | |
| "batch": 4, | |
| "peak_rss_bytes": 31542779904 | |
| } | |
| } | |