Saito-Karuha/code_and_docs / Task_docs /task_audit_report.md
Saito-Karuha's picture
|
download
raw
10.4 kB
# CORAL Example Tasks — SFT Pipeline Compliance Audit
**审计日期:** 2026-07-15
**审计方式:** 逐个任务读取 task.yaml、seed/ 代码、eval/grader.py 或 grader/ 代码、pyproject.toml、workspace.setup
**总计:** 37 tasks | **可用:** 27 | **不可用:** 10
> 排除目录: `frontier_cs_research/`, `frontier_eng/`, `frontier_smith/`(子任务过多)
---
## 可用任务 (26)
### math/ (17) — 全部 legacy grader
所有 math/ 子任务结构一致: task.yaml + seed/ (initial_program.py + pyproject.toml) + eval/grader.py。依赖 numpy>=1.24.0 + scipy>=1.10.0(matmul 加 jax/optax,uncertainty_ineq 加 sympy,均为 pip-installable)。workspace.setup: "uv sync"。任务描述为纯数学优化问题,无 GPU/Docker 提及。Grader 代码在 subprocess 中运行 solution,纯 Python + numpy/scipy,完全 CPU-only。
| # | 任务 | 路径 | 简介 |
|---|------|------|------|
| 1 | Circle Packing | `math/circle_packing/` | 26圆 packed into 单位正方形,最大化半径和 |
| 2 | Circle Packing Rect | `math/circle_packing_rect/` | 21圆 packed into 矩形,最大化半径和 |
| 3 | Erdos Min Overlap | `math/erdos_min_overlap/` | 最小化 C5 overlap integral 的阶梯函数 |
| 4 | First Autocorr Ineq | `math/first_autocorr_ineq/` | 最小化 [0,0.5] 上第一自相关不等式 C1 常数 |
| 5 | Heilbronn Convex 13 | `math/heilbronn_convex_13/` | 2D 中13点,最大化 min triangle area / convex hull area |
| 6 | Heilbronn Convex 14 | `math/heilbronn_convex_14/` | 2D 中14点,最大化 min triangle area / convex hull area |
| 7 | Heilbronn Triangle | `math/heilbronn_triangle/` | 等边三角形内11点,最大化最小三角形面积 |
| 8 | Hexagon Packing 11 | `math/hexagon_packing_11/` | 11单位正六边形 packed (SAT 验证) |
| 9 | Hexagon Packing 12 | `math/hexagon_packing_12/` | 12单位正六边形 packed (SAT 验证) |
| 10 | Matmul | `math/matmul/` | (2,4,5) 矩阵乘法张量低秩分解 (deps: jax, optax) |
| 11 | Max Min Dist 2D | `math/minimizing_max_min_dist_2d/` | 2D 中16点,最大化 (min_dist/max_dist)^2 |
| 12 | Max Min Dist 3D | `math/minimizing_max_min_dist_3d/` | 3D 中14点,最大化 (min_dist/max_dist)^2 |
| 13 | Second Autocorr Ineq | `math/second_autocorr_ineq/` | 最大化第二自相关不等式 C2 常数 |
| 14 | Signal Processing | `math/signal_processing/` | 自适应信号处理,最小化多目标代价 (5种信号) |
| 15 | Sums Diffs Finite Sets | `math/sums_diffs_finite_sets/` | 有限整数集最大化 C6 下界 |
| 16 | Third Autocorr Ineq | `math/third_autocorr_ineq/` | 最小化 C3 常数 (f 可为负) |
| 17 | Uncertainty Ineq | `math/uncertainty_ineq/` | Hermite 多项式系数最小化 C4 bound (deps: sympy) |
### ADRS (5)
| # | 任务 | 路径 | 简介 |
|---|------|------|------|
| 18 | Cloudcast | `ADRS/cloudcast/` | 多云广播优化 — 最小化跨 AWS/Azure/GCP 数据传输成本。Seed 用 `networkx`+`pandas`。已补 `pyproject.toml` + `workspace.setup: "uv sync"`。 |
| 19 | EPLB | `ADRS/eplb/` | MoE 专家并行负载均衡算法。Seed 用 `torch`(纯 CPU)。已补 `pyproject.toml` + `workspace.setup``expert-load.json`(234MB) 已下载。 |
| 20 | LLM-SQL | `ADRS/llm_sql/` | DataFrame 列重排序最大化 prefix cache 命中率。Seed 用 `pandas`+`networkx`。已补 `pyproject.toml` + `workspace.setup`,5 个 CSV 已下载。 |
| 21 | Prism | `ADRS/prism/` | LLM 模型在 GPU 集群上的 placement 算法,最小化 max KV cache pressure。Seed 纯 stdlib,无外部 pip 依赖。 |
| 22 | Txn Scheduling | `ADRS/txn_scheduling/` | 事务调度 makespan 最小化。Seed 纯 stdlib + 本地文件,无外部 pip 依赖。 |
### 顶层任务 (5)
| # | 任务 | 路径 | 简介 |
|---|------|------|------|
| 23 | Circle Packing | `circle_packing/` | 26圆 packed into 单位正方形。Seed imports `numpy``workspace.setup: ["uv pip install numpy scipy"]`,依赖已声明。Grader subprocess 纯 numpy 约束检查。任务描述纯优化(simulated annealing, L-BFGS-B 等),CPU-only。`run.session: docker` 不影响 `coral collect-trajectories`(pipeline 自行管理 session)。 |
| 24 | DNA Design | `dna_design/` | 200bp HepG2 特异性 DNA enhancer 序列设计。Static packaged grader(`dna_design_grader.grader:Grader`),无 GPU 时 fallback 到 GC-content proxy 评分。`workspace.setup: ["uv pip install numpy"]`。Seed 纯 stdlib + random。 |
| 25 | Drug Design | `drug_design/` | 抗 K. pneumoniae 小分子抗生素设计 (SMILES)。Static packaged grader(`drug_design_grader.grader:Grader`),RDKit-only fallback。`workspace.setup: ["uv pip install rdkit numpy"]`。Seed imports `rdkit`(try/except fallback)。 |
| 26 | Erdos | `erdos/` | Erdős minimum overlap — step function h 最小化 C5。Static packaged grader(`erdos_grader.grader:Grader`),pyproject.toml + `workspace.setup: "uv sync"` 齐全。Seed deps: numpy, scipy, jax, optax(均 pip-installable)。 |
| 27 | Kernel Builder | `kernel_builder/` | VLIW SIMD kernel 优化(tree traversal),最小化 cycle count。Seed 纯 Python + stdlib(`dataclasses`),无外部 pip 依赖。Grader subprocess 加载 frozen_problem.py simulator,纯 Python。`run.session: docker` 不影响 `coral collect-trajectories`。 |
---
## 不可用任务 (10)
### GPU 硬依赖 (2)
| 任务 | 路径 | 原因 |
|------|------|------|
| dlomix-pfly | `dlomix-pfly/` | **Grader 配置 `gpu_pool: [0, 1, 3]`** — grader 为每个 eval 子进程 flock 一块 RTX 6000 Ada GPU 并设置 `CUDA_VISIBLE_DEVICES`。**seed/pyproject.toml 依赖 PyTorch CUDA build** (`torch` from `download.pytorch.org/whl/cu128`)。**任务描述明确要求 "Use PyTorch on GPU"**,并警告 "CPU-only classifiers as the main model" 会超时。GPU 从 grader/env/描述三个维度都是硬依赖。 |
| kernel_engineering | `kernel_engineering/trimul/` | **任务 tips 明确写 "Triton 3.3.0 on H100"**,要求使用 `/usr/bin/python3`(host Python 才有 torch/triton,venv Python 没有)。Grader 在 subprocess 中调 host Python 跑 Triton kernel benchmark。GPU (H100) + Triton 从 grader/描述/环境三个维度都是硬依赖。无顶层 task.yaml,task.yaml 在 `trimul/` 子目录下。 |
### 任务本质需要 GPU + 依赖声明缺失 (4)
> 这些任务的 grader 代码本身仅用 sklearn/pandas/numpy(CPU-only),**但任务本质是 ML/DL 问题**:mnist 的 tips 提到 "Good CNNs score 0.99+"、"reshape for CNNs";spaceship_titanic 的 tips 提到 "Top Kaggle scores exceed 0.82";stanford_covid_vaccine 的 tips 提到 "Winning Kaggle approaches used GRU/LSTM/Transformer models"。**三者任务描述均写 "GPU 0 is a H200 available for use"**。agent 为取得 competitive score 必然写 GPU 代码(如 CNN、Transformer、XGBoost GPU),在 CPU-only 环境中会失败。此外三者均无 `pyproject.toml` 且无 `workspace.setup`,seed 代码 import 的 numpy/pandas/sklearn 无安装途径。
| 任务 | 路径 | 原因 |
|------|------|------|
| mnist | `mnist/` | 任务描述: "GPU 0 is a H200 available for use" + tips 引导 CNN。Seed imports `numpy`, `sklearn`(无 pyproject.toml / workspace.setup)。 |
| spaceship_titanic | `spaceship_titanic/` | 任务描述: "GPU 0 is a H200 available for use"。Seed imports `pandas`, `numpy`, `sklearn`(无 pyproject.toml / workspace.setup)。 |
| stanford_covid_vaccine | `stanford_covid_vaccine/` | 任务描述: "GPU 0 is a H200 available for use" + tips 引导 GRU/LSTM/Transformer。Seed imports `pandas`, `numpy`, `sklearn`(无 pyproject.toml / workspace.setup)。 |
### 动态 Grader (LLM-as-Judge) + 无 seed/ (3)
| 任务 | 路径 | 原因 |
|------|------|------|
| apex-eggshell-skull | `apex-eggshell-skull/` | (1) **动态 grader**: `apex_judge.grader:Grader`,`dynamic_rubric: true`,spawn Claude Code agent judge,persistent rubric state 存 `.coral/private/rubrics/`,后续 reward 随评判历史改变 — 不同 tree branch 无法独立评分;(2) **无 `seed/`**,`workspace.repo_path: ./examples/apex-eggshell-skull/repo` 目录不存在。 |
| apex-frontier-bu | `apex-frontier-bu/` | (1) **动态 grader**: 同 apex-eggshell-skull 的 `apex_judge.grader:Grader``dynamic_rubric: true`;(2) **无独立 `grader/`**`setup: "uv pip install -e ../apex-eggshell-skull/grader"` 依赖兄弟任务;(3) **无 `seed/`**`repo_path` 指向不存在的 `repo/`。 |
| race-japan-elderly | `race-japan-elderly/` | (1) **动态 grader**: `race_japan_grader.grader:Grader`,spawn Claude Code agent judge 按 25 个 rubric criteria 评分 — LLM-as-judge 非确定性评分;(2) **无 `seed/`**`repo_path` 指向不存在的 `repo/`。 |
### Docker 硬依赖 (2)
| 任务 | 路径 | 原因 |
|------|------|------|
| swebench-verified | `swebench-verified/` | **Grader 代码调用 `harbor run -d swebench-verified@1.0`**,harbor 内部启动 Docker 容器运行 SWE-bench 测试。无 Docker 则 grader 直接 fail(grader 代码中有 `_find_harbor_cmd()` 检查)。 |
| terminal-bench | `terminal-bench/` | **Grader 代码调用 `harbor run -d terminal-bench@2.0`**,harbor 内部启动 Docker 容器。同 swebench-verified 模式。 |
---
## 汇总
| 类别 | 数量 | 任务 |
|------|------|------|
| **立即可用** | **27** | math/* (17), ADRS/cloudcast, ADRS/eplb, ADRS/llm_sql, ADRS/prism, ADRS/txn_scheduling, circle_packing, dna_design, drug_design, erdos, kernel_builder |
| GPU 硬依赖 | 2 | dlomix-pfly, kernel_engineering |
| 任务本质 GPU + 缺依赖声明 | 3 | mnist, spaceship_titanic, stanford_covid_vaccine |
| 动态 grader + 无 seed | 3 | apex-eggshell-skull, apex-frontier-bu, race-japan-elderly |
| Docker 硬依赖 (harbor) | 2 | swebench-verified, terminal-bench |
### 判断依据
每个任务的结论基于四个维度交叉验证:
| 维度 | 检查内容 |
|------|----------|
| **Grader 代码** | 是否 import torch/triton?是否调 harbor/docker?是否 spawn LLM judge?subprocess 脚本用什么包? |
| **任务描述 (task.yaml)** | 是否提及 GPU/Docker?tips 是否引导 DL 方法? |
| **Seed 代码** | import 了哪些包?是否有 CUDA/torch 依赖? |
| **环境配置** | pyproject.toml 声明了什么依赖?workspace.setup 安装了哪些包?`run.session` 是什么?grader args 是否有 `gpu_pool`? |

Xet Storage Details

Size:
10.4 kB
·
Xet hash:
eb5cff700005387b7e691aef7401773fb1b9c7749383ed0a6d79fcefc4dbc16f

Xet efficiently stores files, intelligently splitting them into unique chunks and accelerating uploads and downloads. More info.