PARC2026 Track 1 SmolVLA LoRA

PARC2026予選 Track 1向けに、公開済みのロボット基盤モデル lerobot/smolvla_libero_plusを LoRA追加学習する参加者モデルのModel Cardです。前方・手先カメラ画像、ロボット状態、 言語指示から、Franka Emika Panda用の7次元relative EEF actionを生成します。

現在の状態: Model Cardのみを先行登録しています。学習済みweight、最終manifest、 checkpoint hash、性能値は未登録です。以下の TBD は、最終提出に使用するcheckpointを 確定後、その実測値で更新します。このリポジトリを現時点で推論に使用することはできません。

Model details

項目 内容
Model name PARC2026 Track 1 SmolVLA LoRA
Version / run TBD
Base model lerobot/smolvla_libero_plus
Base revision 7bb70aa5bc92b82c9239142775d3a173103567ff
VLM backbone HuggingFaceTB/SmolVLM2-500M-Video-Instruct
VLM revision 7b375e1b73b11138ff12fe22c8f2822d8fe03467
Framework LeRobot v0.6.0 / commit 30da8e687a6dfc617fcd94afc367ac7071c376ce(最終manifestで再確認)
Architecture SmolVLM2 vision-language backbone + flow-matching action expert
Fine-tuning LoRA(最終checkpointではbase weightへmerge予定)
Action chunk あり、50 actions
Checkpoint SHA-256 TBD
Intended hardware NVIDIA L4 24 GB(大会評価環境)

Inputs and outputs

入力は次の情報です。

  • agentview_image: 前方カメラ画像、uint8 (128, 128, 3)
  • robot0_eye_in_hand_image: 手先カメラ画像、uint8 (128, 128, 3)
  • End-effector位置・quaternionとgripper qpos
  • エピソード開始時に与えられる自然言語タスク指示

画像resize、state変換、normalizationはcheckpointに付属するLeRobotの preprocessorで行います。出力は float32 (7,) のrelative EEF actionです。

[dx, dy, dz, droll, dpitch, dyaw, gripper]

推論時は50-step action chunkをキャッシュし、エピソード開始時の reset() でqueueと 内部状態を消去します。大会環境は外部ネットワークへ接続できないため、tokenizer、config、 pre/postprocessorを含む推論資産をcheckpointと一緒に固定・保存する設計です。

Intended use

  • PARC2026予選 Track 1の、同一タスク・同一ドメインにテクスチャ等の摂動を加えた LIBERO Plus環境での研究・評価
  • 公開された4つのTrack 1 base taskに対する模倣学習
  • ローカル評価環境でのロボットポリシー研究

本モデルは実機での安全性を保証するものではありません。安全検証なしに実ロボットへ 展開しないでください。また、タスク固有FSM、ハードコード行動列、評価seed等をキーにした 行動表、成功条件や報酬への直接アクセス、評価観測を使った追加学習には使用しません。

Training data

学習元は lerobot/libero_plusの 固定revision f3f49f426d75030177b18778374005bc12ccd588 です。

項目 全データ 今回の選択データ
Tasks 40 4
Episodes 14,347 80(各task 20)
Frames 2,238,036 10,855
FPS 20 20

選択した公開Track 1 base taskは次の4つです。

  1. pick up the black bowl in the top drawer of the wooden cabinet and place it on the plate
  2. pick up the tomato sauce and place it in the basket
  3. pick up the milk and place it in the basket
  4. put the bowl on the stove

各taskのepisodeは固定revision内の並び全体へ均等に分散するよう選択し、収集条件の偏りを 抑えています。評価時の観測やtrajectoryは保存せず、後続の学習にも使用しません。

Training procedure

以下はMain run Aの予定値です。実行後、parc_training_manifest.json と照合して確定します。

Hyperparameter Value
Training steps 3,000
Batch size 1
Learning rate 3e-4 → 3e-5
Warmup 100 steps
LoRA rank / alpha 16 / 16
Seed 42
Mixed precision fp16 on NVIDIA T4

視覚encoderを固定し、action expertのattention projection、state/action projectionなどを LoRAの主な学習対象とする計画です。最終的な学習対象parameter名とtrainable parameter数は 学習ログから追記します。

Evaluation

PARC2026の評価はtask successとcollisionをgateにし、実行効率と軌道の滑らかさを含む 非公開の重み・正規化式で総合します。ローカル環境で確認できる指標はsuccess rate、steps、 trajectory length、jerk、SPARC、EEF rotation、collisionです。

成功にはtask goalの達成に加え、操作対象以外の物体の初期位置からの変位が各軸の絶対値の 和で1 mm以下であることが必要です。また、/act と /reset は各request 10秒以内、 server startupは既定120秒以内、Track全体は1時間以内である必要があります。

Results

Run Data Steps Final loss Local success Max /act Omnicampus score
Random connectivity - - - 0% 0.003 s -
Smoke 4 tasks × 5 episodes 500 TBD TBD TBD Not submitted
Main A 4 tasks × 20 episodes 3,000 TBD TBD TBD TBD
Main B (optional) 4 tasks × 20 episodes 8,000 TBD TBD TBD TBD

結果を記録する際はepisode数、最大step数、task一覧、seed、GPU、checkpoint SHA-256も併記し、 異なる条件の値を同じrunとして混在させません。

Limitations

  • 学習対象は公開4タスクのみで、非公開taskや大きなdomain shiftへの汎化性能は未確認です。
  • 128×128の評価画像は、学習checkpointのpreprocessorを通して学習時の表現へ変換します。
  • Action chunkingは推論回数を減らしますが、観測変化への反応が遅れる可能性があります。
  • Collisionを含む安全性、実機へのsim-to-real transfer、分布外の言語指示は未検証です。
  • 現在はweight未登録のため、性能に関する主張はありません。

Reproducibility and report record

最終checkpointには parc_training_manifest.json を添付し、以下を機械可読な形で保存します。

  • base model、VLM、dataset、LeRobotのrevision / commit
  • task名、episode indices、学習step、batch size、seed、LoRA・optimizer設定
  • Python、PyTorch、Transformers、Accelerate、PEFTのversion
  • adapter、merged model、offline VLM assetsのSHA-256
  • T4でのcold/warm chunk推論時間

最終レポート提出前に、次の TBD を必ず確定します。

  • 最終run名・versionと、実際の学習step数
  • trainable parameter範囲と学習終了時loss
  • merged checkpointおよび提出zipのSHA-256
  • local task別/全体success、collision、軌道指標、最大 /act latency
  • Omnicampus scoreと評価日時
  • server startup、24 GB VRAM、完全offline推論の確認結果
  • 最終成果物と本Model Card・2ページレポートの記載内容の一致

Licenses and attribution

  • Base SmolVLA checkpoint / Model Card: Apache License 2.0
  • SmolVLM2-500M-Video-Instruct: Apache License 2.0
  • LeRobot: Apache License 2.0
  • LIBERO code: MIT License
  • Original LIBERO demonstrations: CC BY 4.0

固定した lerobot/libero_plus revisionには、確認時点で独立したdataset cardまたはlicense tagが ありません。そのため最終レポートでは、講座提供データとしての利用、repositoryとrevision、 元LIBERO demonstrationsの出所とライセンスを併記します。提出物へ同梱する第三者コードは、 各ライセンス文と配布条件を個別に維持します。

Competition context

これはPARC2026参加者によるprivateな作業用repositoryであり、大会運営による公式モデルでは ありません。大会資料 Version 1.0(2026-07-31)では、最終モデルに参加者自身が学習し、 Action生成へ実質的に寄与する要素を含めること、ならびに2ページ以内のレポートでモデル、 学習、試行錯誤、権利関係を申告することが求められています。

Downloads last month

-

Downloads are not tracked for this model. How to track
Video Preview
loading

Model tree for chocopan/chocopan-pre

Finetuned
(2)
this model

Dataset used to train chocopan/chocopan-pre