|
Download README.md from HenghuiB/vm: direct link, hf CLI and curl.
- Browser
- Download file 1.25 kB
-
https://huggingface.co/HenghuiB/vm/resolve/main/README.md
- Command line
-
hf download hf://HenghuiB/vm/README.md
-
curl -L -o README.md https://huggingface.co/HenghuiB/vm/resolve/main/README.md
1.25 kB
metadata
license: other
tags:
- video
- egocentric
- action-recognition
- lora
vm · 第一人称视频稠密转写 LoRA
配套推理代码:https://github.com/worldEngineDev/Anno-inference
把第一人称视频转成每 0.5 秒一条动作短语。本仓库只含 LoRA 适配器(16 MB); 底座是 Qwen/Qwen3.5-9B。
拉
huggingface-cli download HenghuiB/vm --local-dir ./checkpoints
用
见推理仓 README。要点:必须设 FPVA_NATFULL=1(这个 ckpt 训自 natfull 格式,
用别的格式评它会低约 14 点且不报错),推理需要约 70 GB 显存。
是什么
r1_natfull_step1500 —— 3.9 M LoRA 参数,挂 8 层注意力,
在 EPIC-KITCHENS-100 上训 1500 步。同批 26 条实验臂里最好的一个。
| 逐格名词正确率 | 变化点召回 | 覆盖 | |
|---|---|---|---|
| 49.92% | 59.9% | 98.6% | 本 ckpt |
| 45.58% | 62.6% | 96.6% | 同臂 step 3000(训更久更差) |
| 40.41% | 62.0% | 96.1% | 解冻视觉 projector |
已知边界
只在厨房第一人称视频上验过;逐格约 50% 正确率; 同一件事会在近义说法间换口(推理仓的事件通道能消掉一部分)。 详见推理仓 README。