vm / README.md
HenghuiB's picture
Upload folder using huggingface_hub
960b568 verified
|
Raw History Blame Contribute Delete
1.25 kB
---
license: other
tags:
- video
- egocentric
- action-recognition
- lora
---
# vm · 第一人称视频稠密转写 LoRA
配套推理代码:https://github.com/worldEngineDev/Anno-inference
把第一人称视频转成**每 0.5 秒一条动作短语**。本仓库只含 LoRA 适配器(16 MB);
底座是 [Qwen/Qwen3.5-9B](https://huggingface.co/Qwen/Qwen3.5-9B)。
## 拉
```bash
huggingface-cli download HenghuiB/vm --local-dir ./checkpoints
```
## 用
见推理仓 README。要点:必须设 `FPVA_NATFULL=1`(这个 ckpt 训自 natfull 格式,
用别的格式评它会低约 14 点且不报错),推理需要约 70 GB 显存。
## 是什么
`r1_natfull_step1500` —— 3.9 M LoRA 参数,挂 8 层注意力,
在 EPIC-KITCHENS-100 上训 1500 步。**同批 26 条实验臂里最好的一个。**
| 逐格名词正确率 | 变化点召回 | 覆盖 | |
|---|---|---|---|
| **49.92%** | 59.9% | 98.6% | **本 ckpt** |
| 45.58% | 62.6% | 96.6% | 同臂 step 3000(训更久更差) |
| 40.41% | 62.0% | 96.1% | 解冻视觉 projector |
## 已知边界
只在厨房第一人称视频上验过;逐格约 50% 正确率;
同一件事会在近义说法间换口(推理仓的事件通道能消掉一部分)。
详见推理仓 README。