--- license: other tags: - video - egocentric - action-recognition - lora --- # vm · 第一人称视频稠密转写 LoRA 配套推理代码:https://github.com/worldEngineDev/Anno-inference 把第一人称视频转成**每 0.5 秒一条动作短语**。本仓库只含 LoRA 适配器(16 MB); 底座是 [Qwen/Qwen3.5-9B](https://huggingface.co/Qwen/Qwen3.5-9B)。 ## 拉 ```bash huggingface-cli download HenghuiB/vm --local-dir ./checkpoints ``` ## 用 见推理仓 README。要点:必须设 `FPVA_NATFULL=1`(这个 ckpt 训自 natfull 格式, 用别的格式评它会低约 14 点且不报错),推理需要约 70 GB 显存。 ## 是什么 `r1_natfull_step1500` —— 3.9 M LoRA 参数,挂 8 层注意力, 在 EPIC-KITCHENS-100 上训 1500 步。**同批 26 条实验臂里最好的一个。** | 逐格名词正确率 | 变化点召回 | 覆盖 | | |---|---|---|---| | **49.92%** | 59.9% | 98.6% | **本 ckpt** | | 45.58% | 62.6% | 96.6% | 同臂 step 3000(训更久更差) | | 40.41% | 62.0% | 96.1% | 解冻视觉 projector | ## 已知边界 只在厨房第一人称视频上验过;逐格约 50% 正确率; 同一件事会在近义说法间换口(推理仓的事件通道能消掉一部分)。 详见推理仓 README。