### Question • 作者您好,感谢开源 InternNav 和 DualVLN。 我们按照公开配置完成了两阶段训练: - Stage 1:R2R 4组视角 + RxR 4组视角 + ScaleVLN 2组视角,均按100%使用; - Stage 2:R2R、RxR、ScaleVLN各2组视角,每组使用`%30`采样; - 单节点8张80GB GPU; - per-device batch size为2,gradient accumulation steps为8,global batch size为128; - Stage 1训练14k steps,Stage 2训练15k steps。 最终在R2R `val_unseen`上得到SR 57.69、SPL 53.71,与官方SR 64.3、SPL 58.5仍有差距。 想请问官方结果实际使用的训练配置: 1. 官方训练是否还混入EnvDrop或general video QA?如果有,大致数据比例是多少? 2. 官方最终结果对应的Stage 1和Stage 2分别训练了多少optimizer steps? 3. Stage 1的停止条件是论文中的14k steps、Issue中建议的约20k steps,还是按完整epoch训练? 4. 官方实际使用的GPU数量、单卡batch size和global batch size是多少? 感谢!