作者好,感谢你们对这项工作的开源,我最近也在研究VLA剪枝方法,lightVLA这个方法给了我很多启发。我在阅读代码的过程中产生了一些疑问,希望可以得到解答。 - 在TokenPruner的代码实现中,gumbel-softmax不是使用gumbel噪声,而是使用均匀分布噪声实现的,这有什么特殊原因吗? https://github.com/LiAutoAD/LightVLA/blob/a4680fda5ffe73029190ac97328aa34b0e87a45a/prismatic/extern/hf/modeling_prismatic.py#L92-L94 - VLA-cache,ADP等剪枝方法中,为了保证训练时每个batch间token长度一致会事先固定剪枝比例,但在lightVLA训练使用的score_to_indices函数中,似乎是通过让部分patch重复占位来保证token总长度在剪枝前后不发生变化。这意味着lightVLA只会降低推理显存,而不会降低训练时的显存占用吗? https://github.com/LiAutoAD/LightVLA/blob/a4680fda5ffe73029190ac97328aa34b0e87a45a/prismatic/extern/hf/modeling_prismatic.py#L95-L98
作者好,感谢你们对这项工作的开源,我最近也在研究VLA剪枝方法,lightVLA这个方法给了我很多启发。我在阅读代码的过程中产生了一些疑问,希望可以得到解答。
在TokenPruner的代码实现中,gumbel-softmax不是使用gumbel噪声,而是使用均匀分布噪声实现的,这有什么特殊原因吗?
LightVLA/prismatic/extern/hf/modeling_prismatic.py
Lines 92 to 94 in a4680fd
VLA-cache,ADP等剪枝方法中,为了保证训练时每个batch间token长度一致会事先固定剪枝比例,但在lightVLA训练使用的score_to_indices函数中,似乎是通过让部分patch重复占位来保证token总长度在剪枝前后不发生变化。这意味着lightVLA只会降低推理显存,而不会降低训练时的显存占用吗?
LightVLA/prismatic/extern/hf/modeling_prismatic.py
Lines 95 to 98 in a4680fd