본문 바로가기

전체 글

(91)
Event-Grounded Sparse Autoencoders forVision-Language-Action Policies 논문 주소: https://arxiv.org/pdf/2605.17204깃허브: https://github.com/xc-j/Event-SAE Abstract Vision-Language-Action (VLA) policies는 언어 및 시각 입력을 로봇 actions로 변환하며, 이들의 hidden representations는 closed-loop behavior를 직접 형성합니다. 그러나 language 및 vision-language models의 mechanistic interpretability 도구들은 VLAs로 깔끔하게 전이되지 않습니다: 출력값은 인간이 읽을 수 있는 tokens가 아닌 로봇 actions이며, interventions는 비용이 많이 드는 closed-loop rollout..
JEPA-VLA: Video Predictive Embedding is Needed for VLA Models 논문 주소: https://arxiv.org/pdf/2602.11832 Abstract사전 학습된 Vision-language models를 기반으로 구축된 최근의 vision-language-action 모델들은 robotic manipulation 분야에서 상당한 발전을 이루었습니다. 그러나 현재의 VLAs는 여전히 낮은 sample efficiency와 한계가 있는 generalization 성능으로 인해 어려움을 겪고 있습니다.\ 본 논문에서는 이러한 한계점들이 그동한 간과되어 온 요소인 pretrained visual representation과 밀접하게 연관되어 있다고 주장합니다.현재의 visual representation은 environment understanding과 policy p..
Nüwa : MENDING THE SPATIAL INTEGRITY TORN BYVLM TOKEN PRUNING 논문 주소: https://arxiv.org/pdf/2602.02951 깃허브: https://github.com/Man-PaperRejected/Nuwa AbstractVision token pruning은 효율적인 VLM을 위한 효과적인 가석화 기술임이 입증되었습니다. 그러나 기존의 pruning방법들은 visual question answering (VQA) 에서는 우수한 성느을 보여주지만, , visual grounding (VG) 태스크에서는 상당한 성능 저하를 겪습니다. VLM의 프로세싱 파이프라인에 대한 본 연구의 분석 결과, global semantic simiarity와 attention scroes를 활용하는 전략들이 global spatial reference frame을 상실한다는..
DTP:A SIMPLE YET EFFECTIVE DISTRACTING TOKEN PRUNINGFRAMEWORK FOR VISION-LANGUAGE ACTION MODELS 논문 주소: https://arxiv.org/pdf/2601.16065v1project: https://anonymous.4open.science/r/CBD3 ABSTRACTVision Language Action model은 환경을 이해하고 액션을 직접 출력하기 위해 VLMs의 강력한 인지 능력을 활용함으로써 robotic manipulation 분야에서 눈부신 발전을 보여주었습니다. 그러나 기본적으로 VLA 몯레은 task와 무관한 영역의 이미지 token에 과도하게 주의를 기울일 수 있으며 본 연구에서는 이를 distraction tokens이라고 정의합니다. 이러한 동작은 매 단계에서 원하는 액션 토큰의 생성을 방해하며 task의 성공률의 영향을 미칠 수 있습니다. 본 논문에서는 이러한 dist..
Action-Aware Dynamic Pruning for Efficient Vision-Language-Action Manipulation 논문 주소: https://arxiv.org/pdf/2509.22093 ABSTRACT Vision-Language-Action 모델을 이용한 로봇 조작은 긴 시나리오의 멀티모달 컨텍스트에 대한 효율적인 추론을 요구하며, 이 때 visual tokens에 대한 attention 연산 비용의 대부분을 차지합니다. 기존 방법들은 VLA 모델 내에서 visual redundancy를 줄여 추론 속도를 최적화하지만, 로봇 조작 단계에 따라 중복성이 달라진다는 점을 간과합니다. 본 연구에서는 시각적 토큰의 중복성이 정밀 조작 (fine-grained operations) 단계보다 조대 조작(coarse manipulation) 단계에서 더 높으며, 이것이 action dynamic과 강한 상관관계가 있음을 관찰..
Token Expand-Merge: Training-Free Token Compression forVision-Language-Action Models 논문 주소: https://arxiv.org/pdf/2512.09927깃허브: https://github.com/Jasper-aaa/TEAM-VLA ABSTRACT대규모 멀티모달 데이터셋에서 사전 학습된 Vision-Language-Action (VLA) models는 로봇 인지 및 제어를 위한 강력한 토대로 등장했습니다. 하지만 종종 수십억 개의 파라미터에 달하는 거대한 규모는 동적인 환경에서 추론의 연산 비용이 비싸고 지연 시간에 민감하기 때문에, 실시간 배포에 상당한 어려움을 초래합니다. 이를 해결하기 위해, 태스크 성능을 유지하면서 VLA 추론을 가속화하는 training-free 토큰 압축 프레임워크인 Token Expand-and-Merge-VLA (TEAM-VLA)를 제안합니다. TEAM-V..
SpecPrune-VLA: Accelerating Vision-Language-Action Models via Action-Aware Self-Speculative Pruning 논문 주소: https://arxiv.org/pdf/2509.05614 ABSTRACTPruning은 중요하지 않은 값에 대한 연산을 제거함으로 써 Compute-bound 모델을 가속화하는 전형적인 기술입니다. 최근에는 이를 VLA 모델의 추론을 가속화하는데 적용하려는 노력이 있었습니다. 하지만 기존의 가속화 방법들은 현재 액션 단계의 local information에만 집중하고 global context를 무시하여, 일부 시나리오에서 성공률이 20% 이상 하락하거나 가속화 효과가 제한적이었습니다. 본 논문에서는 VLA Task에서의 spatial-temporal consistency를 지적합니다. 즉, 연속적인 단계의 입력 이미지들은 높은 유사성을 보이며, 따라서 token selection은 lo..
Beyond Text-Visual Attention: Exploiting Visual Cues forEffective Token Pruning in VLMs 논문 주소: https://arxiv.org/pdf/2412.01818깃허브: https://github.com/Theia-4869/VisPruner Abstract Large Vision-Language Models (LVLMs)는 일반적으로 텍스트 토큰보다 훨씬 더 많은 visual tokens를 포함하고 있으며, 이는 상당한 계산 부담을 초래합니다. 최근 이러한 문제를 해결하기 위해 language model 초기 단계에서 visual tokens를 pruning하려는 노력이 이루어져 왔습니다. 대부분의 기존 연구들은 text와 visual tokens 사이의 attention scores를 사용하여 visual tokens의 중요도를 평가합니다. 하지만 본 연구에서 language model 내의..