VLA 논문 리뷰 템플릿
Vision-Language-Action 논문을 읽을 때는 모델 이름보다 문제 설정을 먼저 확인하는 편이 좋습니다. 아래 항목을 기준으로 논문 리뷰를 일정한 형식으로 남길 예정입니다.
체크리스트
- 입력은 이미지, 비디오, 언어 명령 중 무엇인가?
- 출력 action space는 discrete token인가, continuous control인가?
- 데이터는 teleoperation, simulation, web-scale pretraining 중 어디에서 왔는가?
- 평가는 실제 로봇, 시뮬레이터, offline benchmark 중 무엇으로 이루어졌는가?
- 실패 사례는 perception 문제인가, planning 문제인가, control 문제인가?
리뷰 형식
각 글은 문제 정의, 핵심 아이디어, 데이터와 평가, 재현 가능성, 다음 질문 순서로 정리합니다.