Daily Paper2026.07.14
dLLM의 자유로움은 과연 장점일까?
The Flexibility Trap: Rethinking the Value of Arbitrary Order in Diffusion Language Models
01/09
dLLM의 자유로운 생성 순서는 정말 더 다양한 추론을 가능하게 할까요?
유연성의 함정
이 논문은 수학·코딩 추론에서 dLLM이 불확실한 분기 토큰을 뒤로 미루고 쉬운 토큰부터 생성하면서, 오히려 탐색 가능한 풀이 공간을 줄일 수 있다고 지적합니다.
자유도가 곧 다양성으로 이어지지 않는다는 것입니다.
JustGRPO
연구진은 RL 학습 중에만 생성 순서를 왼쪽에서 오른쪽으로 제한하는 JustGRPO를 제안했습니다.
복잡한 diffusion 전용 강화학습 없이도 높은 추론 성능과 병렬 디코딩 능력을 모두 유지했습니다.
태그
- #ai논문
- #논문리뷰
- #인공지능
- #DiffusionLLM
- #강화학습
- #GRPO
- #추론모델








