Skip to content
Daily Paper2026.07.14

← 아카이브

dLLM의 자유로움은 과연 장점일까?

The Flexibility Trap: Rethinking the Value of Arbitrary Order in Diffusion Language Models

dLLM의 자유로움은 과연 장점일까? — 1 / 9
01
dLLM의 자유로움은 과연 장점일까? — 2 / 9
02
dLLM의 자유로움은 과연 장점일까? — 3 / 9
03
dLLM의 자유로움은 과연 장점일까? — 4 / 9
04
dLLM의 자유로움은 과연 장점일까? — 5 / 9
05
dLLM의 자유로움은 과연 장점일까? — 6 / 9
06
dLLM의 자유로움은 과연 장점일까? — 7 / 9
07
dLLM의 자유로움은 과연 장점일까? — 8 / 9
08
dLLM의 자유로움은 과연 장점일까? — 9 / 9
09
01/09

dLLM의 자유로운 생성 순서는 정말 더 다양한 추론을 가능하게 할까요?

유연성의 함정

이 논문은 수학·코딩 추론에서 dLLM이 불확실한 분기 토큰을 뒤로 미루고 쉬운 토큰부터 생성하면서, 오히려 탐색 가능한 풀이 공간을 줄일 수 있다고 지적합니다.

자유도가 곧 다양성으로 이어지지 않는다는 것입니다.

JustGRPO

연구진은 RL 학습 중에만 생성 순서를 왼쪽에서 오른쪽으로 제한하는 JustGRPO를 제안했습니다.

복잡한 diffusion 전용 강화학습 없이도 높은 추론 성능과 병렬 디코딩 능력을 모두 유지했습니다.

태그

  • #ai논문
  • #논문리뷰
  • #인공지능
  • #DiffusionLLM
  • #강화학습
  • #GRPO
  • #추론모델
인스타그램에서 보기