我們的新工作 Where and When to Commit: Candidate-Aware Decoding for Diffusion Language Models 已發布於 arXiv。這篇提出 LATCH,想解決 diffusion language model 在 decoding 時常常要反覆更新整段 sequence、因而很慢的問題。
LATCH 不直接粗暴地把所有 token 提早停掉,而是分開處理兩件事:什麼時候可以確認整個答案已經穩定,以及哪些非最後區塊可以先 commit。這個設計不需要額外訓練,在 LLaDA 和 Dream 的多項任務上能明顯加速,同時盡量維持完整 decoding 的答案品質。又是一個很符合我們口味的題目:有效,但不要把原本該有的結果弄壞。