
每日大模型 Rap05/19/2026, 08:07:28 AM
扩散语言模型固定位置分块是结构性浪费——DCDM 用 Chunking Attention 把 token 路由进语义簇,端到端被扩散目标约束,1.5B 参数规模 benchmark 全线碾压两条 baseline。通勤 90 秒,听懂今日最新扩散 LM 架构创新。
DCDM·切分(arXiv 2605.15676)
扩散语言模型固定位置分块是结构性浪费——DCDM 用 Chunking Attention 把 token 路由进语义簇,端到端被扩散目标约束,1.5B 参数规模 benchmark 全线碾压两条 baseline。通勤 90 秒,听懂今日最新扩散 LM 架构创新。
0:00