LLM 预训练论文每日速览

每日自动抓取 HuggingFace Daily Papers · AI 筛选预训练相关工作 · 中文摘要

28预训练论文
584累计收录
2026-08-11最新日期
28 篇(仅预训练相关) · 已加载 12 更新于 2026-08-21 04:33
2026-08-11 1 篇

混合线性注意力大语言模型中的大规模激活:预注意力尖峰与尖峰间平台

HF 热门 中相关 架构设计训练动力学注意力机制

Massive Activations in Hybrid Linear Attention Large Language Models: Pre-Attention Spikes and Inter-Spike Plateaus

判定:研究混合线性注意力架构预训练中的大规模激活现象

本文首次系统研究层交错混合线性注意力(HLA)大语言模型中的大规模激活(MA)。发现MA在完整注意力层前形成预注意力尖峰(PAS),并可经线性注意力层持续形成尖峰间平台(ISP)。通过在最多1.3B参数的GDN混合模型受控预训练,表明两种形态早期出现且对输出门控不对称响应,机制上支持由MA抵消时机调控的生命周期解释。

  • 揭示HLA LLM中PAS与ISP两种大规模激活形态
  • 跨多架构/配置/域/规模验证MA组织规律
  • 受控预训练显示门控不对称衰减MA但保留层结构
📄 2608.12149 ▲ 30 💬 4 📅 2026-08-11 ✍ Zunhai Su 等 11 人
arXiv 原文 HF 页面 代码仓库
2026-08-09 2 篇

Motif 3:技术报告

HF 热门 高相关 MoE架构设计长上下文

Motif 3: Technical Report

判定:从零训练314B MoE基座模型并报告预训练技术

本文提出Motif 3,一个314B总参数的解码器-only细粒度MoE语言模型,每token激活13.2B。其采用GDLA注意力、改进超连接、ESPN激活及多token预测等架构创新,并在约12.5T tokens上从零预训练,辅以专家均衡与MXFP8等稳定高效训练技术。经后训练整合多能力后,模型在推理、代码、长上下文等评测中媲美领先开放权重模型。

  • 细粒度MoE架构含384路由专家每token选8
  • GDLA融合分组差分注意力与MLA压缩KV
  • 12.5T tokens预训练并采用MXFP8与256K上下文并行
📄 2608.09119 ▲ 41 💬 1 📅 2026-08-09 ✍ Junghwan Lim 等 27 人
arXiv 原文 HF 页面

幂律图注意力:缩放点积注意力的精确泛化,推理时的经验性坍缩

HF 热门 高相关 架构设计注意力机制变体Transformer架构改进

Power law graph attention: exact generalization of scaled dot-product attention, empirical collapse at inference

判定:提出PLGA注意力架构并验证,属Transformer架构改进

该论文提出PLDR-LLM及其幂律图注意力(PLGA),以输入生成的正张量双线性算子替代固定SDPA。PLGA在恒等算子下精确包含SDPA,并具Perron-Frobenius结构与NOTEARS正则。论文证明推理不变性会导致推断坍缩为广义SDPA,并在发布检查点上测量了三阶段机制与分块训练一致性。

  • PLGA以学习的正幂律双线性算子泛化SDPA并精确包含之
  • 证明输入不变性下推理坍缩为常算子广义SDPA
  • 在检查点上测量旋转搅动等机制并验证分块训练一致性
📄 2608.10288 ▲ 7 💬 2 📅 2026-08-09 ✍ Burc Gokden
arXiv 原文 HF 页面 代码仓库
2026-08-08 1 篇

全带宽Transformer

HF 热门 高相关 架构设计预训练目标与算法训练动力学

Full-bandwidth transformer

判定:提出新架构与预训练目标并训练1B模型

标准Transformer解码步间垂直反馈通道过窄,仅采样token回传底部而顶层隐状态被丢弃。本文提出全带宽Transformer,通过门控线性单元将上层隐状态与词嵌入融合形成潜反馈,拓宽该通道且不改架构与KV缓存。采用调度多遍目标在预训练后期引入潜反馈并混合深层反馈以稳定训练。1B模型训练至400B token,验证损失、少样本评测及推理表现提升,等效省约1.5倍数据。

  • 用潜反馈拓宽解码步间垂直通道,保留标准Transformer与KV缓存
  • 调度多遍目标在预训练后期引入反馈并保证稳定性
  • 1B模型训400B token,效果匹敌多1.5倍数据的标准模型
📄 2608.08888 ▲ 21 💬 4 📅 2026-08-08 ✍ Xi Wang 等 8 人
arXiv 原文 HF 页面
2026-08-06 1 篇

Skaling:Chinchilla指数与Kaplan耦合的相遇

HF 热门 高相关 Scaling Law训练动力学compute-optimal

Skaling: Chinchilla's Exponents Meet Kaplan's Coupling

判定:提出耦合型Scaling Law优化预训练算力分配

标准神经Scaling Law在数据与模型极端区间系统性误估损失,根源在于假设模型规模与数据独立影响损失。本文提出Skaling律,通过单一交互指数耦合模型容量与数据,在插值与外推区间将MAPE降低1.5-3倍。结合低算力稀疏网格策略,可用约1/10算力实现全网格外推,为下一代模型预训练算力预算提供稳健高效框架。

  • 揭示标准Scaling Law独立假设导致极端区间误估
  • 提出耦合模型与数据的Skaling律交互指数形式
  • 稀疏网格+Skaling律实现10倍算力节省的外推
📄 2608.07222 ▲ 5 💬 0 📅 2026-08-06 ✍ Mathurin Videau 等 4 人
arXiv 原文 HF 页面
2026-08-05 3 篇

MameLoshnLM:意第绪语语言模型与评测基准

HF 热门 中相关 预训练数据continual/mid-training评测基准

MameLoshnLM: Yiddish Language Model and Evaluation Benchmark

判定:构建意第绪语预训练语料并继续预训练Llama 3.1 8B

针对意第绪语数字资源稀缺和评测缺失问题,作者构建了高质量预训练语料Oytser和多任务基准Kashes。基于该语料对Llama 3.1 8B进行继续预训练得到MameLoshnLM。该模型在基准上超越同规模开源基线,并更好捕捉意第绪语形态句法特征。

  • 发布高质量意第绪语预训练语料Oytser
  • 基于Llama 3.1 8B进行继续预训练得到MameLoshnLM
  • 构建Kashes基准验证低资源语言噪声数据缺陷
📄 2608.05850 ▲ 20 💬 3 📅 2026-08-05 ✍ Uri Katz 等 5 人
arXiv 原文 HF 页面 代码仓库

扩展内在可解释的语言模型

HF 热门 高相关 预训练目标与算法训练动力学架构设计

Scaling Inherently Interpretable Language Models

判定:将可解释性作为训练约束与语言建模目标联合优化

该工作挑战可解释性损害能力的假设,将可解释性作为训练流程约束与语言建模目标联合优化。在自回归与扩散语言模型上跨三个数量级算力验证可解释性随能力扩展,并训练Steerling-8B扩散语言模型支持概念归因与闭环干预。结果显示其竞争力媲美多倍算力训练的开放模型,表明可解释性可内建于预训练并随规模提升。

  • 将可解释性作为训练期约束与LM目标联合优化
  • 跨算力规模验证表征随规模更解耦可理解
  • Steerling-8B支持归因与无重训概念干预
📄 2608.07594 ▲ 17 💬 2 📅 2026-08-05 ✍ Guide Labs Team 等 10 人
arXiv 原文 HF 页面 代码仓库

超越序列顺序:面向Transformer的句法感知位置嵌入

HF 热门 高相关 位置编码架构设计预训练目标与算法

Beyond Sequence Order: Syntax-Informed Positional Embeddings for Transformers

判定:提出预训练期注入句法先验的位置编码方法

该论文解决Transformer位置编码忽略句法结构的问题。提出SiPE,在预训练时从依存句法树学习轻量句法先验,注入绝对、相对、旋转三类位置编码且不改注意力架构。实验表明预训练使用SiPE在SyntaxGym提升达10.3%、困惑度降9.0%,GLUE也提升最多8.2%。

  • SiPE在预训练期将依存句法先验注入主流位置编码家族
  • 不同架构最优注入点不同:解码器乘性耦合相对位置项,编码器加输入嵌入
  • 在句法泛化与GLUE上均优于无句法监督基线且推理仅用单解析
📄 2608.06111 ▲ 5 💬 2 📅 2026-08-05 ✍ Haris Riaz 等 3 人
arXiv 原文 HF 页面 代码仓库
2026-08-04 4 篇

迈向多模态预训练的物理:知识流、模态协同、早期统一与配方

HF 热门 高相关 多模态预训练架构设计MoE

Towards Physics of Multimodal Pretraining: Knowledge Flow, Modality Synergy, Early Unification, and Recipes

判定:系统研究多模态统一预训练机制与配方

本文研究原生统一多模态预训练中模态交互机制与设计空间这一未被充分探索的问题。通过在合成与真实数据集上的受控实验,系统分析了知识跨模态流动、协同与竞争、早期统一训练优势及高效配方。结果发现共享注意力等架构促进协同,早期统一优于晚期对齐,并以5%算力获得强生成性能,最终训练13.5B MoE模型于2T tokens验证。

  • 揭示语言与视觉间知识流的不对称转移模式
  • 共享注意力与模态特定FFN架构促进模态协同
  • 早期统一训练优于顺序训练并缓解视觉惰性
📄 2608.05000 ▲ 56 💬 2 📅 2026-08-04 ✍ Junlin Han 等 7 人
arXiv 原文 HF 页面

K-EXAONE 2.0 技术报告

HF 热门 高相关 MoE持续预训练长上下文

K-EXAONE 2.0 Technical Report

判定:报告涵盖持续预训练与mid-training及MoE架构升级

LG AI Research发布开放权重的多语言MoE基座模型K-EXAONE 2.0,通过对前代模型向上循环并扩展架构实现750B总参数、37B激活参数。训练流程结合持续预训练、难度聚焦的mid-training与后训练,支持256K上下文及十种语言。该模型在智能体编程与长上下文理解上提升明显,已Apache 2.0开源。

  • 由稠密模型向上循环为750B总参数MoE,激活37B
  • 训练含持续预训练与难度聚焦mid-training
  • 支持256K上下文并扩展至十种语言覆盖
📄 2608.04505 ▲ 20 💬 1 📅 2026-08-04 ✍ Eunbi Choi 等 77 人
arXiv 原文 HF 页面

Maglev:滑动循环记忆

HF 热门 高相关 模型架构长上下文注意力机制变体

Maglev: Sliding Recurrent Memory

判定:提出循环记忆Transformer架构并用于预训练

该工作针对长序列建模提出Maglev,一种带固定记忆的循环Transformer架构。其由预填充器Q(全注意力)与解码器P(滑动窗口+循环KV注入)耦合,通过记忆一致性损失对齐二者。实验表明Maglev在验证损失与下游预训练基准上优于滑动窗口及隐循环Transformer,且参数共享可降本保效。

  • 提出耦合Q与P的循环记忆Transformer架构
  • 用记忆一致性损失使推理仅用P且可并行训练
  • 预训练损失与基准优于基线且支持参数共享
📄 2608.02870 ▲ 14 💬 2 📅 2026-08-04 ✍ Bo Liu 等 2 人
arXiv 原文 HF 页面

损失函数看不见基,但Adam看得见

HF 热门 中相关 优化器训练动力学架构设计

The Loss Does Not See the Basis, but Adam Does

判定:研究优化器规范等变性,对预训练优化器设计有直接借鉴

本文研究因子化模型W=UV^T上不同优化器的隐式偏置差异,发现梯度下降具规范等变性而Adam不具备。通过结构定理与转移定理刻画记忆无关等变规则,并在矩阵感知与Transformer实验中验证。结果表明基的选择决定优化器所选插值解,对预训练优化器设计有借鉴意义。

  • 损失规范对称下梯度下降等变而Adam等非等变优化器不具低秩偏置
  • 给出记忆无关等变更新规则的Gram预条件器刻画与路径性质转移定理
  • Transformer中Adam首步分离规范等价初始化且产生不可旋转闭合的差距
📄 2608.05136 ▲ 6 💬 2 📅 2026-08-04 ✍ Devender Singh
arXiv 原文 HF 页面 代码仓库