过去一年,大模型研究的重心正在发生显著转移。如果说2023年的主题是“更大参数、更多数据”,那么当前的前沿探索已明确转向“更高效率、更强推理”。这一转变不仅体现在学术论文中,也深刻影响着工业界的落地路径。
首先,稀疏激活架构成为热点。以混合专家模型(MoE)为代表的技术,通过让不同输入激活不同参数子集,在保持总参数量巨大的同时,大幅降低单次推理的计算成本。近期多个开源模型(如Mixtral、DeepSeek-MoE)证明,稀疏模型在同等算力下可达到甚至超越稠密模型的性能。研究者进一步提出“细粒度专家分割”与“共享专家隔离”策略,让专家分工更明确,负载更均衡。这标志着大模型设计从“暴力堆叠”走向“结构化稀疏”。
其次,推理能力的专项优化取得突破。传统大模型依赖思维链提示,但推理深度有限。新一批研究聚焦于“推理时计算”的动态分配——让模型在简单问题上少算,在复杂问题上多算。例如,通过过程奖励模型(PRM)对每一步推理进行打分,再结合树搜索或束搜索,模型在数学、代码等任务上的准确率显著提升。OpenAI的o1系列与DeepSeek的R1系列均展示了这一路线的潜力。更值得关注的是,部分工作开始尝试将推理能力“蒸馏”回小模型,使7B级别模型在特定推理任务上接近百亿参数模型的表现。
第三,多模态与长上下文走向实用。早期多模态模型多停留在图文匹配层面,而新一代模型(如GPT-4o、Gemini 1.5、Qwen-VL)开始实现跨模态的细粒度理解与生成。同时,长上下文窗口从128K扩展到1M甚至10M token,使得模型能够处理整本书、数小时视频或大型代码库。关键技术包括环形注意力、位置插值与记忆压缩。这为法律、医疗、科研等长文档场景打开了新可能。
第四,训练与对齐方法持续演进。直接偏好优化(DPO)及其变体因无需奖励模型而广受欢迎,但最新研究指出其在分布外泛化上的局限。于是,迭代式DPO、KTO、以及基于博弈论的偏好优化方法被提出。另一方面,合成数据成为提升模型能力的关键杠杆——通过强模型生成高质量推理轨迹,再微调弱模型,形成“自我进化”循环。
最后,评估体系面临挑战。传统基准(如MMLU、GSM8K)逐渐饱和,且存在数据污染风险。新基准如GPQA、ARC-AGI、LiveBench强调抗污染与动态更新。同时,研究者呼吁关注“推理忠实度”——模型给出的推理步骤是否真实反映其内部计算,而非事后编造。
总体来看,大模型研究正从“规模崇拜”回归“智能本质”。效率、推理、多模态与对齐四条主线交织,推动技术从实验室走向可靠、可控、可负担的通用助手。未来一年,我们有望看到更多“小模型+强推理”的组合,以及面向真实场景的持续学习方案。