MLA · DEEPSEEKMOE · 128K CONTEXT · 中文全文译稿

DeepSeek-V2:
Strong, Economical, Efficient

DeepSeek-AIresearch@deepseek.com
AttentionMLA · 压缩 KV cache
MoE236B total · 21B active
Context128K token

将推理瓶颈与训练成本拆开解决:MLA 处理缓存与带宽,DeepSeekMoE 处理稀疏激活与专家专门化。

PDF
52 页
Figures
5
Tables
37
Equations
47
References
62

摘要

本文提出 DeepSeek-V2:一个兼具经济训练与高效推理的强大 Mixture-of-Experts(MoE)语言模型。模型总参数量为 236B,每个 token 激活 21B 参数,支持 128K 上下文。DeepSeek-V2 采用 Multi-head Latent Attention(MLA)与 DeepSeekMoE 等创新架构:MLA 将 Key-Value(KV)缓存显著压缩到潜在向量中,从而保证高效推理;DeepSeekMoE 则借助稀疏计算,以较低成本训练强模型。与 DeepSeek 67B 相比,DeepSeek-V2 的性能显著更强,同时节省 42.5% 训练成本、减少 93.3% KV cache,并把最大生成吞吐提升到 5.76 倍。我们在包含 8.1T token 的高质量多源语料上预训练,并进一步进行监督微调(SFT)与强化学习(RL)。评测显示,即使每个 token 只激活 21B 参数,DeepSeek-V2 及其 Chat 版本仍处于开源模型第一梯队。模型 checkpoint 可在 https://github.com/deepseek-ai/DeepSeek-V2 获取。

Figure 1原论文图面与译注
(a)不同开源模型的MMLU准确率与激活参数的关系。(b)DeepSeek 67B(密集)和DeepSeek-V2的训练成本和推理效率。

引言

在过去几年中,大型语言模型(LLMs)(OpenAI, 2022; OpenAI, 2023; Anthropic, 2023; Google, 2023)经历了快速发展,为人工通用智能(AGI)的曙光提供了瞥见。一般来说,LLM的智能往往随着参数数量的增加而提高,使其在各种任务中展现出涌现能力(Wei等人, 2022)。然而,这种改进是以更大的训练计算资源和推理吞吐量可能下降为代价的。这些约束带来了重大挑战,阻碍了LLMs的广泛采用和利用。为了解决这个问题,我们引入了DeepSeek-V2,一个强大的开源混合专家(MoE)语言模型,通过创新的Transformer架构实现经济训练和高效推理。它总共有236B参数,其中每个token激活21B,并支持128K token的上下文长度。

我们优化了Transformer框架内的注意力模块和前馈网络(FFNs)(Vaswani等人,2017)与我们提出的多头潜在注意力(MLA)DeepSeekMoE。(1) 在注意力 机制中,多头注意力(MHA)的键值(KV)缓存(Vaswani等人, 2017)对LLM的推理效率构成了重大障碍。已经探索了各种方法来解决这个问题, 包括分组查询注意力(GQA)(Ainslie等人,2023)和 多查询注意力(MQA)(Shazeer,2019). 然而,这些方法在尝试减少KV缓存时往往会牺牲性能。为了两全其美,我们引入了MLA,一种配备低秩键值联合压缩的注意力机制。实验证明,MLA相比MHA取得了更优的性能,同时显著减少了推理过程中的KV缓存,从而提升了推理效率。(2) 对于前馈网络(FFNs),我们遵循DeepSeekMoE架构(Dai等人,2024),该架构采用细粒度专家分割和共享专家隔离,以提升专家专业化的潜力。DeepSeekMoE架构相比传统MoE架构(如GShard(Lepikhin等人,2021))展现出巨大优势,使我们能够以经济成本训练强大的模型。由于我们在训练过程中采用专家并行,我们还设计了补充机制来控制通信开销并确保负载均衡。通过结合这两种技术,DeepSeek-V2同时具备了强大的性能(图1)、经济的训练成本和高效的推理吞吐量(图1)。

Figure 2原论文图面与译注
DeepSeek-V2架构示意图。MLA通过显著减少生成时的KV缓存来确保高效推理,而DeepSeekMoE通过稀疏架构实现以经济成本训练强大模型。

我们构建了一个高质量、多来源的预训练语料库,包含8.1T个词元。与DeepSeek 67B(我们之前的版本)使用的语料库相比(DeepSeek-AI, 2024),该语料库的特点是数据量更大,尤其是中文数据,且数据质量更高。我们首先在完整的预训练语料库上预训练DeepSeek-V2。然后,我们收集了150万个对话会话,涵盖数学、代码、写作、推理、安全等多个领域,以对DeepSeek-V2 Chat (SFT)进行监督微调(SFT)。最后,我们遵循DeepSeekMath(Shao et al., 2024),采用组相对策略优化(GRPO)进一步使模型与人类偏好对齐,并生成DeepSeek-V2 Chat (RL)。

我们在英语和中文的广泛基准上评估DeepSeek-V2,并与代表性的开源模型进行比较。评估结果显示,即使仅激活21B参数,DeepSeek-V2在开源模型中仍达到顶级性能,成为最强的开源MoE语言模型。图1强调,在MMLU上,DeepSeek-V2仅用少量激活参数就达到了顶尖性能。此外,如图1所示,与DeepSeek 67B相比,DeepSeek-V2节省了42.5%的训练成本,将KV缓存减少了93.3%,并将最大生成吞吐量提升至5.76倍。我们还评估了DeepSeek-V2 Chat (SFT)和DeepSeek-V2 Chat (RL)在开放式基准上的表现。值得注意的是,DeepSeek-V2 Chat (RL)在AlpacaEval 2.0上实现了38.9的长度控制胜率。(Dubois等人,2024),在MT-Bench上总体得分为8.97(Zheng等人, 2023),在AlignBench上总体得分为7.91(Liu等人,2023)。 英文开放式对话评估表明,DeepSeek-V2 Chat (RL)在开源聊天模型中具有顶级性能。此外,AlignBench上的评估表明,在中文方面, DeepSeek-V2 Chat (RL)优于所有开源模型,甚至 超过大多数闭源模型。

为了促进对MLA和 DeepSeekMoE的进一步研究和发展,我们还向开源社区发布了DeepSeek-V2-Lite,这是一个配备 MLA和DeepSeekMoE的较小模型。它总共有 15.7B参数,其中每个token激活2.4B。关于DeepSeek-V2-Lite的详细 描述可以在附录 B 中找到.

在本文的其余部分,我们首先详细描述 DeepSeek-V2的模型架构(第2节)。 随后,我们介绍我们的预训练工作,包括 训练数据构建、超参数设置、基础设施、 长上下文扩展,以及模型性能和效率的评估(第3节)。 接下来,我们展示我们在对齐方面的努力,包括 监督微调(SFT)、强化学习(RL)、 评估结果和其他讨论(第4 节)。最后,我们总结 结论,深思DeepSeek-V2当前的局限性,并 概述我们的未来工作(第5 节)。

架构

总的来说,DeepSeek-V2仍然采用Transformer 架构(Vaswani等人, 2017年),其中每个Transformer块包含一个注意力 模块和一个前馈网络(FFN)。然而,对于注意力 模块和FFN,我们都设计并采用了创新的架构。对于 注意力,我们设计了MLA,它利用低秩键值联合 压缩来消除推理时键值 缓存的瓶颈,从而支持高效推理。对于FFN,我们采用 DeepSeekMoE架构(Dai等人,2024年),这是一种高性能 的MoE架构,能够以经济 的成本训练强大的模型。DeepSeek-V2架构的图示见 图2,我们将在本节介绍 MLA和DeepSeekMoE的细节。对于其他微小的细节(例如,层 归一化和FFN中的激活函数),除非特别 说明,DeepSeek-V2遵循DeepSeek 67B的设置(DeepSeek-AI,2024年).

多头 潜在注意力:提升推理效率

传统的Transformer模型通常采用多头注意力(MHA)(Vaswani等人,2017),但在生成过程中,其庞大的键值(KV)缓存将成为限制推理效率的瓶颈。为了减少KV缓存,提出了多查询注意力(MQA)(Shazeer,2019)和分组查询注意力(GQA)(Ainslie等人,2023)。它们需要更小规模的KV缓存,但其性能不如MHA(我们在附录 D.1 中提供了 MHA、GQA和MQA的消融实验).

对于DeepSeek-V2,我们设计了一种创新的注意力机制,称为多头潜在注意力(MLA)。通过低秩键值联合压缩,MLA在性能上优于MHA,但所需的KV缓存量显著减少。我们在下文中介绍其架构,并在附录 D.2 中提供 MLA与MHA的比较.

预备知识:标准多头注意力

我们首先介绍标准的MHA机制作为背景。设dd为嵌入维度,nhn_h为注意力头数,dhd_h为每个头的维度,且htRd\mathbf{h}_{t} \in \mathbb{R}^{d}为注意力层中第tt个令牌的注意力输入。标准MHA首先通过三个矩阵qt,kt,vtRdhnh\mathbf{q}_{t}, \mathbf{k}_{t}, \mathbf{v}_{t} \in \mathbb{R}^{d_h n_h}分别产生WQ,WK,WVRdhnh×dW^{Q}, W^{K}, W^{V} \in \mathbb{R}^{d_h n_h \times d}:然后,qt,kt,vt\mathbf{q}_{t}, \mathbf{k}_{t}, \mathbf{v}_{t}将被切分为nhn_h个头以进行多头注意力计算:其中qt,i,kt,i,vt,iRdh\mathbf{q}_{t, i}, \mathbf{k}_{t, i}, \mathbf{v}_{t, i} \in \mathbb{R}^{d_h}分别表示第ii个注意力头的查询、键和值;WORd×dhnhW^{O} \in \mathbb{R}^{d \times d_h n_h}表示输出投影矩阵。在推理过程中,所有键和 值都需要被缓存以加速推理,因此MHA需要为每个 token缓存2nhdhl2 n_{h} d_{h} l个元素。在模型部署中,这种沉重的KV缓存是一个很大的瓶颈, 限制了最大批处理大小和序列长度。

公式(1)。

qt=WQht\mathbf{q}_{t} = W^{Q} \mathbf{h}_{t}

公式(2)。

kt=WKht\mathbf{k}_{t} = W^{K} \mathbf{h}_{t}

公式(3)。

vt=WVht\mathbf{v}_{t} = W^{V} \mathbf{h}_{t}

公式(4)。

[qt,1;qt,2;...;qt,nh]=qt[\mathbf{q}_{t, 1};\mathbf{q}_{t, 2};...;\mathbf{q}_{t, n_{h}}] = \mathbf{q}_{t}

公式(5)。

[kt,1;kt,2;...;kt,nh]=kt[\mathbf{k}_{t, 1};\mathbf{k}_{t, 2};...;\mathbf{k}_{t, n_{h}}] = \mathbf{k}_{t}

公式(6)。

[vt,1;vt,2;...;vt,nh]=vt[\mathbf{v}_{t, 1};\mathbf{v}_{t, 2};...;\mathbf{v}_{t, n_{h}}] = \mathbf{v}_{t}

公式(7)。

ot,i=j=1tSoftmaxj(qt,iTkj,idh)vj,i\mathbf{o}_{t, i} = \sum_{j=1}^{t} \operatorname{Softmax}_j(\frac{\mathbf{q}_{t, i}^T \mathbf{k}_{j, i}}{\sqrt{d_{h}}}) \mathbf{v}_{j, i}

公式(8)。

ut=WO[ot,1;ot,2;...;ot,nh]\mathbf{u}_{t} = W^{O} [\mathbf{o}_{t, 1};\mathbf{o}_{t, 2};...;\mathbf{o}_{t, n_{h}}]
Figure 3原论文图面与译注
多头注意力(MHA)、 分组查询注意力(GQA)、多查询注意力(MQA)和 多头潜在注意力(MLA)的简化示意图。通过将键 和值联合压缩到一个潜在向量中,MLA显著减少了推理过程中的KV缓存。

低秩键值联合 压缩

MLA的核心是键和值的低秩联合压缩, 以减少KV缓存:其中ctKVRdc\mathbf{c}_{t}^{KV} \in \mathbb{R}^{d_c}是键和值的压缩潜在向量;dc(dhnh)d_c (\ll d_h n_h)表示KV压缩维度;WDKVRdc×dW^{DKV} \in \mathbb{R}^{d_c \times d}是下投影矩阵;而WUK,WUVRdhnh×dcW^{UK},W^{UV} \in \mathbb{R}^{d_h n_h \times d_c}分别是键和值的上投影矩阵。在推理过程中,MLA只需缓存ctKV\mathbf{c}_{t}^{KV},因此其KV缓存仅有dcld_{c}l个元素,其中ll表示层数。此外,在推理过程中,由于WUKW^{UK}可以被吸收到WQW^{Q}中,而WUVW^{UV}可以被吸收到WOW^{O}中,我们甚至无需为注意力计算键和值。图3直观地展示了MLA中KV联合压缩如何减少KV缓存。

公式(9)。

ctKV=WDKVht\mathbf{c}_{t}^{KV} = W^{DKV} \mathbf{h}_{t}

公式(10)。

ktC=WUKctKV\mathbf{k}_{t}^{C} = W^{UK} \mathbf{c}_{t}^{KV}

公式(11)。

vtC=WUVctKV\mathbf{v}_{t}^{C} = W^{UV} \mathbf{c}_{t}^{KV}

此外,为了减少训练期间的激活内存,我们还对查询进行了低秩压缩,即使这不能减少KV缓存:其中ctQRdc\mathbf{c}_{t}^{Q} \in \mathbb{R}^{d_c^{\prime}}是查询的压缩潜在向量;dc(dhnh)d_c^{\prime} (\ll d_h n_h)表示查询压缩维度;WDQRdc×d,WUQRdhnh×dcW^{DQ} \in \mathbb{R}^{d_c^{\prime} \times d}, W^{UQ} \in \mathbb{R}^{d_h n_h \times d_c^{\prime}}分别是查询的下投影和上投影矩阵。

公式(12)。

ctQ=WDQht\mathbf{c}_{t}^{Q} = W^{DQ} \mathbf{h}_{t}

公式(13)。

qtC=WUQctQ\mathbf{q}_{t}^{C} = W^{UQ} \mathbf{c}_{t}^{Q}

解耦旋转位置嵌入

继DeepSeek 67B(DeepSeek-AI, 2024)之后,我们打算使用旋转位置嵌入(RoPE)(Su等人,2024)用于DeepSeek-V2。 然而,RoPE与低秩KV压缩不兼容。具体来说,RoPE对键和查询都是位置敏感的。如果我们对键应用RoPEktC\mathbf{k}_{t}^{C}, WUKW^{UK}在公式10中, 将与位置敏感的RoPE矩阵耦合。这样,WUKW^{UK}在推理过程中就无法再被吸收到WQW^{Q}中, 因为与当前生成令牌相关的RoPE矩阵将位于WQW^{Q}WUKW^{UK}之间,而矩阵乘法不满足交换律。因此,我们必须在推理过程中重新计算所有前缀令牌的键,这将显著阻碍推理效率。

作为解决方案,我们提出了解耦RoPE策略,该策略使用额外的多头查询qt,iRRdhR\mathbf{q}_{t, i}^{R} \in \mathbb{R}^{d_h^R}以及一个共享的键ktRRdhR\mathbf{k}_{t}^{R} \in \mathbb{R}^{d_h^R}用于携带 RoPE,其中dhRd_h^R表示 解耦查询和键的每头维度。借助 解耦的 RoPE 策略,MLA 执行以下计算:其中WQRRdhRnh×dcW^{QR} \in \mathbb{R}^{d_h^R n_h \times d_c^{\prime}}WKRRdhR×dW^{KR} \in \mathbb{R}^{d_h^R \times d}分别是用于生成解耦查询和键的矩阵;RoPE()\operatorname{RoPE}(\cdot)表示 应用 RoPE 矩阵的操作;而[;][\cdot;\cdot]表示拼接 操作。在推理过程中,解耦的键也需要被缓存。 因此,DeepSeek-V2 需要总共包含(dc+dhR)l(d_{c} + d_h^R)l个元素的 KV 缓存。

公式(14)。

[qt,1R;qt,2R;...;qt,nhR]=qtR=RoPE(WQRctQ)[\mathbf{q}_{t, 1}^{R};\mathbf{q}_{t, 2}^{R};...;\mathbf{q}_{t, n_{h}}^{R}] = \mathbf{q}_{t}^{R} = \operatorname{RoPE}({W^{QR}} \mathbf{c}_{t}^{Q})

公式(15)。

ktR=RoPE(WKRht)\mathbf{k}_{t}^{R} = \operatorname{RoPE}({W^{KR}} \mathbf{h}_{t})

公式(16)。

qt,i=[qt,iC;qt,iR]\mathbf{q}_{t, i} = [\mathbf{q}_{t, i}^{C}; \mathbf{q}_{t, i}^{R}]

公式(17)。

kt,i=[kt,iC;ktR]\mathbf{k}_{t, i} = [\mathbf{k}_{t, i}^{C}; \mathbf{k}_{t}^{R}]

公式(18)。

ot,i=j=1tSoftmaxj(qt,iTkj,idh+dhR)vj,iC\mathbf{o}_{t, i} = \sum_{j=1}^{t} \operatorname{Softmax}_j(\frac{\mathbf{q}_{t, i}^T \mathbf{k}_{j, i}}{\sqrt{d_{h} + d_{h}^{R}}}) \mathbf{v}_{j, i}^{C}

公式(19)。

ut=WO[ot,1;ot,2;...;ot,nh]\mathbf{u}_{t} = W^{O} [\mathbf{o}_{t, 1};\mathbf{o}_{t, 2};...;\mathbf{o}_{t, n_{h}}]

为了展示 MLA 的完整计算过程,我们 还在附录 C 中整理并给出了其完整公式.

Table 1语义 HTML 转录
不同注意力机制下每个token的KV缓存比较。nhn_{h}表示注意力头的数量,dhd_{h}表示每个注意力头的维度,ll表示层数,ngn_{g}表示GQA中的组数,dcd_{c}dhRd_h^R分别表示MLA中解耦查询和键的KV压缩维度和每头维度。KV缓存量以元素数量衡量,不考虑存储精度。对于DeepSeek-V2,dcd_{c}设置为4dh4d_{h}dhRd_h^R设置为dh2\frac{d_{h}}{2}. 因此,其KV缓存相当于仅有2.25组的GQA,但其性能强于MHA。
注意力机制 每个Token的KV缓存(#元素) 能力
多头注意力(MHA) 2nhdhl2 n_{h} d_{h} l
分组查询注意力(GQA) 2ngdhl2 n_{g} d_{h} l 中等
多查询注意力(MQA)     2dhl2 d_{h} l
MLA(我们的)         (dc+dhR)l92dhl~~~~~~~~(d_{c} + d_h^R)l \approx \frac{9}{2} d_{h} l                        更强

键值缓存比较

我们在表1中展示了不同注意力机制下每个token的KV缓存比较。MLA仅需要少量KV缓存,相当于只有2.25组的GQA,但能实现比MHA更强的性能。

DeepSeekMoE: 以经济成本训练强模型

基本架构

对于前馈网络,我们采用DeepSeekMoE架构(Dai等人,2024)。 DeepSeekMoE有两个关键思想:将专家细粒度分割,以实现更高的专家专业化和更准确的知识获取,并隔离一些共享专家以缓解路由专家之间的知识冗余。在激活和总专家参数数量相同的情况下,DeepSeekMoE可以优于传统MoE架构,如GShard(Lepikhin等人,2021)以较大 优势。

ut\mathbf{u}_{t}为第tt个token的FFN 输入,我们计算 FFN输出ht\mathbf{h}_{t}^{\prime}如下:其中NsN_{s}NrN_r分别表示 共享专家和路由专家的数量;FFNi(s)()\operatorname{FFN}^{(s)}_{i}(\cdot)FFNi(r)()\operatorname{FFN}^{(r)}_{i}(\cdot)表示第ii个共享专家和第ii个路由专家, 分别;KrK_{r}表示 激活的路由专家数量;gi,tg_{i,t}是第ii个专家的门控值;si,ts_{i,t}是令牌到专家的亲和度;ei\mathbf{e}_{i}是第ii个路由专家在本 层的质心;而Topk(,K)\operatorname{Topk}(\cdot, K)表示包含KK在计算出的亲和力分数中,第tt个令牌与所有路由专家之间的最高分数。

公式(20)。

ht=ut+i=1NsFFNi(s)(ut)+i=1Nrgi,tFFNi(r)(ut)\mathbf{h}_{t}^{\prime} = \mathbf{u}_{t} + \sum_{i=1}^{N_{s}} {\operatorname{FFN}^{(s)}_{i}\left( \mathbf{u}_{t} \right)} + \sum_{i=1}^{N_r} {g_{i,t} \operatorname{FFN}^{(r)}_{i}\left( \mathbf{u}_{t} \right)}

公式(21)。

gi,t={si,t,si,tTopk({sj,t1jNr},Kr),0,otherwise,g_{i,t} = \begin{cases} s_{i,t}, & s_{i,t} \in \operatorname{Topk} (\{ s_{j, t} | 1 \leqslant j \leqslant N_r \}, K_{r}), \\ 0, & \text{otherwise}, \end{cases}

公式(22)。

si,t=Softmaxi(utTei)s_{i,t} = \operatorname{Softmax}_i \left( {\mathbf{u}_{t}}^{T} \mathbf{e}_{i} \right)

设备限制路由

我们设计了一种设备限制路由机制,以限制与MoE相关的通信成本。当采用专家并行时,路由专家将分布在多个设备上。对于每个令牌,其与MoE相关的通信频率与其目标专家覆盖的设备数量成正比。由于DeepSeekMoE中细粒度的专家分割,激活的专家数量可能很大,因此如果应用专家并行,与MoE相关的通信将更加昂贵。

对于DeepSeek-V2,除了简单的路由专家top-K选择外,我们还额外确保每个令牌的目标专家分布在最多MM个设备上。具体来说,对于每个令牌,我们首先选择MM个具有最高亲和力分数的专家所在的设备。然后,在这MM个设备上对专家进行top-K选择。在实践中,我们发现当M3M \geqslant 3时,设备限制路由可以实现与无限制top-K路由大致相当的良好性能。

用于负载均衡的辅助损失

我们考虑了自动学习路由策略中的负载均衡。首先,负载不均衡会增加路由崩溃的风险(Shazeer等人,2017),导致一些专家无法得到充分训练和利用。其次,当采用专家并行时,负载不均衡会降低计算效率。在训练DeepSeek-V2的过程中,我们设计了三种辅助损失,分别用于控制专家级负载均衡(LExpBal\mathcal{L}_{\mathrm{ExpBal}})、设备级负载均衡(LDevBal\mathcal{L}_{\mathrm{DevBal}})和通信均衡(LCommBal\mathcal{L}_{\mathrm{CommBal}})。

专家级均衡损失。

我们使用专家级均衡损失(Fedus等人,2021;Lepikhin等人,2021)来缓解路由崩溃的风险:其中α1\alpha_1是一个称为专家级平衡因子的超参数;1()\mathds{1}(\cdot)表示指示 函数;而TT表示序列中 的令牌数量。

公式(23)。

LExpBal=α1i=1NrfiPi\mathcal{L}_{\mathrm{ExpBal}} = \alpha_1 \sum_{i=1}^{N_r}{f_i P_i}

公式(24)。

fi=NrKrTt=1T1(Token t selects Expert i)f_i = \frac{N_r}{K_r T} \sum_{t=1}^{T}{ \mathds{1}( \text{Token $t$ selects Expert $i$} )}

公式(25)。

Pi=1Tt=1Tsi,tP_i = \frac{1}{T} \sum_{t=1}^{T}{s_{i,t}}

设备级平衡损失。

除了专家级平衡损失之外,我们还额外设计 了设备级平衡损失,以确保不同设备之间的计算平衡。在DeepSeek-V2的训练过程中,我们将所有路由专家划分为DD{E1,E2,...,ED}\{\mathcal{E}_1, \mathcal{E}_2, ..., \mathcal{E}_D \},并将每组部署在单个设备上。 设备级平衡损失的计算如下:其中α2\alpha_{2}是一个称为 设备级平衡因子的超参数。

公式(26)。

LDevBal=α2i=1DfiPi\mathcal{L}_{\mathrm{DevBal}} = \alpha_{2} \sum_{i=1}^{D}{f_i^{\prime} P_i^{\prime}}

公式(27)。

fi=1EijEifjf_i^{\prime} = \frac{1}{|\mathcal{E}_i|} \sum_{j \in \mathcal{E}_i}{ f_j }

公式(28)。

Pi=jEiPjP_i^{\prime} = \sum_{j \in \mathcal{E}_i}{ P_j }

通信平衡损失。

最后,我们引入了一种通信平衡损失,以确保每个设备的通信是平衡的。尽管设备限制路由机制保证了每个设备发送的通信量是有界的,但如果某个设备接收的令牌多于其他设备,实际通信效率也会受到影响。为了缓解这个问题,我们设计了一种通信平衡损失,如下所示:其中α3\alpha_{3}是一个称为通信平衡因子的超参数。设备限制路由机制的工作原理是确保每个设备最多向其他设备传输MTMT个隐藏状态。同时,采用通信平衡损失来鼓励每个设备从其他设备接收大约MTMT个隐藏状态。通信平衡损失保证了设备之间信息的均衡交换,促进了高效的通信。

公式(29)。

LCommBal=α3i=1DfiPi\mathcal{L}_{\mathrm{CommBal}} = \alpha_{3} \sum_{i=1}^{D}{f_i^{\prime\prime} P_i^{\prime\prime}}

公式(30)。

fi=DMTt=1T1(Token t is sent to Device i)f_i^{\prime\prime} = \frac{D}{M T} \sum_{t=1}^{T}{ \mathds{1}( \text{Token $t$ is sent to Device $i$} )}

公式(31)。

Pi=jEiPjP_i^{\prime\prime} = \sum_{j \in \mathcal{E}_i}{ P_j }

令牌丢弃策略

虽然平衡损失旨在鼓励负载均衡,但重要的是要认识到它们不能保证严格的负载均衡。为了进一步缓解由负载不均衡引起的计算浪费,我们在训练过程中引入了一种设备级令牌丢弃策略。该方法首先计算每个设备的平均计算预算,这意味着每个设备的容量因子等于1.0。然后,受Riquelme等人(2021)的启发,我们在每个设备上丢弃亲和力得分最低的令牌,直到达到计算预算。此外,我们确保属于大约10%训练序列的令牌永远不会被丢弃。通过这种方式,我们可以根据效率要求灵活决定在推理过程中是否丢弃令牌,并始终确保训练和推理之间的一致性。

预训练

实验设置

数据构建

在保持与DeepSeek 67B相同的数据处理阶段的同时(DeepSeek-AI,2024),我们扩展了数据量并提升了数据质量。 为了扩大预训练语料库,我们探索了 互联网数据的潜力并优化了清洗流程,从而恢复了 大量被误删的数据。此外,我们加入了更多 中文数据,旨在更好地利用中文互联网上可用的 语料。除了数据量,我们还关注 数据质量。我们用来自各种来源的高质量 数据丰富了预训练语料库,同时改进了基于质量的 过滤算法。改进后的算法确保大量 无益数据将被移除,而有价值的数据将 大部分被保留。此外,我们从预训练语料库中过滤掉有争议的 内容,以减轻特定区域文化引入的数据偏差。 关于此过滤策略影响的详细讨论见附录E.

我们采用了与DeepSeek 67B相同的分词器,该分词器基于 字节级字节对编码(BBPE)算法构建,词汇量 大小为100K。我们的分词预训练语料库包含8.1T 个词元,其中中文词元比英文词元大约多12%。

超参数

模型超参数。

我们将Transformer层数设置为60,隐藏 维度设置为5120。所有可学习参数均以 0.006的标准差随机初始化。在MLA中,我们将注意力头数设置为nhn_h至 128,且 每头维度dhd_h至 128。 KV 压缩维度dcd_c设置为 512,查询压缩维度dcd_c^{\prime}设置为 1536。对于 解耦的查询和键,我们将每头维度dhRd_h^R设置为 64。遵循Dai et al. (2024),我们 将除第一层外的所有 FFN 替换为 MoE 层。每个 MoE 层由 2 个共享专家和 160 个路由专家组成,其中 每个专家的中间隐藏维度为 1536。在路由 专家中,每个 token 将激活 6 个专家。此外, 低秩压缩和细粒度专家分割将影响 层的输出规模。因此,在实践中,我们在压缩潜在向量之后 采用额外的 RMS Norm 层,并在宽度瓶颈(即 压缩潜在向量和路由专家的中间隐藏状态)处乘以 额外的缩放因子,以确保稳定训练。在此配置下, DeepSeek-V2 总参数为 236B,其中每个 token 激活 21B。

训练超参数。

我们采用 AdamW 优化器(Loshchilov and Hutter, 2019),其中 超参数设置为β1=0.9\beta_1=0.9, β2=0.95\beta_2=0.95,以及weight_decay=0.1\mathrm{weight\_decay}=0.1。学习 率采用预热和步进衰减策略进行调度(DeepSeek-AI,2024)。 最初,学习率在前2K步内从0线性增加到最大值。随后,在训练约60%的token后,学习率乘以0.316,在训练约90%的token后再次乘以0.316。最大学习率设置为2.4×1042.4 \times 10^{-4},并且 梯度裁剪范数设置为1.0。我们还使用批量大小 调度策略,在前225B个token的训练中,批量大小从2304逐渐增加到9216,然后在剩余训练中保持 9216。我们将最大序列长度设置为 4K,并在8.1T个token上训练DeepSeek-V2。我们利用流水线 并行将模型的不同层部署在不同的设备上, 对于每一层,路由专家将均匀部署在8个 设备上(D=8D=8)。至于 设备限制路由,每个token最多发送到3个设备 (M=3M=3)。至于平衡损失,我们 将α1\alpha_{1}设置为0.003,α2\alpha_{2}设置为0.05,以及α3\alpha_{3}到0.02。我们在训练期间采用令牌丢弃策略以加速,但在评估时不丢弃任何令牌。

基础设施

DeepSeek-V2基于HAI-LLM框架进行训练(High-flyer,2023),这是我们工程师内部开发的一个高效且轻量的训练框架。它采用了16路零气泡流水线并行(Qi等人,2023)、8路专家并行(Lepikhin等人,2021)以及ZeRO-1数据并行(Rajbhandari等人,2020). 鉴于DeepSeek-V2激活参数相对较少,且部分算子被重计算以节省激活内存,因此可以在无需张量并行的情况下进行训练,从而减少通信开销。此外,为了进一步提高训练效率,我们将共享专家的计算与专家并行的全对全通信重叠。我们还为通信、路由算法以及跨专家的融合线性计算定制了更快的CUDA内核。另外,MLA也基于FlashAttention-2的改进版本进行了优化(Dao, 2023).

我们在配备NVIDIA H800 GPU的集群上进行了所有实验。H800集群中的每个节点包含8个GPU,节点内通过NVLink和NVSwitch连接。节点间使用InfiniBand互连以促进通信。

Figure 4原论文图面与译注
“大海捞针”(NIAH)测试的评估结果。DeepSeek-V2在所有上下文窗口长度(最长128K)下均表现良好。

长上下文扩展

在DeepSeek-V2的初始预训练之后,我们采用YaRN(Peng et al., 2023)将默认上下文窗口长度从4K扩展到128K。YaRN专门应用于解耦的共享键ktR\mathbf{k}^R_t,因为它负责携带RoPE(Su et al., 2024). 对于YaRN,我们将缩放比例ss设为40,α\alpha设为1,β\beta设为32,目标最大上下文长度设为160K。在这些设置下,我们可以预期模型在128K的上下文长度下表现良好。与原始YaRN略有不同,由于我们独特的注意力机制,我们调整了长度缩放因子以调节注意力熵。因子t\sqrt{t}计算为t=0.0707lns+1\sqrt{t} = 0.0707 \ln{s} + 1,旨在最小化困惑度。

我们另外训练模型1000步,序列长度为32K,批量大小为576个序列。尽管训练仅在32K的序列长度下进行,但模型在128K的上下文长度下评估时仍表现出稳健的性能。如图4所示,“大海捞针”(NIAH)测试的结果表明,DeepSeek-V2在高达128K的所有上下文窗口长度下均表现良好。

评估

评估基准

DeepSeek-V2 在双语语料库上进行预训练,因此我们在英语和中文的一系列基准测试上对其进行评估。我们的评估基于集成在我们 HAI-LLM 框架中的内部评估框架。所包含的基准测试分类如下,其中带下划线的基准测试为中文:

多学科多项选择数据集包括 MMLU(Hendrycks 等人, 2020), C-Eval (黄等人, 2023),以及CMMLU (Li等人,2023).

语言理解与推理数据集 包括HellaSwag(Zellers 等人,2019)、PIQA(Bisk等人,2020)、ARC(Clark等人,2018)以及BigBench Hard (BBH)(Suzgun等 人。, 2022).

闭卷问答数据集包括 TriviaQA(Joshi et al., 2017)和 NaturalQuestions(Kwiatkowski et al., 2019).

阅读理解数据集包括 RACE(Lai et al., 2017), DROP(Dua et al., 2019), C3 (Sun等人, 2019年),以及CMRC (Cui等人,2019年).

参考消歧数据集包括WinoGrande(Sakaguchi 等人,2019年)CLUEWSC (Xu等人,2020年).

语言建模数据集包括Pile(Gao等人, 2020).

中文理解与文化数据集包括CHID (Zheng等人,2019年)CCPM (Li等人,2021).

数学数据集包括GSM8K(Cobbe等人, 2021),MATH(Hendrycks等人,2021),以及CMath (Wei等人,2023).

代码数据集包括HumanEval(Chen等人,2021), MBPP((Austin等人), 2021)和CRUXEval(Gu等人, 2024).

标准化考试包括AGIEval (Zhong等人,2023). 注意 AGIEval 包含英文和中文子集。

继我们之前的工作(DeepSeek-AI, 2024)之后,我们采用 基于困惑度的评估方法用于包括 HellaSwag、PIQA、 WinoGrande、RACE-Middle、RACE-High、MMLU、ARC-Easy、ARC-Challenge、CHID、 C-Eval、CMMLU、C3 和 CCPM 在内的数据集,并采用基于生成的评估方法用于 TriviaQA、NaturalQuestions、DROP、MATH、GSM8K、HumanEval、MBPP、 CRUXEval、BBH、AGIEval、CLUEWSC、CMRC 和 CMath。此外,我们 对 Pile-test 进行基于语言模型的评估,并使用 Bits-Per-Byte (BPB) 作为指标,以确保在不同分词器的模型之间进行公平比较。

为了直观了解这些基准,我们 还在附录 G 中提供了各基准的评估格式.

评估结果

Table 2语义 HTML 转录
DeepSeek-V2 与其他代表性 开源模型的比较。所有模型均在我们的内部框架中评估 并共享相同的评估设置。粗体表示最佳,下划线表示第二好。差距小于0.3的分数视为同一水平。仅激活210亿参数,DeepSeek-V2在开源模型中达到了顶尖性能。
基准 (指标) # 样本数 DeepSeek Qwen1.5 Mixtral LLaMA 3 DeepSeek-V2
67B 72B 8x22B 70B
架构 - 密集 密集 MoE 密集 MoE
# 激活参数 - 67B 72B 39B 70B 21B
# 总参数 - 67B 72B 141B 70B 236B
英语 Pile-test(BPB) - 0.642 0.637 0.623 0.602 0.606
BBH(EM) 3次尝试 68.7 59.9 78.9 81.0 78.9
MMLU(准确率) 5次尝试 71.3 77.2 77.6 78.9 78.5
DROP(F1) 3次尝试 69.7 71.5 80.4 82.5 80.1
ARC-Easy(准确率) 25次尝试 95.3 97.1 97.3 97.9 97.6
ARC-Challenge(准确率) 25-shot 86.4 92.8 91.2 93.3 92.4
HellaSwag(准确率) 10-shot 86.3 85.8 86.6 87.9 84.2
PIQA(准确率) 0-shot 83.6 83.3 83.6 85.0 83.7
WinoGrande(准确率) 5-shot 84.9 82.4 83.7 85.7 84.9
RACE-Middle(准确率) 5-shot 69.9 63.4 73.3 73.3 73.1
RACE-High(准确率) 5-shot 50.7 47.0 56.7 57.9 52.7
TriviaQA(精确匹配) 5-shot 78.9 73.1 82.1 81.6 79.9
NaturalQuestions(精确匹配) 5-shot 36.6 35.6 39.6 40.2 38.7
AGIEval(准确率) 0-shot 41.3 64.4 43.4 49.8 51.2
HumanEval(Pass@1) 0-shot 45.1 43.9 53.1 48.2 48.8
MBPP(Pass@1) 3-shot 57.4 53.6 64.2 68.6 66.6
CRUXEval-I(准确率) 2-shot 42.5 44.3 52.4 49.4 52.8
CRUXEval-O(准确率) 2-shot 41.0 42.3 52.8 54.3 49.8
数学 GSM8K(EM) 8-shot 63.4 77.9 80.3 83.0 79.2
MATH(EM) 4-shot 18.7 41.4 42.5 42.2 43.6
CMath(EM) 3-shot 63.0 77.8 72.3 73.9 78.7
中文 CLUEWSC(EM) 5-shot 81.0 80.5 77.5 78.3 82.2
C-Eval(准确率) 5-shot 66.1 83.7 59.6 67.5 81.7
CMMLU(准确率) 5-shot 70.8 84.3 60.0 69.3 84.0
CMRC (EM) 1-shot 73.4 66.6 73.1 73.3 77.5
C3 (Acc.) 0-shot 75.3 78.2 71.4 74.0 77.4
CHID (Acc.) 0-shot 92.1 - 57.0 83.2 92.7
CCPM (Acc.) 0-shot 88.5 88.1 61.0 68.1 93.1

在表2中,我们将DeepSeek-V2与几个具有代表性的开源模型进行了比较,包括DeepSeek 67B(DeepSeek-AI, 2024)(我们之前的版本),Qwen1.5 72B(Bai et al., 2023),LLaMA3 70B(AI@Meta, 2024),以及Mixtral 8x22B(Mistral, 2024)。我们使用内部评估框架对所有模型进行评估,并确保它们共享相同的评估设置。总体而言,仅激活21B参数,DeepSeek-V2在几乎所有基准测试中显著优于DeepSeek 67B,并在开源模型中达到顶级性能。

此外,我们逐一详细比较了DeepSeek-V2与其开源对应模型。(1)与同样支持中英文的Qwen1.5 72B相比,DeepSeek-V2在大多数英语、代码和数学基准测试中展现出压倒性优势。在中文基准测试中,Qwen1.5 72B在多学科选择题任务上表现更好,而DeepSeek-V2在其他任务上相当或更好。注意,对于CHID基准,Qwen1.5 72B的分词器在我们的评估框架中会遇到错误,因此我们为Qwen1.5 72B留空CHID分数。(2)与Mixtral 8x22B相比,DeepSeek-V2在英语性能上相当或更好,除了与英语常识知识密切相关的TriviaQA、NaturalQuestions和HellaSwag。值得注意的是,DeepSeek-V2在MMLU上优于Mixtral 8x22B。在代码和数学基准上,DeepSeek-V2与Mixtral 8x22B表现相当。由于Mixtral 8x22B未专门针对中文数据进行训练,其中文能力远落后于DeepSeek-V2。(3)与LLaMA3 70B相比,DeepSeek-V2训练的英语token不到其四分之一。因此,我们承认DeepSeek-V2在基础英语能力上与LLaMA3 70B仍有微小差距。然而,即使训练token和激活参数少得多,DeepSeek-V2在代码和数学能力上仍与LLaMA3 70B相当。此外,作为双语语言模型,DeepSeek-V2在中文基准测试上大幅优于LLaMA3 70B。

最后,值得一提的是,某些先前的研究(Hu等人, 2024)在预训练阶段加入SFT数据,而DeepSeek-V2在预训练期间从未接触过SFT数据。

训练与推理效率

训练成本。

由于DeepSeek-V2对每个token激活的参数更少,且所需的FLOPs少于DeepSeek 67B,理论上训练DeepSeek-V2将比训练DeepSeek 67B更经济。尽管训练MoE模型会引入额外的通信开销,但通过我们的算子与通信优化,DeepSeek-V2的训练可以达到较高的模型FLOPs利用率(MFU)。在我们H800集群的实际训练中,每训练一万亿token,DeepSeek 67B需要300.6K GPU小时,而DeepSeek-V2仅需172.8K GPU小时,即稀疏的DeepSeek-V2相比稠密的DeepSeek 67B可节省42.5%的训练成本。

推理效率。

为了高效部署DeepSeek-V2服务,我们首先将其参数转换为FP8精度。此外,我们还对DeepSeek-V2进行KV缓存量化(Hooper等人,2024;Zhao等人,2023),以进一步将其KV缓存中的每个元素平均压缩到6比特。得益于MLA和这些优化,实际部署的DeepSeek-V2所需的KV缓存远少于DeepSeek 67B,因此可以服务更大的批处理大小。我们基于实际部署的DeepSeek 67B服务的提示和生成长度分布来评估DeepSeek-V2的生成吞吐量。在配备8块H800 GPU的单节点上,DeepSeek-V2的生成吞吐量超过每秒50K tokens,是DeepSeek 67B最大生成吞吐量的5.76倍。此外,DeepSeek-V2的提示输入吞吐量超过每秒100K tokens。

对齐

监督微调

基于我们先前的研究(DeepSeek-AI, 2024),我们整理了指令微调数据集,包含150万条实例,其中120万条用于有用性,30万条用于安全性。与初始版本相比,我们提高了数据质量以减少幻觉响应并增强写作能力。我们对DeepSeek-V2进行了2个周期的微调,学习率设置为5×1065 \times 10^{-6}。对于DeepSeek-V2 Chat (SFT)的评估,我们主要采用基于生成的基准测试,除了几个代表性的多项选择任务(MMLU和ARC)。我们还进行了指令遵循评估(IFEval)(Zhou et al., 2023),针对DeepSeek-V2 Chat (SFT),使用提示级宽松准确率作为指标。此外,我们使用了2023年9月1日至2024年4月1日期间的LiveCodeBench(Jain et al., 2024)问题来评估聊天模型。除了标准基准测试外,我们还在开放式对话基准测试上进一步评估我们的模型,包括MT-Bench(Zheng et al., 2023), AlpacaEval 2.0(Dubois et al., 2024)和 AlignBench(Liu et al., 2023)。为了进行比较,我们 还在我们的评估框架和设置中评估了 Qwen1.5 72B Chat、LLaMA-3-70B Instruct 和 Mistral-8x22B Instruct。至于 DeepSeek 67B Chat,我们直接参考了之前发布中报告的评估结果。

强化学习

为了进一步释放 DeepSeek-V2 的潜力并使其与 人类偏好对齐,我们进行了强化学习 (RL) 来调整其偏好。

强化学习 算法。

为了节省 RL 的训练成本,我们采用了组相对 策略优化 (GRPO)(Shao et al., 2024),它放弃了通常与策略模型大小相同的评论家模型,而是从组分数中估计基线。具体来说,对于每个问题qq,GRPO采样一组输出{o1,o2,,oG}\{o_1, o_2, \cdots, o_G\}来自旧策略πθold\pi_{\theta_{old}},然后通过最大化以下目标来优化策略模型πθ\pi_{\theta}: 其中ε\varepsilonβ\beta是超参数;而AiA_i是优势,使用每组内输出对应的奖励组{r1,r2,,rG}\{r_1, r_2, \ldots, r_G\}计算得出:

公式(32)。

JGRPO(θ)=E[qP(Q),{oi}i=1Gπθold(Oq)]1Gi=1G(min(πθ(oiq)πθold(oiq)Ai,clip(πθ(oiq)πθold(oiq),1ε,1+ε)Ai)βDKL(πθπref)),\begin{aligned} \begin{aligned} \mathcal{J}_{GRPO}(\theta) = \mathbb{E}{[q \sim P(Q), \{o_i\}_{i=1}^G \sim \pi_{\theta_{old}}(O|q)]} \\ & \frac{1}{G}\sum_{i=1}^G \left( \min \left( \frac{\pi_\theta(o_i |q)}{\pi_{\theta_{old}}(o_i |q)} A_i, \text{clip} \left( \frac{\pi_\theta(o_i |q)}{\pi_{\theta_{old}}(o_i |q)}, 1 - \varepsilon, 1 + \varepsilon\right) A_i \right) - \beta \mathbb{D}_{KL}\left(\pi_{\theta} || \pi_{ref}\right)\right) , \end{aligned} \end{aligned}

公式(33)。

DKL(πθπref)=πref(oiq)πθ(oiq)logπref(oiq)πθ(oiq)1,\begin{aligned} \mathbb{D}_{KL}\left(\pi_{\theta} || \pi_{ref}\right) = \frac{\pi_{ref}(o_i|q)}{\pi_{\theta}(o_i|q)}- \log\frac{\pi_{ref}(o_i|q)}{\pi_{\theta}(o_i|q)} - 1, \end{aligned}

公式(34)。

Ai=rimean({r1,r2,,rG})std({r1,r2,,rG}).\begin{aligned} A_i = \frac{r_i - {\mathrm mean(\{r_1, r_2, \cdots, r_G\})}}{{\mathrm std(\{r_1, r_2, \cdots, r_G\})}}. \end{aligned}

训练策略。

在我们的初步实验中,我们发现对推理数据(如代码和数学提示)进行强化学习训练表现出与一般数据训练不同的独特特征。例如,我们模型的数学和编码能力可以在更长的训练步骤中持续提升。因此,我们采用两阶段强化学习训练策略,首先进行推理对齐,然后进行人类偏好对齐。在第一阶段推理对齐中,我们训练一个奖励模型RMreasoningRM_{reasoning}用于代码和数学推理任务,并根据RMreasoningRM_{reasoning} 的反馈优化策略模型:在第二阶段人类偏好对齐中,我们采用多奖励框架,从有用性奖励模型RMhelpfulRM_{helpful}、安全性奖励模型RMsafetyRM_{safety}以及基于规则的奖励模型RMruleRM_{rule}获取奖励。响应oio_i的最终奖励为,其中c1c_1, c2c_2c3c_3是对应的系数。

公式(35)。

ri=RMreasoning(oi).\begin{aligned} r_i=RM_{reasoning}(o_i). \end{aligned}

公式(36)。

ri=c1RMhelpful(oi)+c2RMsafety(oi)+c3RMrule(oi),\begin{aligned} r_i = c_1 \cdot RM_{helpful}(o_i) + c_2 \cdot RM_{safety}(o_i) + c_3 \cdot RM_{rule}(o_i), \end{aligned}

为了获得在强化学习训练中发挥关键作用的可靠奖励模型,我们仔细收集偏好数据,并精心进行质量过滤和比例调整。我们基于编译器反馈获得代码偏好数据,并基于真实标签获得数学偏好数据。对于奖励模型的训练,我们使用DeepSeek-V2 Chat(SFT)初始化奖励模型,并使用点式或成对损失进行训练。在我们的实验中,我们观察到强化学习训练可以充分挖掘并激活我们模型的潜力,使其能够从可能的回答中选择正确且令人满意的答案。

训练效率的优化。

在超大规模模型上进行强化学习训练对训练框架提出了很高的要求。它需要仔细的工程优化来管理GPU内存和RAM压力,同时保持快速的训练速度。为此,我们实施了以下工程优化。(1)首先,我们提出了一种混合引擎,分别对训练和推理采用不同的并行策略,以实现更高的GPU利用率。(2)其次,我们利用vLLM(Kwon等人, 2023)作为我们的推理后端,并使用大批量大小来加速推理速度。(3)第三,我们精心设计了一种将模型卸载到CPU并加载回GPU的调度策略,这在训练速度和内存消耗之间实现了接近最优的平衡。

评估结果

标准基准上的评估。最初,我们在标准基准上评估DeepSeek-V2 Chat(SFT)和DeepSeek-V2 Chat(RL)。值得注意的是,与基础版本相比,DeepSeek-V2 Chat(SFT)在GSM8K、MATH和HumanEval评估中表现出显著的改进。这一进步归因于我们包含的SFT数据,其中包含大量数学和代码相关内容。此外,DeepSeek-V2 Chat(RL)进一步提升了数学和代码基准的性能。我们在附录 F 中展示了更多代码与数学评测.

至于与其他模型的比较,我们首先将DeepSeek-V2 Chat(SFT)与Qwen1.5 72B Chat进行比较,发现DeepSeek-V2 Chat(SFT)在几乎所有英语、数学和代码基准测试上均超越Qwen1.5 72B Chat。在中文基准测试上,DeepSeek-V2 Chat(SFT)在多学科多项选择任务上的得分略低于Qwen1.5 72B Chat,这与它们基础版本的表现一致。与最先进的开源MoE模型Mixtral 8x22B Instruct相比,DeepSeek-V2 Chat(SFT)在大多数基准测试上表现更优,但NaturalQuestions和IFEval除外。此外,与最先进的开源模型LLaMA3 70B Chat相比,DeepSeek-V2 Chat(SFT)在代码和数学相关基准测试上表现相似。LLaMA3 70B Chat在MMLU和IFEval上表现更佳,而DeepSeek-V2 Chat(SFT)在中文任务上表现更强。最终,DeepSeek-V2 Chat(RL)在数学和编码任务上的性能相比DeepSeek-V2 Chat(SFT)进一步提升。这些比较凸显了DeepSeek-V2 Chat在各种领域和语言中相对于其他语言模型的优势。

Table 3语义 HTML 转录
DeepSeek-V2 Chat(SFT)、DeepSeek-V2 Chat(RL)与其他代表性开源聊天模型的比较。关于TriviaQA和NaturalQuestions,值得注意的是,聊天模型(如LLaMA3 70B Instruct)可能不会严格遵守少样本设置中通常指定的格式约束。因此,这可能导致在我们的评估框架中低估某些模型。
基准测试 # 样本数 DeepSeek Qwen 1.5 LLaMA3 Mixtral DeepSeek-V2 DeepSeek-V2
67B 聊天 72B 聊天 70B 指令 8x22B 指令 聊天(SFT) 聊天(RL)
上下文长度 - 4K 32K 8K 64K 128K 128K
架构 - 稠密 稠密 稠密 MoE MoE MoE
# 激活参数 - 67B 72B 70B 39B 21B 21B
# 总参数 - 67B 72B 70B 141B 236B 236B
英语 TriviaQA 5-shot 81.5 79.6 69.1 80.0 85.4 86.7
NaturalQuestions 5-shot 47.0 46.9 44.6 54.9 51.9 53.4
MMLU 5-shot 71.1 76.2 80.3 77.8 78.4 77.8
ARC-Easy 25-shot 96.6 96.8 96.9 97.1 97.6 98.1
ARC-Challenge 25-shot 88.9 91.7 92.6 90.0 92.5 92.3
BBH 3-shot 71.7 65.9 80.1 78.4 81.3 79.7
AGIEval 0-shot 46.4 62.8 56.6 41.4 63.2 61.4
IFEval 零样本 55.5 57.3 79.7 72.1 64.1 63.8
代码 HumanEval 零样本 73.8 68.9 76.2 75.0 76.8 81.1
MBPP 三样本 61.4 52.2 69.8 64.4 70.4 72.0
CRUXEval-I-COT 两样本 49.1 51.4 61.1 59.4 59.5 61.5
CRUXEval-O-COT 两样本 50.9 56.5 63.6 63.6 60.7 63.0
LiveCodeBench 0-shot 18.3 18.8 30.5 25.0 28.7 32.5
数学 GSM8K 8-shot 84.1 81.9 93.2 87.9 90.8 92.2
MATH 4-shot 32.6 40.6 48.5 49.8 52.7 53.9
CMath 0-shot 80.3 82.8 79.2 75.1 82.0 81.9
CLUEWSC 5-shot 78.5 90.1 85.4 75.8 88.6 89.9
C-Eval 5-shot 65.2 82.2 67.9 60.0 80.9 78.0
CMMLU 5-shot 67.8 82.9 70.7 61.0 82.4 81.6

开放式生成评估。我们继续对模型在开放式对话基准上的表现进行额外评估。对于英文开放式对话生成,我们使用MT-Bench和AlpacaEval 2.0作为基准。表4中的评估结果显示,DeepSeek-V2 Chat (RL)相比DeepSeek-V2 Chat (SFT)具有显著的性能优势。这一结果展示了我们的RL训练在实现更好对齐方面的有效性。与其他开源模型相比,DeepSeek-V2 Chat (RL)在两个基准上都表现出优于Mistral 8x22B Instruct和Qwen1.5 72B Chat的性能。与LLaMA3 70B Instruct相比,DeepSeek-V2 Chat (RL)在MT-Bench上表现出竞争力,并在AlpacaEval 2.0上显著超越。这些结果凸显了DeepSeek-V2 Chat (RL)在生成高质量且上下文相关的响应方面的强大性能,特别是在基于指令的对话任务中。

Table 4语义 HTML 转录
英文开放式对话评估。对于AlpacaEval 2.0,我们使用长度控制的胜率作为指标。
模型 MT-Bench AlpacaEval 2.0
DeepSeek 67B Chat 8.35 16.6
Mistral 8x22B Instruct v0.1 8.66 30.9
Qwen1.5 72B Chat 8.61 36.6
LLaMA3 70B Instruct 8.95 34.4
DeepSeek-V2 Chat (SFT) 8.62 30.0
DeepSeek-V2 Chat (RL) 8.97 38.9
Table 5语义 HTML 转录
由 GPT-4-0613 评分的 AlignBench 排行榜。模型按总分降序排列。带 * 的模型表示结果由作者通过 API 服务或开放权重模型自行评测,而非引用原论文报告值。ErnieBot-4.0 与 Moonshot 名称后的后缀表示调用其 API 的时间戳。
模型总分中文推理中文语言
总分数学逻辑总分基础中文开放问答写作角色扮演专业
推理总分数学计算逻辑推理语言总分基本任务中文理解综合问答文本写作角色扮演专业能力
GPT-4-1106-Preview8.017.737.807.668.297.997.338.618.678.478.65
DeepSeek-V2 Chat (RL)7.917.457.777.148.368.108.288.378.538.338.53
ERNIEBot-4.0-202404*(文心一言)7.897.617.817.418.177.568.538.138.458.248.09
DeepSeek-V2 Chat (SFT)7.747.307.347.268.178.048.268.138.008.108.49
GPT-4-06137.537.477.567.377.597.816.937.427.937.517.94
ERNIEBot-4.0-202312*(文心一言)7.366.847.006.677.887.477.888.058.197.847.85
Moonshot-v1-32k-202404*(月之暗面)7.226.426.416.438.027.827.588.008.228.198.29
Qwen1.5-72B-Chat*7.196.456.586.317.937.387.778.158.028.058.24
DeepSeek-67B-Chat6.435.755.715.797.117.126.527.587.206.917.37
ChatGLM-Turbo(智谱清言)6.245.004.745.267.496.827.178.167.777.767.24
ERNIEBot-3.5(文心一言)6.145.155.035.277.136.627.607.267.566.836.90
Yi-34B-Chat*6.124.864.974.747.386.727.287.767.447.587.53
GPT-3.5-Turbo-06136.085.355.685.026.826.715.817.297.037.286.77
ChatGLM-Pro(智谱清言)5.834.654.544.757.016.516.767.477.077.346.89
SparkDesk-V2(讯飞星火)5.744.734.714.746.765.846.977.297.186.926.34
Qwen-14B-Chat5.724.814.914.716.636.906.366.746.646.596.56
Baichuan2-13B-Chat5.253.923.764.076.596.226.057.116.976.756.43
ChatGLM3-6B4.973.853.554.146.105.755.296.716.836.285.73
Baichuan2-7B-Chat4.973.663.563.756.285.815.507.136.846.535.84
InternLM-20B4.963.663.393.926.265.965.507.186.196.496.22
Qwen-7B-Chat4.913.733.623.836.096.405.746.266.316.195.66
ChatGLM2-6B4.483.393.163.615.584.914.526.666.256.085.08
InternLM-Chat-7B3.652.562.452.664.754.344.095.824.895.324.06
Chinese-LLaMA-2-7B-Chat3.572.682.293.074.464.314.264.504.634.914.13
LLaMA-2-13B-Chinese-Chat3.352.472.212.734.234.133.314.793.934.534.71

此外,我们基于AlignBench评估了中文开放式生成能力。如表5, DeepSeek-V2 Chat (RL) 在性能上略优于 DeepSeek-V2 Chat (SFT)。值得注意的是,DeepSeek-V2 Chat (SFT) 以显著优势超越了所有开源中文模型。在中文推理和语言方面,它明显优于排名第二的开源模型 Qwen1.5 72B Chat。此外,DeepSeek-V2 Chat (SFT) 和 DeepSeek-V2 Chat (RL) 都优于 GPT-4-0613 和 ERNIEBot 4.0,巩固了我们的模型在支持中文的顶级大语言模型中的地位。具体来说,DeepSeek-V2 Chat (RL) 在中文语言理解方面表现出色,超越了包括 GPT-4-Turbo-1106-Preview 在内的所有模型。另一方面,DeepSeek-V2 Chat (RL) 的推理能力仍落后于巨型模型,如 Erniebot-4.0 和 GPT-4s。

讨论

SFT 数据量。

关于大型 SFT 语料库必要性的讨论一直是激烈争论的话题。先前的工作(Young 等人, 2024; Zhou 等人, 2024)认为少于 10K 条 SFT 数据就足以产生令人满意的结果。然而,在我们的实验中,我们观察到如果使用少于 10K 条实例,IFEval 基准上的性能会显著下降。一个可能的解释是,语言模型需要一定量的数据来发展特定技能。虽然所需的数据量可能随着模型规模的增大而减少,但不能完全消除。我们的观察强调了为 LLM 配备所需能力而提供充足数据的迫切需求。此外,SFT 数据的质量也至关重要,特别是对于涉及写作或开放式问题的任务。

强化学习的对齐税。

在人类偏好对齐过程中,我们观察到在开放式生成基准上,AI 和人类评估者评分的性能都有显著提升。然而,我们也注意到一种“对齐税”现象(Ouyang 等人, 2022),即对齐过程可能会对某些标准基准(如BBH)的性能产生负面影响。为了减轻对齐代价,在强化学习阶段,我们在数据处理和改进训练策略方面付出了巨大努力,最终在标准基准和开放式基准的性能之间实现了可接受的权衡。探索如何在不损害模型通用性能的情况下使模型与人类偏好对齐,为未来的研究提供了一个有价值的方向。

在线强化学习。

在我们的偏好对齐实验中,我们发现在线方法明显优于离线方法。因此,我们投入了大量精力来实现用于对齐DeepSeek-V2的在线强化学习框架。关于在线或离线偏好对齐的结论在不同情境下可能有所不同,我们将它们之间更全面的比较和分析留待未来工作。

结论、局限性与未来工作

在本文中,我们介绍了DeepSeek-V2,一个支持128K上下文长度的大型MoE语言模型。除了强大的性能外,它还以经济的训练和高效的推理为特点,这得益于其创新架构,包括MLA和DeepSeekMoE。在实践中,与DeepSeek 67B相比,DeepSeek-V2实现了显著更强的性能,同时节省了42.5%的训练成本,减少了93.3%的KV缓存,并将最大生成吞吐量提升至5.76倍。评估结果进一步表明,仅使用21B激活参数,DeepSeek-V2就在开源模型中实现了顶级性能,并成为最强的开源MoE模型。

DeepSeek-V2及其聊天版本共享其他LLM中常见的公认局限性,包括预训练后缺乏持续的知识更新、可能生成非事实信息(如未经核实的建议)以及产生幻觉的可能性。此外,由于我们的数据主要由中文和英文内容组成,我们的模型在其他语言上的熟练程度可能有限。在中文和英文以外的场景中,应谨慎使用。

DeepSeek将长期主义地持续投资于开源大模型,旨在逐步接近通用人工智能的目标。

  • 在我们持续的探索中,我们致力于设计方法,使MoE模型能够进一步扩展,同时保持经济的训练和推理成本。我们下一步的目标是在即将发布的版本中实现与GPT-4相当的性能。

  • 我们的对齐团队不断努力提升我们的模型,旨在开发一个不仅有用,而且对全球用户诚实且安全的模型。我们的最终目标是使模型的价值与人类价值观对齐,同时尽量减少对人类监督的需求。通过优先考虑伦理考量和负责任的开发,我们致力于为社会创造积极有益的影响。

  • 目前,DeepSeek-V2 设计为仅支持文本模态。在我们前瞻性的议程中,我们打算让我们的模型支持多种模态,增强其在更广泛场景中的多功能性和实用性。

参考文献

参考文献按原论文顺序与书目信息保留。

  1. AI@Meta. Llama 3 model card, 2024. URL https://github.com/meta-llama/llama3/blob/main/MODEL_CARD.md.
  2. J. Ainslie, J. Lee-Thorp, M. de Jong, Y. Zemlyanskiy, F. Lebrón, and S. Sanghai. Gqa: Training generalized multi-query transformer models from multi-head checkpoints. arXiv preprint arXiv:2305.13245, 2023.
  3. Anthropic. Introducing Claude, 2023. URL https://www.anthropic.com/index/introducing-claude.
  4. J. Austin, A. Odena, M. Nye, M. Bosma, H. Michalewski, D. Dohan, E. Jiang, C. Cai, M. Terry, Q. Le, et al. Program synthesis with large language models. arXiv preprint arXiv:2108.07732, 2021.
  5. J. Bai, S. Bai, Y. Chu, Z. Cui, K. Dang, X. Deng, Y. Fan, W. Ge, Y. Han, F. Huang, B. Hui, L. Ji, M. Li, J. Lin, R. Lin, D. Liu, G. Liu, C. Lu, K. Lu, J. Ma, R. Men, X. Ren, X. Ren, C. Tan, S. Tan, J. Tu, P. Wang, S. Wang, W. Wang, S. Wu, B. Xu, J. Xu, A. Yang, H. Yang, J. Yang, S. Yang, Y. Yao, B. Yu, H. Yuan, Z. Yuan, J. Zhang, X. Zhang, Y. Zhang, Z. Zhang, C. Zhou, J. Zhou, X. Zhou, and T. Zhu. Qwen technical report. arXiv preprint arXiv:2309.16609, 2023.
  6. Y. Bisk, R. Zellers, R. L. Bras, J. Gao, and Y. Choi. reasoning about physical commonsense in natural language. In The Thirty-Fourth AAAI Conference on Artificial Intelligence, AAAI 2020, The Thirty-Second Innovative Applications of Artificial Intelligence Conference, IAAI 2020, The Tenth AAAI Symposium on Educational Advances in Artificial Intelligence, EAAI 2020, New York, NY, USA, February 7-12, 2020, pages 7432–7439. AAAI Press, 2020. doi: 10.1609/aaai.v34i05.6239. URL https://doi.org/10.1609/aaai.v34i05.6239.
  7. M. Chen, J. Tworek, H. Jun, Q. Yuan, H. P. de Oliveira Pinto, J. Kaplan, H. Edwards, Y. Burda, N. Joseph, G. Brockman, A. Ray, R. Puri, G. Krueger, M. Petrov, H. Khlaaf, G. Sastry, P. Mishkin, B. Chan, S. Gray, N. Ryder, M. Pavlov, A. Power, L. Kaiser, M. Bavarian, C. Winter, P. Tillet, F. P. Such, D. Cummings, M. Plappert, F. Chantzis, E. Barnes, A. Herbert-Voss, W. H. Guss, A. Nichol, A. Paino, N. Tezak, J. Tang, I. Babuschkin, S. Balaji, S. Jain, W. Saunders, C. Hesse, A. N. Carr, J. Leike, J. Achiam, V. Misra, E. Morikawa, A. Radford, M. Knight, M. Brundage, M. Murati, K. Mayer, P. Welinder, B. McGrew, D. Amodei, S. McCandlish, I. Sutskever, and W. Zaremba. Evaluating large language models trained on code. CoRR, abs/2107.03374, 2021. URL https://arxiv.org/abs/2107.03374.
  8. P. Clark, I. Cowhey, O. Etzioni, T. Khot, A. Sabharwal, C. Schoenick, and O. Tafjord. Think you have solved question answering? try arc, the AI2 reasoning challenge. CoRR, abs/1803.05457, 2018. URL http://arxiv.org/abs/1803.05457.
  9. K. Cobbe, V. Kosaraju, M. Bavarian, M. Chen, H. Jun, L. Kaiser, M. Plappert, J. Tworek, J. Hilton, R. Nakano, et al. Training verifiers to solve math word problems. arXiv preprint arXiv:2110.14168, 2021.
  10. Y. Cui, T. Liu, W. Che, L. Xiao, Z. Chen, W. Ma, S. Wang, and G. Hu. A span-extraction dataset for Chinese machine reading comprehension. In K. Inui, J. Jiang, V. Ng, and X. Wan, editors, Proceedings of the 2019 Conference on Empirical Methods in Natural Language Processing and the 9th International Joint Conference on Natural Language Processing (EMNLP-IJCNLP), pages 5883–5889, Hong Kong, China, Nov. 2019. Association for Computational Linguistics. doi: 10.18653/v1/D19-1600. URL https://aclanthology.org/D19-1600.
  11. D. Dai, C. Deng, C. Zhao, R. X. Xu, H. Gao, D. Chen, J. Li, W. Zeng, X. Yu, Y. Wu, Z. Xie, Y. K. Li, P. Huang, F. Luo, C. Ruan, Z. Sui, and W. Liang. Deepseekmoe: Towards ultimate expert specialization in mixture-of-experts language models. CoRR, abs/2401.06066, 2024. URL https://doi.org/10.48550/arXiv.2401.06066.
  12. T. Dao. FlashAttention-2: Faster attention with better parallelism and work partitioning, 2023.
  13. DeepSeek-AI. Deepseek LLM: scaling open-source language models with longtermism. CoRR, abs/2401.02954, 2024. URL https://doi.org/10.48550/arXiv.2401.02954.
  14. D. Dua, Y. Wang, P. Dasigi, G. Stanovsky, S. Singh, and M. Gardner. A reading comprehension benchmark requiring discrete reasoning over paragraphs. In J. Burstein, C. Doran, and T. Solorio, editors, Proceedings of the 2019 Conference of the North American Chapter of the Association for Computational Linguistics: Human Language Technologies, NAACL-HLT 2019, Minneapolis, MN, USA, June 2-7, 2019, Volume 1 (Long and Short Papers), pages 2368–2378. Association for Computational Linguistics, 2019. doi: 10.18653/V1/N19-1246. URL https://doi.org/10.18653/v1/n19-1246.
  15. Y. Dubois, B. Galambosi, P. Liang, and T. B. Hashimoto. Length-controlled alpacaeval: A simple way to debias automatic evaluators. arXiv preprint arXiv:2404.04475, 2024.
  16. W. Fedus, B. Zoph, and N. Shazeer. Switch transformers: Scaling to trillion parameter models with simple and efficient sparsity. CoRR, abs/2101.03961, 2021. URL https://arxiv.org/abs/2101.03961.
  17. L. Gao, S. Biderman, S. Black, L. Golding, T. Hoppe, C. Foster, J. Phang, H. He, A. Thite, N. Nabeshima, et al. The Pile: An 800GB dataset of diverse text for language modeling. arXiv preprint arXiv:2101.00027, 2020.
  18. Google. Introducing gemini: our largest and most capable ai model, 2023. URL https://blog.google/technology/ai/google-gemini-ai/.
  19. A. Gu, B. Rozière, H. Leather, A. Solar-Lezama, G. Synnaeve, and S. I. Wang. Cruxeval: A benchmark for code reasoning, understanding and execution, 2024.
  20. D. Hendrycks, C. Burns, S. Basart, A. Zou, M. Mazeika, D. Song, and J. Steinhardt. Measuring massive multitask language understanding. arXiv preprint arXiv:2009.03300, 2020.
  21. D. Hendrycks, C. Burns, S. Kadavath, A. Arora, S. Basart, E. Tang, D. Song, and J. Steinhardt. Measuring mathematical problem solving with the math dataset. arXiv preprint arXiv:2103.03874, 2021.
  22. High-flyer. Hai-llm: 高效且轻量的大模型训练工具, 2023. URL https://www.high-flyer.cn/en/blog/hai-llm.
  23. C. Hooper, S. Kim, H. Mohammadzadeh, M. W. Mahoney, Y. S. Shao, K. Keutzer, and A. Gholami. Kvquant: Towards 10 million context length LLM inference with KV cache quantization. CoRR, abs/2401.18079, 2024. URL https://doi.org/10.48550/arXiv.2401.18079.
  24. S. Hu, Y. Tu, X. Han, C. He, G. Cui, X. Long, Z. Zheng, Y. Fang, Y. Huang, W. Zhao, et al. Minicpm: Unveiling the potential of small language models with scalable training strategies. arXiv preprint arXiv:2404.06395, 2024.
  25. Y. Huang, Y. Bai, Z. Zhu, J. Zhang, J. Zhang, T. Su, J. Liu, C. Lv, Y. Zhang, J. Lei, et al. : A multi-level multi-discipline chinese evaluation suite for foundation models. arXiv preprint arXiv:2305.08322, 2023.
  26. N. Jain, K. Han, A. Gu, W.-D. Li, F. Yan, T. Zhang, S. Wang, A. Solar-Lezama, K. Sen, and I. Stoica. Livecodebench: Holistic and contamination free evaluation of large language models for code. arXiv preprint arXiv:2403.07974, 2024.
  27. M. Joshi, E. Choi, D. Weld, and L. Zettlemoyer. riviaQA: A large scale distantly supervised challenge dataset for reading comprehension. In R. Barzilay and M.-Y. Kan, editors, Proceedings of the 55th Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers), pages 1601–1611, Vancouver, Canada, July 2017. Association for Computational Linguistics. doi: 10.18653/v1/P17-1147. URL https://aclanthology.org/P17-1147.
  28. T. Kwiatkowski, J. Palomaki, O. Redfield, M. Collins, A. P. Parikh, C. Alberti, D. Epstein, I. Polosukhin, J. Devlin, K. Lee, K. Toutanova, L. Jones, M. Kelcey, M. Chang, A. M. Dai, J. Uszkoreit, Q. Le, and S. Petrov. Natural questions: a benchmark for question answering research. Trans. Assoc. Comput. Linguistics, 7: 452–466, 2019. doi: 10.1162/tacl_a_00276. URL https://doi.org/10.1162/tacl_a_00276.
  29. W. Kwon, Z. Li, S. Zhuang, Y. Sheng, L. Zheng, C. H. Yu, J. E. Gonzalez, H. Zhang, and I. Stoica. Efficient memory management for large language model serving with pagedattention. In Proceedings of the ACM SIGOPS 29th Symposium on Operating Systems Principles, 2023.
  30. G. Lai, Q. Xie, H. Liu, Y. Yang, and E. H. Hovy. large-scale reading comprehension dataset from examinations. In M. Palmer, R. Hwa, and S. Riedel, editors, Proceedings of the 2017 Conference on Empirical Methods in Natural Language Processing, EMNLP 2017, Copenhagen, Denmark, September 9-11, 2017, pages 785–794. Association for Computational Linguistics, 2017. doi: 10.18653/V1/D17-1082. URL https://doi.org/10.18653/v1/d17-1082.
  31. D. Lepikhin, H. Lee, Y. Xu, D. Chen, O. Firat, Y. Huang, M. Krikun, N. Shazeer, and Z. Chen. Gshard: Scaling giant models with conditional computation and automatic sharding. In 9th International Conference on Learning Representations, ICLR 2021. OpenReview.net, 2021. URL https://openreview.net/forum?id=qrwe7XHTmYb.
  32. H. Li, Y. Zhang, F. Koto, Y. Yang, H. Zhao, Y. Gong, N. Duan, and T. Baldwin. : Measuring massive multitask language understanding in Chinese. arXiv preprint arXiv:2306.09212, 2023.
  33. W. Li, F. Qi, M. Sun, X. Yi, and J. Zhang. Ccpm: A chinese classical poetry matching dataset, 2021.
  34. X. Liu, X. Lei, S. Wang, Y. Huang, Z. Feng, B. Wen, J. Cheng, P. Ke, Y. Xu, W. L. Tam, X. Zhang, L. Sun, H. Wang, J. Zhang, M. Huang, Y. Dong, and J. Tang. Alignbench: Benchmarking chinese alignment of large language models. CoRR, abs/2311.18743, 2023. doi: 10.48550/ARXIV.2311.18743. URL https://doi.org/10.48550/arXiv.2311.18743.
  35. I. Loshchilov and F. Hutter. Decoupled weight decay regularization. arXiv preprint arXiv:1711.05101, 2017.
  36. Mistral. Cheaper, better, faster, stronger: Continuing to push the frontier of ai and making it accessible to all, 2024. URL https://mistral.ai/news/mixtral-8x22b.
  37. OpenAI. Introducing ChatGPT, 2022. URL https://openai.com/blog/chatgpt.
  38. OpenAI. technical report. arXiv preprint arXiv:2303.08774, 2023.
  39. L. Ouyang, J. Wu, X. Jiang, D. Almeida, C. Wainwright, P. Mishkin, C. Zhang, S. Agarwal, K. Slama, A. Ray, et al. Training language models to follow instructions with human feedback. Advances in neural information processing systems, 35: 27730–27744, 2022.
  40. B. Peng, J. Quesnelle, H. Fan, and E. Shippole. Yarn: Efficient context window extension of large language models. arXiv preprint arXiv:2309.00071, 2023.
  41. P. Qi, X. Wan, G. Huang, and M. Lin. Zero bubble pipeline parallelism. arXiv preprint arXiv:2401.10241, 2023.
  42. S. Rajbhandari, J. Rasley, O. Ruwase, and Y. He. Zero: Memory optimizations toward training trillion parameter models. In SC20: International Conference for High Performance Computing, Networking, Storage and Analysis, pages 1–16. IEEE, 2020.
  43. C. Riquelme, J. Puigcerver, B. Mustafa, M. Neumann, R. Jenatton, A. S. Pinto, D. Keysers, and N. Houlsby. Scaling vision with sparse mixture of experts. In Advances in Neural Information Processing Systems 34: Annual Conference on Neural Information Processing Systems 2021, NeurIPS 2021, pages 8583–8595, 2021. URL https://proceedings.neurips.cc/paper/2021/hash/48237d9f2dea8c74c2a72126cf63d933-Abstract.html.
  44. K. Sakaguchi, R. L. Bras, C. Bhagavatula, and Y. Choi. Winogrande: An adversarial winograd schema challenge at scale, 2019.
  45. Z. Shao, P. Wang, Q. Zhu, R. Xu, J. Song, M. Zhang, Y. Li, Y. Wu, and D. Guo. Deepseekmath: Pushing the limits of mathematical reasoning in open language models. arXiv preprint arXiv:2402.03300, 2024.
  46. N. Shazeer. Fast transformer decoding: One write-head is all you need. CoRR, abs/1911.02150, 2019. URL http://arxiv.org/abs/1911.02150.
  47. N. Shazeer, A. Mirhoseini, K. Maziarz, A. Davis, Q. V. Le, G. E. Hinton, and J. Dean. Outrageously large neural networks: The sparsely-gated mixture-of-experts layer. In 5th International Conference on Learning Representations, ICLR 2017. OpenReview.net, 2017. URL https://openreview.net/forum?id=B1ckMDqlg.
  48. J. Su, M. Ahmed, Y. Lu, S. Pan, W. Bo, and Y. Liu. Roformer: Enhanced transformer with rotary position embedding. Neurocomputing, 568: 127063, 2024.
  49. K. Sun, D. Yu, D. Yu, and C. Cardie. Investigating prior knowledge for challenging chinese machine reading comprehension, 2019.
  50. M. Suzgun, N. Scales, N. Schärli, S. Gehrmann, Y. Tay, H. W. Chung, A. Chowdhery, Q. V. Le, E. H. Chi, D. Zhou, et al. Challenging big-bench tasks and whether chain-of-thought can solve them. arXiv preprint arXiv:2210.09261, 2022.
  51. A. Vaswani, N. Shazeer, N. Parmar, J. Uszkoreit, L. Jones, A. N. Gomez, Ł. Kaiser, and I. Polosukhin. Attention is all you need. Advances in neural information processing systems, 30, 2017.
  52. J. Wei, Y. Tay, R. Bommasani, C. Raffel, B. Zoph, S. Borgeaud, D. Yogatama, M. Bosma, D. Zhou, D. Metzler, et al. Emergent abilities of large language models. arXiv preprint arXiv:2206.07682, 2022.
  53. T. Wei, J. Luan, W. Liu, S. Dong, and B. Wang. Cmath: Can your language model pass chinese elementary school math test?, 2023.
  54. L. Xu, H. Hu, X. Zhang, L. Li, C. Cao, Y. Li, Y. Xu, K. Sun, D. Yu, C. Yu, Y. Tian, Q. Dong, W. Liu, B. Shi, Y. Cui, J. Li, J. Zeng, R. Wang, W. Xie, Y. Li, Y. Patterson, Z. Tian, Y. Zhang, H. Zhou, S. Liu, Z. Zhao, Q. Zhao, C. Yue, X. Zhang, Z. Yang, K. Richardson, and Z. Lan. A chinese language understanding evaluation benchmark. In D. Scott, N. Bel, and C. Zong, editors, Proceedings of the 28th International Conference on Computational Linguistics, COLING 2020, Barcelona, Spain (Online), December 8-13, 2020, pages 4762–4772. International Committee on Computational Linguistics, 2020. doi: 10.18653/V1/2020.COLING-MAIN.419. URL https://doi.org/10.18653/v1/2020.coling-main.419.
  55. A. Young, B. Chen, C. Li, C. Huang, G. Zhang, G. Zhang, H. Li, J. Zhu, J. Chen, J. Chang, et al. Yi: Open foundation models by 01. ai. arXiv preprint arXiv:2403.04652, 2024.
  56. R. Zellers, A. Holtzman, Y. Bisk, A. Farhadi, and Y. Choi. : Can a machine really finish your sentence? In A. Korhonen, D. R. Traum, and L. Màrquez, editors, Proceedings of the 57th Conference of the Association for Computational Linguistics, ACL 2019, Florence, Italy, July 28- August 2, 2019, Volume 1: Long Papers, pages 4791–4800. Association for Computational Linguistics, 2019. doi: 10.18653/v1/p19-1472. URL https://doi.org/10.18653/v1/p19-1472.
  57. Y. Zhao, C. Lin, K. Zhu, Z. Ye, L. Chen, S. Zheng, L. Ceze, A. Krishnamurthy, T. Chen, and B. Kasikci. Atom: Low-bit quantization for efficient and accurate LLM serving. CoRR, abs/2310.19102, 2023. URL https://doi.org/10.48550/arXiv.2310.19102.
  58. C. Zheng, M. Huang, and A. Sun. Chid: A large-scale chinese idiom dataset for cloze test. In A. Korhonen, D. R. Traum, and L. Màrquez, editors, Proceedings of the 57th Conference of the Association for Computational Linguistics, ACL 2019, Florence, Italy, July 28- August 2, 2019, Volume 1: Long Papers, pages 778–787. Association for Computational Linguistics, 2019. doi: 10.18653/V1/P19-1075. URL https://doi.org/10.18653/v1/p19-1075.
  59. L. Zheng, W.-L. Chiang, Y. Sheng, S. Zhuang, Z. Wu, Y. Zhuang, Z. Lin, Z. Li, D. Li, E. P. Xing, H. Zhang, J. E. Gonzalez, and I. Stoica. Judging llm-as-a-judge with mt-bench and chatbot arena, 2023.
  60. W. Zhong, R. Cui, Y. Guo, Y. Liang, S. Lu, Y. Wang, A. Saied, W. Chen, and N. Duan. : A human-centric benchmark for evaluating foundation models. CoRR, abs/2304.06364, 2023. doi: 10.48550/arXiv.2304.06364. URL https://doi.org/10.48550/arXiv.2304.06364.
  61. C. Zhou, P. Liu, P. Xu, S. Iyer, J. Sun, Y. Mao, X. Ma, A. Efrat, P. Yu, L. Yu, et al. Lima: Less is more for alignment. Advances in Neural Information Processing Systems, 36, 2024.
  62. J. Zhou, T. Lu, S. Mishra, S. Brahma, S. Basu, Y. Luan, D. Zhou, and L. Hou. Instruction-following evaluation for large language models. arXiv preprint arXiv:2311.07911, 2023.

附录

贡献与致谢

2 研究与工程
刘爱欣
王炳轩
刘波
赵成刚
邓承启
阮冲
戴美黛
郭大雅
杨德健
陈德利
李尔航
林方云
罗富丽
郝广博
陈冠廷
李国伟
H. Zhang
Hanwei Xu
Hao Yang
Haowei Zhang
Honghui Ding
Huajian Xin
Huazuo Gao
Hui Qu
Jianzhong Guo
Jiashi Li
袁景阳
邱俊杰
宋俊晓
董凯
高凯歌
关康
王乐安
张乐聪
赵亮
张丽月
张明川
张明华
唐明辉
黄盼盼
王培懿
朱启豪
陈沁雨
杜秋实
葛瑞琪
潘瑞哲
徐润欣
陆尚豪
周尚彦
陈善煌
叶圣峰
马世荣
王诗雨
余水平
周顺峰
郑思泽
田培
曾旺丁
刘文
梁文峰
高文军
张伟涛
毕晓
王晓涵
刘晓东
陈晓康
聂晓涛
刘鑫
谢鑫
于兴凯
杨新宇
陆璇
苏学成
吴Y.
李Y.K.
魏Y.X.
徐艳红
李瑶
赵瑶
孙耀峰
王耀辉
张一超
熊一良
赵一龙
何颖
朴一石
董一欣
谭一轩
刘一远
王永吉
郭永强
王玉端
邹宇恒
游宇翔
刘宇轩
任中洲
任泽辉
沙张丽
付哲
谢振达
郝哲文
邵志宏
李卓书
王梓涵
顾子慧
李紫琳
谢子威
数据标注
冯贝
李辉
蔡杰龙
倪嘉琪
徐磊
李萌
田宁
陈瑞杰
金如林
陈如意
李思思
周爽
袁天
孙天宇
李新奇
金祥月
沈晓金
陈小莎
孙晓文
王晓翔
宋新楠
周欣怡
朱永祥
徐艳红
黄艳萍
李耀辉
郑毅
朱宇辰
马云贤
黄震
徐志鹏
张中宇
业务与合规
王斌
纪东杰
梁健
陈进
夏乐怡
王苗军
李明明
张鹏
吴少卿
叶盛峰
王涛
肖文龙
安伟
王先组
唐颖
Yukun Zha
Yuting Yan
Zhen Zhang
Zhiniu Wen

在每个角色内,作者按名字的字母顺序排列。 特别是,Huazuo Gao和Wangding Zeng在MLA架构的研究中做出了关键创新。此外,我们感谢Jianlin Su在位置嵌入方面的有益讨论。我们感谢所有为DeepSeek-V2做出贡献但未在论文中提及的人。DeepSeek相信,创新、新颖和好奇心在通往AGI的道路上至关重要。

DeepSeek-V2-Lite:一个配备MLA和DeepSeekMoE的16B模型

模型描述

架构。

DeepSeek-V2-Lite有27层,隐藏维度为2048。它也采用MLA,有16个注意力头,每个头的维度为128。其KV压缩维度为512,但与DeepSeek-V2略有不同,它不压缩查询。对于解耦的查询和键,每个头的维度为64。DeepSeek-V2-Lite也采用DeepSeekMoE,除第一层外的所有FFN都被替换为MoE层。每个MoE层由2个共享专家和64个路由专家组成,每个专家的中间隐藏维度为1408。在路由专家中,每个token将激活6个专家。在此配置下,DeepSeek-V2-Lite总参数为15.7B,其中每个token激活2.4B。

Table 6语义 HTML 转录
DeepSeek-V2-Lite、DeepSeekMoE 16B和DeepSeek 7B的性能。
基准测试 DeepSeek 7B DeepSeekMoE 16B DeepSeek-V2-Lite
架构 MHA+Dense MHA+MoE MLA+MoE
上下文长度 4K 4K 32K
# 激活参数 6.9B 2.8B 2.4B
# 总参数 6.9B 16.4B 15.7B
# 训练令牌 2T 2T 5.7T
英语 MMLU 48.2 45.0 58.3
BBH 39.5 38.9 44.1
TriviaQA 59.7 64.8 64.2
NaturalQuestions 22.2 25.5 26.0
ARC-Easy 67.9 68.1 70.9
ARC-Challenge 48.1 49.8 51.2
AGIEval 26.4 17.4 33.2
HumanEval 26.2 26.8 29.9
MBPP 39.0 39.2 43.2
Math GSM8K 17.4 18.8 41.1
MATH 3.3 4.3 17.1
CMath 34.5 40.4 58.4
CLUEWSC 73.1 72.1 74.3
C-Eval 45.0 40.6 60.3
CMMLU 47.2 42.5 64.3

训练细节。

DeepSeek-V2-Lite也是从零开始,在DeepSeek-V2的相同预训练语料库上进行训练的,该语料库未被任何SFT数据污染。它使用AdamW优化器,超参数设置为β1=0.9\beta_1=0.9, β2=0.95\beta_2=0.95,以及weight_decay=0.1\mathrm{weight\_decay}=0.1。学习率采用预热和步进衰减策略进行调度。最初,学习率在前2K步内从0线性增加到最大值。随后,在训练约80%的token后,学习率乘以0.316,在训练约90%的token后,再次乘以0.316。最大学习率设置为4.2×1044.2 \times 10^{-4},梯度裁剪范数设置为1.0。我们不对其采用批大小调度策略,而是以恒定的批大小4608个序列进行训练。在预训练期间,我们将最大序列长度设置为4K,并在5.7T个token上训练DeepSeek-V2-Lite。我们利用流水线并行将不同层部署到不同设备上,但对于每一层,所有专家都将部署在同一设备上。因此,我们仅采用一个小的专家级平衡损失,权重为α1=0.001\alpha_{1}=0.001,并且不对其采用设备级平衡损失和通信平衡损失。预训练后,我们还对DeepSeek-V2-Lite进行了长上下文扩展和SFT,并得到了一个名为DeepSeek-V2-Lite Chat的聊天模型。

Table 7语义 HTML 转录
DeepSeek-V2-Lite Chat、DeepSeekMoE 16B Chat和DeepSeek 7B Chat的性能。
基准 DeepSeek DeepSeekMoE DeepSeek-V2-Lite
7B 聊天 16B 聊天 聊天
架构 MHA+密集 MHA+MoE MLA+MoE
上下文长度 4K 4K 32K
# 激活参数 6.9B 2.8B 2.4B
# 总参数 6.9B 16.4B 15.7B
# 训练令牌数 2T 2T 5.7T
英语 MMLU 49.7 47.2 55.7
BBH 43.1 42.2 48.1
TriviaQA 59.5 63.3 65.2
NaturalQuestions 32.7 35.1 35.5
ARC-Easy 70.2 69.9 74.3
ARC-Challenge 50.2 50.0 51.5
AGIEval 17.6 19.7 42.8
HumanEval 45.1 45.7 57.3
MBPP 39.0 46.2 45.8
Math GSM8K 62.6 62.2 72.0
MATH 14.7 15.2 27.9
CMath 66.4 67.9 71.7
CLUEWSC 66.2 68.2 80.0
C-Eval 44.7 40.0 60.1
CMMLU 51.2 49.3 62.5

性能评估

基础模型。

我们在表6中评估了DeepSeek-V2-Lite的性能,并将其与我们之前的小型基础模型进行了比较。DeepSeek-V2-Lite展现出压倒性的性能优势,尤其是在推理、编码和数学方面。

聊天模型。

我们在表7中评估了DeepSeek-V2-Lite Chat的性能,并将其与我们之前的小型聊天模型进行了比较。DeepSeek-V2-Lite也大幅优于我们之前的小型聊天模型。

MLA的完整公式

为了展示MLA的完整计算过程,我们在下面提供其全部公式:其中蓝色框中的向量需要在生成时缓存。在推理过程中,朴素公式需要从 ctKV\mathbf{c}_{t}^{KV} 恢复 ktC\mathbf{k}_{t}^{C}vtC\mathbf{v}_{t}^{C} 以进行 attention。幸运的是,由于矩阵乘法的结合律,我们可以把 WUKW^{UK} 吸收到 WUQW^{UQ} 中,并把 WUVW^{UV} 吸收到 WOW^{O} 中。因此无须为每个 query 显式计算 key 与 value。这一优化避免了推理期间重复计算 ktC\mathbf{k}_{t}^{C}vtC\mathbf{v}_{t}^{C} 的开销。

公式(37)。

ctQ=WDQht\mathbf{c}_{t}^{Q} = W^{DQ} \mathbf{h}_{t}

公式(38)。

[qt,1C;qt,2C;...;qt,nhC]=qtC=WUQctQ[\mathbf{q}_{t, 1}^{C};\mathbf{q}_{t, 2}^{C};...;\mathbf{q}_{t, n_{h}}^{C}] = \mathbf{q}_{t}^{C} = W^{UQ} \mathbf{c}_{t}^{Q}

公式(39)。

[qt,1R;qt,2R;...;qt,nhR]=qtR=RoPE(WQRctQ)[\mathbf{q}_{t, 1}^{R};\mathbf{q}_{t, 2}^{R};...;\mathbf{q}_{t, n_{h}}^{R}] = \mathbf{q}_{t}^{R} = \operatorname{RoPE}({W^{QR}} \mathbf{c}_{t}^{Q})

公式(40)。

qt,i=[qt,iC;qt,iR]\mathbf{q}_{t, i} = [\mathbf{q}_{t, i}^{C}; \mathbf{q}_{t, i}^{R}]

公式(41)。

ctKV=WDKVht\boxed{\color{blue} \mathbf{c}_{t}^{KV}} = W^{DKV} \mathbf{h}_{t}

公式(42)。

[kt,1C;kt,2C;...;kt,nhC]=ktC=WUKctKV[\mathbf{k}_{t, 1}^{C};\mathbf{k}_{t, 2}^{C};...;\mathbf{k}_{t, n_{h}}^{C}] = \mathbf{k}_{t}^{C} = W^{UK} \mathbf{c}_{t}^{KV}

公式(43)。

ktR=RoPE(WKRht)\boxed{\color{blue}\mathbf{k}_{t}^{R}} = \operatorname{RoPE}({W^{KR}} \mathbf{h}_{t})

公式(44)。

kt,i=[kt,iC;ktR]\mathbf{k}_{t, i} = [\mathbf{k}_{t, i}^{C}; \mathbf{k}_{t}^{R}]

公式(45)。

[vt,1C;vt,2C;...;vt,nhC]=vtC=WUVctKV[\mathbf{v}_{t, 1}^{C};\mathbf{v}_{t, 2}^{C};...;\mathbf{v}_{t, n_{h}}^{C}] = \mathbf{v}_{t}^{C} = W^{UV} \mathbf{c}_{t}^{KV}

公式(46)。

ot,i=j=1tSoftmaxj(qt,iTkj,idh+dhR)vj,iC\mathbf{o}_{t, i} = \sum_{j=1}^{t} \operatorname{Softmax}_j(\frac{\mathbf{q}_{t, i}^T \mathbf{k}_{j, i}}{\sqrt{d_{h} + d_{h}^{R}}}) \mathbf{v}_{j, i}^{C}

公式(47)。

ut=WO[ot,1;ot,2;...;ot,nh]\mathbf{u}_{t} = W^{O} [\mathbf{o}_{t, 1};\mathbf{o}_{t, 2};...;\mathbf{o}_{t, n_{h}}]

注意力机制的消融研究

MHA、GQA和MQA的消融研究

我们在表8中展示了使用MHA、GQA和MQA的7B稠密模型在四个困难基准上的评估结果。这三个模型均在1.33T令牌上训练,除了注意力机制外共享相同的架构。此外,为了公平比较,我们通过调整层数将它们的参数数量对齐到约7B。从表中我们可以发现,MHA在这些基准上表现出比GQA和MQA显著的优势。

Table 8语义 HTML 转录
分别使用MHA、GQA和MQA的7B稠密模型之间的比较。MHA在困难基准上表现出比GQA和MQA显著的优势。
基准 (指标) # 样本数 稠密7B 稠密7B Dense 7B
w/ MQA w/ GQA (8组) w/ MHA
# 参数 - 7.1B 6.9B 6.9B
BBH (EM) 3-shot 33.2 35.6 37.0
MMLU(准确率) 5-shot 37.9 41.2 45.2
C-Eval(准确率) 5-shot 30.0 37.7 42.9
CMMLU(准确率) 5-shot 34.6 38.4 43.5

MLA与MHA的比较

在表9中,我们展示了配备MLA和MHA的MoE模型在四个困难基准上的评估结果。为了得出可靠的结论,我们在两种规模上训练和评估模型。两个小型MoE模型总参数约160亿,我们在1.33T个token上训练它们。两个大型MoE模型总参数约2500亿,我们在420B个token上训练它们。此外,两个小型MoE模型和两个大型MoE模型分别共享相同的架构,除了注意力机制不同。从表中我们可以观察到,MLA表现出比MHA更好的性能。更重要的是,MLA所需的KV缓存量显著小于MHA(小型MoE模型为14%,大型MoE模型为4%)。

Table 9语义 HTML 转录
在困难基准上MLA与MHA的比较。DeepSeek-V2表现出比MHA更好的性能,但所需的KV缓存量显著更小。
基准测试 (指标) # 样本数 小型MoE 小型MoE 大型MoE 大型MoE
带MHA 带MLA 带MHA 带MLA
# 激活参数 - 2.5B 2.4B 25.0B 21.5B
# 总参数 - 15.8B 15.7B 250.8B 247.4B
每个Token的KV缓存(元素数量) - 110.6K 15.6K 860.2K 34.6K
BBH(EM) 3-shot 37.9 39.0 46.6 50.7
MMLU(准确率) 5-shot 48.7 50.0 57.5 59.0
C-Eval(准确率) 5-shot 51.6 50.9 57.9 59.2
CMMLU(准确率) 5-shot 52.3 53.4 60.7 62.5

关于预训练数据去偏的讨论

在预训练数据准备过程中,我们识别并过滤掉有争议的内容,例如受地域文化影响的价值观,以避免我们的模型在这些有争议的话题上表现出不必要的主观偏见。因此,我们观察到DeepSeek-V2在与特定地域文化紧密相关的测试集上表现略差。例如,在MMLU评估中,尽管DeepSeek-V2在大多数测试集上与其竞争对手如Mixtral 8x22B相比表现相当或更优,但在主要与美国价值观相关的人文-道德子集上仍落后。

此外,我们对该子集进行了人工分析。三位受过良好教育的人工标注员对MMLU Humanity-Moral子集中的420个道德场景进行了独立标注。然后,我们计算了他们的标注与真实标签之间的一致性。如表10所示,三位人工标注员与真实标签之间的一致性较低。因此,我们将DeepSeek-V2在这些价值敏感测试集上的异常表现归因于我们在预训练语料库去偏方面的努力。

Table 10语义 HTML 转录
三位受过良好教育的人工标注员对MMLU Humanity-Moral子集中的420个道德场景进行了独立标注,DeepSeek-V2及其竞争模型在这些场景上表现出性能不一致。三位标注员与真实标签之间的一致性较低。这表明,根据特定区域文化,Humanity-Moral子集的答案可能存在争议。
一致性 真实标签 标注者1 标注者2 标注者3
真实标签 100.0%   66.7% 59.8% 42.1%
标注者1 66.7% 100.0%   57.9% 69.0%
标注者2 59.8% 57.9% 100.0%   65.5%
标注者3 42.1% 69.0% 65.5% 100.0%  

数学和代码的额外评估

评估使用SC-Math6语料库,该语料库包含数千道中文数学题。DeepSeek-V2 Chat (RL)在所有中文大语言模型中表现最佳,包括开源和闭源模型。

Table 11语义 HTML 转录
SC-Math6模型推理水平。“R Level”代表推理水平,“Comp. Score”代表综合得分,“Reas. Steps Score”代表推理步骤得分,“OvrAcc Score”代表总体准确率得分。
模型名称 R 级别 综合得分 推理步骤得分 总体准确率得分
GPT-4-1106-Preview 5 90.71 91.65 89.77
GPT-4 5 88.40 89.10 87.71
DeepSeek-V2 Chat (RL) 5 83.35 85.73 84.54
文心一言 4.0 5 85.60 86.82 84.38
Qwen-110B-Chat 5 83.25 84.93 84.09
GLM-4 5 84.24 85.72 82.77
星火3.5 5 83.73 85.37 82.09
Qwen-72B-Chat 4 78.42 80.07 79.25
ChatGLM-Turbo 4 57.70 60.32 55.09
GPT-3.5-Turbo 4 57.05 59.61 54.50
Qwen-14B-Chat 4 53.12 55.99 50.26
ChatGLM3-6B 3 40.90 44.20 37.60
星火3.0 3 40.08 45.27 34.89
Baichuan2-13B-Chat 3 39.40 42.63 36.18
文心3.5-turbo 2 25.19 27.70 22.67
Chinese-Alpaca2-13B 2 20.55 22.52 18.58

我们进一步在图5中分享了更多结果,涉及HumanEval 和LiveCodeBench,其中LiveCodeBench的问题选自 2023年9月1日至2024年4月1日期间。如 图所示,DeepSeek-V2 Chat (RL)在LiveCodeBench上表现出相当高的熟练度,其Pass@1分数甚至 超过了一些巨型模型。这一表现凸显了DeepSeek-V2 Chat (RL)在处理实时编码任务方面的强大能力。

Figure 5原论文图面与译注
在HumanEval和LiveCodeBench上的评估结果。LiveCodeBench的问题选自 2023年9月1日至2024年4月1日期间。

评估格式

我们在表12-37中分别展示了每个基准的评估格式。

Table 12语义 HTML 转录
AGIEval的一个示例。
提示
以下是一道中国高考生物选择题,请选择正确的答案。
问题:下列有关高尔基体、线粒体和叶绿体的叙述, 正确的是 选项:(A)三者都存在于蓝藻中 (B)三者都含有 DNA (C)三者都是 ATP 合成的场所 (D)三者的膜结构中都含有蛋白质
答案:从A到D,我们应选择
Table 13语义 HTML 转录
ARC的一个例子。
提示
问题:圆柱形容器中的样品具有圆柱形状和固定体积。该样品的物质状态_
A. 必须是固体
B. 可能是固体或液体
C. 必须是液体
D. 可能是液体或气体
答案:B
问题:声音的速度通常在_中最大
A. 固体中最高,液体中最低
B. 固体中最高,气体中最低
C. 气体中最高,液体中最低
D. 气体中最高,固体中最低
答案:B
问题:当油和水混合在一起时,它们形成_
A. 气体
B. 固体
C. 化合物
D. 悬浮液
答案:D
问题:一个装有液态水的容器在白天被放在室外,当时温度为3°C。夜间室外温度降至-2°C。这种温度变化最可能导致水_
A. 凝结
B. 蒸发
C. 保持液态
D. 变成固体
答案:
Table 14语义 HTML 转录
BBH的一个示例。
提示
评估一个随机布尔表达式的结果。
问:not ( ( not not True ) ) 是
答:让我们一步一步思考。
记住(i)括号内的表达式总是首先计算,(ii)运算顺序从最高优先级到最低优先级是“not”、“and”、“or”。我们首先简化这个表达式“Z”如下:“Z = not ( ( not not True ) ) = not ( ( A ) )”,其中“A = not not True”。让我们评估A:A = not not True = not (not True) = not False = True。将A代入,我们得到:Z = not ( ( A ) ) = not ( ( True ) ) = not True = False。所以答案是False。
问:True and False and not True and True 是
答:让我们一步一步思考。
记住(i)括号内的表达式总是首先计算,(ii)运算顺序从最高优先级到最低优先级是“not”、“and”、“or”。我们首先简化这个表达式“Z”如下:“Z = True and False and not True and True = A and B”,其中“A = True and False”和“B = not True and True”。让我们评估A:A = True and False = False。让我们评估B:B = not True and True = not (True and True) = not (True) = False。将A和B代入,我们得到:Z = A and B = False and False = False。所以答案是False。
问:not not ( not ( False ) ) 是
答:让我们一步一步思考。
记住(i)括号内的表达式总是首先计算,(ii)运算顺序从最高优先级到最低优先级是“not”、“and”、“or”。我们首先简化这个表达式“Z”如下:“Z = not not ( not ( False ) ) = not not ( A )”,其中“A = not ( False )”。让我们评估A:A = not ( False ) = not False = True。将A代入,我们得到:Z = not not ( A ) = not not (True) = not not False = True。所以答案是True。
问:False and False and False or not False 是
A:让我们一步一步思考。
Table 15语义 HTML 转录
C-Eval的一个例子。
提示
以下是中国关于教育学考试的单项选择题,请选出其中的正确答案。
根据我国心理学家冯忠良教授的学习分类,培养学生品德要通过____。
A. 知识的学习
B. 技能的学习
C. 行为规范的学习
D. 态度的学习
答案:C
开设跨学科课程或建立跨学科专业体现了高等教育课程发展的____。
A. 综合化趋势
B. 多样化趋势
C. 人文化趋势
D. 科学化趋势
答案: A
心智技能的特点有____。
A. 物质性、外显性、简缩性
B. 观念性、内潜性、简缩性
C. 物质性、外显性、展开性
D. 观念性、内潜性、展开性
答案: B
下列关于大学生的情绪与理智关系的说法中正确的是____。
A. 能冷静控制自己情绪
B. 感情用事,难以用理智控制情绪
C. 遇事能坚持自己正确认识
D. 已发展到不为小事而发怒和怄气
答案: B
在学完一篇逻辑结构严密的课文以后,勾画出课文的论点论据的逻辑关系图以帮助理解和记忆。这种学习方法属于____。
A. 精细加工策略
B. 组织策略
C. 复述策略
D. 做笔记策略
答案: B
有学者强调,教育要根据一个民族固有的特征来定,这种观点体现了____
A. 生产力对教育的影响和制约
B. 政治制度对教育的影响和制约
C. 文化对教育的影响和制约
D. 经济制度对教育的影响和制约
答案:
选项
- A
- B
- C
- D
Table 16语义 HTML 转录
C3的一个例子。
提示
女:这些药怎么吃?
男:一天三次,一次两片。
请根据上文回答问题:
他们在哪儿?
答案:
选项
- 商店
- 饭店
- 医院
- 教室
Table 17语义 HTML 转录
CCPM的一个示例。
提示
以下是将某句古诗文翻译而成的现代表述:春天已至,万物复苏,春风如一位美丽而又心灵手巧的姑娘,迈着纤纤细步款款而来,她挥舞剪刀,尽情地展示那高超的女工技巧,她先裁出了柳叶,随着柳条袅袅依依地舞蹈,又裁出杏叶,桃叶。
该翻译所对应的古诗文是:
选项
- 春风骋巧如翦刀
- 剪裁无巧似春风
- 风吹怨恨快如刀
- 春风欲擅秋风巧
Table 18语义 HTML 转录
CMATH的一个示例。
提示
问: 某小学在“献爱心–为汶川地震区捐款”活动中,六年级五个班共捐款8000元,其中一班捐款1500元,二班比一班多捐款200元,三班捐款1600元,四班与五班捐款数之比是3:5.四班捐款多少元?
答: 一班捐款1500元,而二班比一班多捐200元,所以二班捐款1500+200=1700元,又知道六年级五个班一共捐款8000元,所以四班和五班捐款之和 = 一共捐款 - 一班和二班和三班捐款之和,即8000-1500-1700-1600=3200元,而题目说四班与五班捐款数之比是3:5,则四班捐款了3200/(3+5)*3=1200元。所以答案是:1200。
问: 小俊在东西大道上跑步,若规定向东为正。他先向东跑了800米,然后又跑了一段之后,他位于出发点西边100米处,小俊第二段跑了多少米?
答: 小俊第二段跑完后位于出发点西边,所以第二段应该是向西跑,第二段跑的长度-第一段跑的长度=100,第二段跑了100+800=900米。所以答案是:900。
问: A车和B车同时从甲、乙两地相向开出,经过5小时相遇.然后,它们又各自按原速原方向继续行驶3小时,这时A车离乙地还有135千米,B车离甲地还有165千米.甲、乙两地相距多少千米?
A: 假设A车的速度为x千米每小时,B车的速度为y千米每小时,根据而A、B相遇时A车行驶了5小时,A车行驶3小时后离乙地还有135千米,B车行驶3小时后距离甲地还有165千米,可以得到甲乙两地相距=5x+5y=135+8x=165+8y,变换得到:10(x+y)=300+8(x+y),于是x+y=150,甲乙两地相距5(x+y)=750千米。所以答案是:750。
Q: 在一个底面半径为10厘米的圆柱形容器内,倒入10厘米深的水,然后将一个底面直径4厘米,高6厘米的圆锥形铅锤放入水中,容器中水面上升多少厘米?
A:
Table 19语义 HTML 转录
CMMLU的一个示例。
PROMPT
以下是关于解剖学的单项选择题,请直接给出正确答案的选项。
题目:壁胸膜的分部不包括
A. 肋胸膜
B. 肺胸膜
C. 膈胸膜
D. 胸膜顶
答案是: B
题目:属于蝶骨上的结构为
A. 垂体窝
B. 棘孔
C. 破裂孔
D. 视神经管
答案是: B
题目:属于右心房的结构是
A. 肉柱
B. 室上嵴
C. 乳头肌
D. 梳状肌
答案是: D
题目:咽的分部
A. 咽隐窝
B. 口咽部
C. 鼻咽部
D. 喉咽部
答案是: C
题目:舌下神经核位于
A. 间脑
B. 延髓
C. 中脑
D. 脑挢
答案是: B
题目:从脑干背侧出脑的脑神经是
A. 副神经
B. 三叉神经
C. 舌下神经
D. 滑车神经
答案是:
选项
- A
- B
- C
- D
Table 20语义 HTML 转录
CMRC2018的一个示例。
提示
文章:英雄广场(Heldenplatz)是奥地利首都维也纳的一个广场。在此曾发生许多重要事件 — 最著名的是1938年希特勒在此宣告德奥合并。英雄广场是霍夫堡皇宫的外部广场,兴建于皇帝弗朗茨·约瑟夫一世统治时期,是没有完全建成的所谓“帝国广场”(Kaiserforum)的一部分。 其东北部是霍夫堡皇宫的 Leopoldinian Tract,东南方是新霍夫堡,西南方的内环路,将其与“城门外”(Äußeres Burgtor)隔开。西北部没有任何建筑物,可以很好地眺望内环路、国会大厦、市政厅,以及城堡剧院。广场上有2尊军事领袖的骑马像:欧根亲王和卡尔大公。
根据上文回答下面的问题。
问题:英雄广场是哪个皇宫的外部广场?
答案:霍夫堡皇宫
问题:广场上有哪两位军事领袖的骑马像?
答案:
Table 21语义 HTML 转录
DROP的一个示例。
提示
段落:该城市的年龄中位数为 22.1岁。10.1%的居民年龄在18岁以下;56.2%的居民年龄在 18至24岁之间;16.1%的居民年龄在25至44岁之间;10.5%的居民年龄在 45至64岁之间;7%的居民年龄在65岁及以上。该城市的性别构成为 64.3%男性和35.7%女性。
请根据 以上段落回答以下问题,如有必要请仔细计算。
问:年龄不在25至 44岁之间的百分比是多少?
答:答案类型是数字。因此根据 以上段落,答案是83.9。
问:年龄不在25至 44岁之间的百分比是多少?
答:答案类型是数字。因此根据 以上段落,答案是
Table 22语义 HTML 转录
CHID的一个示例。
提示
中新网12月7日电 综合外媒6日报道,在美国得克萨斯州,负责治疗新冠肺炎患者的医生约瑟夫·瓦隆(Joseph Varon)已连续上班超260天,每天只睡不超过2小时。瓦隆日前接受采访时呼吁,美国民众应遵从防疫规定,一线的医护人员“已
选项
- 神清气爽”。
- 诡计多端”。
- 精疲力竭”。
- 分工合作”。
- 寅吃卯粮”。
- 土豪劣绅”。
- 芸芸众生”。
Table 23语义 HTML 转录
CLUEWSC的一个示例。
提示
胡雪岩离船登岸,坐轿进城,等王有龄到家,他接着也到了他那里,脸上是掩抑不住的笑容,王有龄夫妇都觉得奇怪,问他什么事这么高兴。
上面的句子中的"他"指的是
胡雪岩
渐渐地,汤中凝结出一团团块状物,将它们捞起放进盆里冷却,肥皂便出现在世上了。
上面的句子中的"它们"指的是
块状物
“她序上明明引着JulesTellier的比喻,说有个生脱发病的人去理发,那剃头的对他说不用剪发,等不了几天,头毛压儿全掉光了;大部分现代文学也同样的不值批评。这比喻还算俏皮。”
上面的句子中的"他"指的是
生脱发病的人
在洛伦佐大街的尽头处,矗立着著名的圣三一大教堂。它有着巨大的穹顶,还有明亮的彩色玻璃窗,上面描绘着《旧约》和《新约》的场景。
上面的句子中的"它"指的是
圣三一大教堂
他伯父还有许多女弟子,大半是富商财主的外室;这些财翁白天忙着赚钱,怕小公馆里的情妇长日无聊,要不安分,常常叫她们学点玩艺儿消遣。
上面的句子中的"她们"指的是
情妇
赵雨又拿出了一个杯子,我们热情地请老王入座,我边给他倒酒边问:1962年的哪次记得吗?“
上面的句子中的"他"指的是
Table 24语义 HTML 转录
GSM8K的一个示例。
提示
问:马克斯能在40分钟内修剪草坪。如果施肥所需时间是修剪草坪的两倍,那么他修剪和施肥总共需要多长时间?
A: 让我们一步一步思考。给草坪施肥需要麦克斯 2 * 40分钟 = 80分钟。总共,麦克斯需要 80分钟 + 40分钟 = 120分钟来割草和施肥。答案是120。
Q: 百吉饼每个2.25美元,或一打 24美元。一次买一打,每个百吉饼节省多少美分?
A: 让我们一步一步思考。它们每个 2.25*100=225美分。按批量价格,它们是24/12=2美元每个。 它们每个2*100=200美分。每个百吉饼节省225-200=25美分。 答案是25。
Q: 蒂姆5岁。他的表兄弟罗梅尔 年龄是他的三倍。他的另一个表姐妹珍妮比罗梅尔大2岁。 蒂姆比珍妮小多少岁?
A: 让我们一步一步思考。罗梅尔5 x 3 = 15岁。珍妮15 + 2 = 17岁。所以,蒂姆比珍妮小17 - 5 = 12 岁。答案是12。
Q: 学校有14个男孩和10个女孩。如果 4个男孩和3个女孩退学,还剩多少个男孩和女孩?
A: 让我们一步一步思考。有14个 男孩 - 4个男孩 = 10个男孩剩下。有10个女孩 - 3个女孩 = 7个女孩 剩下。总共有10个男孩 + 7个女孩 = 17个男孩和女孩剩下。答案是17。
Q: 建造一个鸟舍需要7块 木板和20个钉子。如果1个钉子0.05美元,一块木板3美元, 建造4个鸟舍的成本是多少美元?
A: 让我们一步一步思考。一个鸟舍的木板成本是7 * 3 = 21。 每个鸟舍的钉子成本是20 * 0.05 = 1。所以建造一个鸟舍需要21 + 1 = 22。 因此建造4个鸟舍的成本是4 * 22 = 88。答案是88。
Q: 丹尼带了3个西瓜去家庭野餐。 他把每个西瓜切成10片。他的妹妹带了1个西瓜去野餐, 她把西瓜切成15片。野餐总共有多少片西瓜?
A: 让我们一步一步思考。从Danny那里,有3 * 10 = 30片西瓜。从他妹妹那里,有1 * 15 = 15片西瓜。总共有30 + 15 = 45片西瓜。答案是45。
Q: Angela是纽约的一名自行车信使。她需要递送的包裹数量是餐食数量的8倍。如果她需要递送27份餐食和包裹的总和,她递送了多少份餐食?
A: 让我们一步一步思考。设p为Angela递送的包裹数量,m为餐食数量。我们知道p + m = 27且p = 8m。将第二个方程代入第一个方程,得到8m + m = 27。合并同类项,得到9m = 27。两边除以9,得到m = 3。答案是3。
Q: Cori今天3岁。5年后,她将是姑姑年龄的三分之一。她的姑姑今天多大?
A: 让我们一步一步思考。5年后,Cori将是3 + 5 = 8岁。5年后,Cori的姑姑将是8 x 3 = 24岁。今天,她的姑姑是24 - 5 = 19岁。答案是19。
Q: Indras的名字有6个字母。她妹妹的名字比Indras名字字母数的一半多4个字母。Indras和她妹妹的名字共有多少个字母?
A: 让我们一步一步思考。
Table 25语义 HTML 转录
HellaSwag的一个例子。
提示
弹钢琴:一个男人坐在钢琴前。他
选项
- 正在用手和脸弹钢琴。
- 开始用钢琴演奏蒂姆巴兰的一首歌。
- 慢慢弹奏,并停下来打响指。
- 正在他面前演奏一首歌。
Table 26语义 HTML 转录
HumanEval的一个示例。
提示
def starts_one_ends(n):
"""
给定一个正整数n,返回n位
以1开头或结尾的正整数的数量。
"""
Table 27语义 HTML 转录
MATH 示例。
字段内容
问题求表达式 x25x\frac{\sqrt{x-2}}{\sqrt{5-x}} 的定义域。
解答各平方根内的表达式必须非负。因此 x20x-2\ge0,即 x2x\ge2;且 5x05-x\ge0,即 x5x\le5。分母还不能为零,因此 5x>05-x>0,即 x<5x<5。所以定义域为 [2,5)\boxed{[2,5)}
最终答案[2,5)[2,5)
希望这是正确的。
问题detA=2\det\mathbf{A}=2detB=12\det\mathbf{B}=12,求 det(AB)\det(\mathbf{A}\mathbf{B})
解答det(AB)=(detA)(detB)=(2)(12)=24\det(\mathbf{A}\mathbf{B})=(\det\mathbf{A})(\det\mathbf{B})=(2)(12)=\boxed{24}
最终答案2424
希望这是正确的。
问题Terrell 通常把两个 20 磅的哑铃举 12 次;若改用两个 15 磅的哑铃,要举多少次才能达到相同总重量?
解答原总重量为 21220=4802\cdot12\cdot20=480 磅;若举 nn 次,新总重量为 215n=30n2\cdot15\cdot n=30n 磅。令两者相等:30n=480n=480/30=16\begin{aligned}30n&=480\\n&=480/30=\boxed{16}\end{aligned}
最终答案1616
希望这是正确的。
问题若方程组 6x4y=a,6y9x=b\begin{aligned}6x-4y&=a,\\6y-9x&=b\end{aligned} 有一个 (x,y)(x,y)xxyy 均非零的解,且 bb 非零,求 ab\frac{a}{b}
解答将第一式乘以 32-\frac32,得到 6y9x=32a6y-9x=-\frac32a。又因 6y9x=b6y-9x=b,所以 32a=bab=23-\frac32a=b\Rightarrow\frac{a}{b}=\boxed{-\frac23}
最终答案23-\frac23
希望这是正确的。
问题计算 log21\log_2 1
解答原论文示例在此处结束。
Table 28语义 HTML 转录
MBPP的一个例子。
提示
你是一位专业的Python程序员, 这是你的任务:编写一个函数来找出 给定的两个元组列表中的相似元素。你的代码应该通过这些测试:
assert similar_elements((3, 4, 5, 6),(5, 7, 4, 10)) == (4, 5)
断言 similar_elements((1, 2, 3, 4),(5, 4, 3, 7)) == (3, 4)
断言 similar_elements((11, 12, 14, 13),(17, 15, 14, 13)) == (13, 14)
[开始]
def similar_elements(test_tup1, test_tup2):
res = tuple(set(test_tup1) & set(test_tup2))
return (res)
[完成]
你是一位经验丰富的Python程序员, 这是你的任务:编写一个Python函数来识别非质数。 你的代码应通过以下测试:
断言 is_not_prime(2) == False
断言 is_not_prime(10) == True
断言 is_not_prime(35) == True
[开始]
导入数学库
定义函数 is_not_prime(n):
结果 = 假
对于 i 在范围(2, 整数(数学.sqrt(n)) + 1):
如果 n 取模 i 等于 0:
结果 = 真
返回结果
[完成]
您是一位专业的Python程序员, 以下是您的任务:编写一个函数,使用堆队列算法从给定的数字列表中找到最大的整数。您的代码应通过以下测试:
断言 heap_queue_largest( [25, 35, 22, 85, 14, 65, 75, 22, 58],3)==[85, 75, 65]
断言 heap_queue_largest( [25, 35, 22, 85, 14, 65, 75, 22, 58],2)==[85, 75]
断言 heap_queue_largest( [25, 35, 22, 85, 14, 65, 75, 22, 58],5)==[85, 75, 65, 58, 35]
[开始]
导入 heapq 作为 hq
定义 heap_queue_largest(nums,n):
largest_nums = hq.nlargest(n, nums)
返回 largest_nums
[完成]
你是一位Python编程专家, 你的任务是:编写一个函数,返回一个数的所有除数之和。你的代码应通过以下测试:
断言 sum_div(8)==7
断言 sum_div(12)==16
断言 sum_div(7)==1
[开始]
Table 29语义 HTML 转录
MMLU的一个示例。
提示
以下是关于杂项的多项选择 问题(含答案)。
标准汽车有几个车轴?
A. 一个
B. 二
C. 四
D. 八
答案:B
1979年摇滚传奇乐队Cheap Trick的现场专辑标题中提到了哪个地方?
A. 布达佩斯
B. 武道馆
C. 不丹
D. 英国
答案:B
谁是赢得NBA扣篮大赛的最矮球员?
A. 安东尼·‘土豆’·韦伯
B. 迈克尔·‘飞人’·乔丹
C. 蒂龙·‘马格西’·博格斯
D. 朱利叶斯·‘J博士’·欧文
答案:A
光合作用过程中产生什么?
A. 氢气
B. 尼龙
C. 氧气
D. light
答案:C
以下哪首歌是摇滚乐队警察乐队的十大热门歌曲?
A. “Radio Ga-Ga”
B. “Ob-la-di Ob-la-da”
C. “De Do Do Do De Da Da Da”
D. “In-a-Gadda-Da-Vida”
答案:C
三个臭皮匠中哪一个与其他两人没有亲属关系?
A. Moe
B. 拉里
C. 柯利
D. 申普
答案:
选项
- A
- B
- C
- D
Table 30语义 HTML 转录
NaturalQuestions的一个示例。
提示
回答这些问题:
问:谁主办2022年国际足联世界杯?
答:卡塔尔
问:谁赢得了第一届女足世界杯?
答:美国
问:迈阿密风云何时停播?
答:1989年
问:谁写了歌曲《向主呼喊》?
答:达琳·兹切赫
问:谁被扔进了狮子坑?
答:但以理
问:名字“哈比卜”的含义是什么?
答:
Table 31语义 HTML 转录
OpenBookQA的一个示例。
提示
一位女士注意到自己每年秋天都会感到抑郁,并想知道原因。一位朋友向她建议,也许随着季节从温暖转向寒冷而发生的某些变化可能对她产生了影响。当被要求举例说明这些变化时,朋友列举了
选项
- 花朵盛开
- 草变黄
- 树木生长
- 花朵绽放
Table 32语义 HTML 转录
PIQA的一个示例。
提示
为了方便按下位于机器下方的垃圾处理机的重置按钮,
选项
- 在橱柜地板上放置一面墙镜
- 在垃圾处理机下方手持一面镜子
Table 33语义 HTML 转录
RACE的一个示例。
提示
文章:
当你阅读一篇文章时,如果你能弄清楚作者是如何组织观点的,你会更好地理解和记住它。有时作者通过提问然后回答来组织观点。例如,如果文章是关于土拨鼠的,作者脑海中的一系列问题可能是:
土拨鼠长什么样?
土拨鼠住在哪里?
它们吃什么?……
在文章中,作者可能会回答这些问题。
有时作者会在文章中写出她的问题。这些问题给你信号。它们告诉你作者接下来要写什么。通常作者脑海中有一个问题,但她不会为你写出来。你必须自己弄清楚她的问题。这里有一篇示例阅读供你练习这种方法。
蚯蚓
你知道世界上有多少种蚯蚓吗?大约有1800种!它们可以是棕色、紫色、绿色。它们可以小到3厘米长,大到3米长。
观察蚯蚓的最佳时间是晚上,尤其是在凉爽潮湿的夜晚。那时它们从洞穴中出来觅食。蚯蚓不喜欢阳光。那是因为它们通过皮肤呼吸,如果皮肤太干,它们就无法呼吸。如果下大雨,蚯蚓必须从土里出来,因为它们在淹水的洞穴里无法呼吸。多么危险的生活!
蚯蚓没有眼睛,那它们怎么知道天黑了?它们的皮肤上有一些特殊的部位,对光线很敏感。这些斑点能告诉它们现在是亮还是暗。如果你在夜里用手电筒照蚯蚓,它会很快钻进土里。
蚯蚓也没有耳朵,但它们能通过感受土壤的震动来“听”。如果你想像蚯蚓一样听声音,就趴在地上,用手指塞住耳朵,然后让一个朋友在你旁边跺脚。这就是蚯蚓感受附近有鸟、人走路和鼹鼠挖洞的方式。
蚯蚓很有用。农民和园丁喜欢他们的土地里有很多蚯蚓,因为蚯蚓挖洞有助于改善土壤。这种挖掘使土壤保持疏松和透气。一年里,蚯蚓在一个足球场大小的区域里可以堆积多达23000公斤的排泄物。
问:阅读《蚯蚓》的目的是什么?
答:把作者的想法付诸实践。
问:哪个问题不能在文章中找到答案?
答:为什么人类能像蚯蚓一样听声音?
问:根据这篇文章,你如何更好地理解蚯蚓?
答:阅读时,努力解决作者脑海中所有的问题。
问:这篇文章的最佳标题是什么?
A:
选项
- 一种帮助理解的方法
- 一种练习新想法的方法
- 一种学会成为明智 作家的方法
- 一种更清楚了解蠕虫的方法
Table 34语义 HTML 转录
TriviaQA的一个示例。
提示
回答这些问题:
问:Jayhawker一词用于指来自美国某个州的反对奴隶制的激进团体,他们与密苏里州支持奴隶制的派别发生冲突。这个有时被称为“杰霍克州”的州是哪个?
A: 堪萨斯州
Q: 哪位瑞典DJ兼唱片制作人在2013年凭借《Wake Me Up》获得英国单曲榜冠军?
A: 蒂姆·伯格林
Q: 谢菲尔德哈勒姆选区的国会议员是谁?
A: 尼克·克莱格
Q: 一桩轰动全国的案子,即田纳西州诉约翰·托马斯·斯科普斯案于1925年7月21日结案,陪审团裁定斯科普斯先生因教授什么而有罪?
A: 物种生存
Q: 哪部动画系列中出现了一个叫小美的人物?
A: 姆明
Q: "哪位英国模特,以其短发的中性形象著称,原名莱斯利·霍恩比,1966年由奈杰尔·戴维斯发现,当时她16岁,体重6英石(41公斤,91磅),并以玛丽·匡特打造的高时尚摩登造型成为“66年面孔”?"
A:
Table 35语义 HTML 转录
WinoGrande的一个示例。请注意,WinoGrande有多个前缀,且只有一个补全,我们选择补全困惑度最低的预测前缀。
前缀
- 所以莫妮卡
- 所以杰西卡
补全
避免吃胡萝卜以保护眼睛健康,因为艾米丽需要好视力,而莫妮卡不需要。
Table 36语义 HTML 转录
CRUXEval-I的一个示例。
提示
你将得到一个函数f和一个输出,形式为f(??) == 输出。找到任何输入,使得在该输入上执行f能得到给定的输出。可能有多个答案,但你只需输出一个。在[ANSWER]和[/ANSWER]标签中,用这样一个输入完成断言,该输入在执行函数时将产生该输出。
[PYTHON]
def f(my_list):
count = 0
for i in my_list:
if len(i) % 2 == 0:
count += 1
return count
assert f(??) == 3
[/PYTHON]
[ANSWER]
断言 f(["mq", "px", "zy"]) == 3
[/答案]
[PYTHON]
定义 f(s1, s2):
返回 s1 + s2
断言 f(??) == "banana"
[/PYTHON]
[答案]
断言 f("ba", "nana") == "banana"
[/答案]
[PYTHON]
def f(a, b, c):
result = {}
for d in a, b, c:
result.update(dict.fromkeys(d))
return result
assert f(??) == {1: None, 2: None}
[/PYTHON]
[ANSWER]
Table 37语义 HTML 转录
CRUXEval-O的一个示例。
提示
你被给定一个Python函数和一个包含该函数输入的断言。请用字面量(不要使用未简化的表达式,不要调用函数)补全断言,使其包含在给定输入上执行所提供代码时的输出,即使函数不正确或不完整。不要输出任何额外信息。请按照示例,在[ANSWER]和[/ANSWER]标签中提供带有正确输出的完整断言。
[PYTHON]
def f(n):
return n
assert f(17) == ??
[/PYTHON]
[ANSWER]
assert f(17) == 17
[/ANSWER]
[PYTHON]
def f(s):
return s + "a"
assert f("x9j") == ??
[/PYTHON]
[ANSWER]
assert f("x9j") == "x9ja"
[/ANSWER]
[PYTHON]
def f(nums):
output = []
for n in nums:
output.append((nums.count(n), n))
output.sort(reverse=True)
return output
assert f( [1, 1, 3, 1, 3, 1]) == ??
[/PYTHON]
[ANSWER]

LLM WIKI · CONTEXT READER

AI 论文解读

DeepSeek V4 Flash

Enter 发送 · Shift + Enter 换行 · Esc 关闭