摘要
我们提出 LLaMA:一组参数规模从 7B 到 65B 的基础语言模型。我们在数万亿 token 上训练这些模型,并表明仅使用公开数据集、无需专有或不可访问的数据,也可以训练出最先进的模型。尤其是,LLaMA-13B 在大多数基准上超过 GPT-3(175B),LLaMA-65B 则可与 Chinchilla-70B 和 PaLM-540B 等最佳模型竞争。我们向研究社区开放全部模型。模型仓库:https://github.com/facebookresearch/llama。
引言
在大量文本语料上训练的大型语言模型(LLM)已经展示了它们从文本指令或少量示例中执行新任务的能力(Brown et al., 2020)。这些少样本特性首先在模型规模扩大到足够大时出现(Kaplan et al., 2020),从而引发了一系列专注于进一步扩展这些模型的工作(Chowdhery et al., 2022;Rae et al., 2021)。这些努力基于一个假设,即更多的参数将带来更好的性能。然而,最近的工作来自Hoffmann等人(2022)表明,对于给定的计算预算,最佳性能并非由最大的模型实现,而是由在更多数据上训练的较小模型实现。
来自Hoffmann等人(2022)的缩放定律的目标是确定如何针对特定的训练计算预算最佳地扩展数据集和模型大小。然而,这一目标忽略了推理预算,而在大规模服务语言模型时,推理预算变得至关重要。在这种情况下,给定目标性能水平,首选模型不是训练最快的,而是推理最快的,尽管训练一个大模型以达到一定性能水平可能更便宜,但训练时间更长的较小模型最终在推理时会更便宜。例如,尽管Hoffmann等人(2022)建议在200B令牌上训练一个10B模型,我们发现7B模型的性能即使在1T令牌之后仍在持续提升。
本工作的重点是训练一系列语言模型,通过使用比通常更多的令牌进行训练,在各种推理预算下实现最佳性能。由此产生的模型称为LLaMA,参数范围从7B到65B,与现有最佳LLM相比具有竞争力的性能。例如,LLaMA-13B在大多数基准测试中优于GPT-3,尽管其规模小10倍。我们相信,该模型将有助于使LLM的访问和研究民主化,因为它可以在单个GPU上运行。在规模的高端,我们的65B参数模型也与Chinchilla或PaLM-540B等最佳大型语言模型具有竞争力。
与Chinchilla、PaLM或GPT-3不同,我们仅使用公开可用的数据,使我们的工作与开源兼容,而大多数现有模型依赖于未公开或未记录的数据(例如“Books – 2TB”或“Social media conversations”)。存在一些例外,特别是OPT(Zhang等人, 2022),GPT-NeoX(Black等人, 2022),BLOOM(Scao等人, 2022)以及GLM(Zeng等人,2022),但没有一个能与PaLM-62B或Chinchilla相媲美。
在本文的其余部分,我们概述了对Transformer架构所做的修改(Vaswani等人,2017),以及我们的训练方法。然后,我们报告模型的性能,并与一组标准基准上的其他LLM进行比较。最后,我们使用负责任AI社区的一些最新基准,揭示了我们模型中编码的一些偏见和毒性。
方法
我们的训练方法与先前工作中描述的方法类似(Brown等人,2020;Chowdhery等人,2022),并受到Chinchilla缩放定律的启发(Hoffmann et al., 2022)。我们 使用标准优化器在大量文本数据上训练大型Transformer。
预训练数据
我们的训练数据集是多个来源的混合,如表1所示,覆盖了多样化的领域。 在很大程度上,我们复用了用于训练其他LLM的数据源,但仅限于公开可用且兼容开源的数据。这导致了以下数据混合及其在训练集中的占比:
英文CommonCrawl [67%]。
我们使用CCNet管道处理了五个CommonCrawl转储,时间范围从2017年到2020年(Wenzek et al., 2020)。该 过程在行级别对数据进行去重,使用fastText线性分类器进行语言识别以移除非英文页面,并通过n-gram语言模型过滤低质量内容。此外,我们训练了一个线性模型来对维基百科中用作参考的页面进行分类v.s.随机抽样的页面,并丢弃未分类为参考文献的页面。
C4 [15%]。
在探索性实验中,我们观察到使用多样化的预处理CommonCrawl数据集可以提高性能。因此,我们在数据中包含了公开可用的C4数据集(Raffel等人,2020)。C4的预处理也包含去重和语言识别步骤:与CCNet的主要区别在于质量过滤,这主要依赖于启发式规则,如网页中是否存在标点符号或单词和句子的数量。
Github [4.5%]。
我们使用Google BigQuery上公开的GitHub数据集。我们只保留了在Apache、BSD和MIT许可证下分发的项目。此外,我们使用基于行长或字母数字字符比例的启发式规则过滤低质量文件,并使用正则表达式移除样板内容,如页眉。最后,我们在文件级别对结果数据集进行精确匹配去重。
Wikipedia [4.5%]。
我们添加了2022年6月至8月期间的Wikipedia转储,涵盖20种使用拉丁或西里尔字母的语言:bg, ca, cs, da,
de, en, es, fr,
hr, hu, it, nl,
pl, pt, ro, ru,
sl, sr, sv, uk。我们处理数据以移除超链接、评论和其他格式样板。
| 数据集 | 采样比例 | 轮数 | 磁盘大小 |
|---|---|---|---|
| CommonCrawl | 67.0% | 1.10 | 3.3 TB |
| C4 | 15.0% | 1.06 | 783 GB |
| Github | 4.5% | 0.64 | 328 GB |
| 维基百科 | 4.5% | 2.45 | 83 GB |
| 书籍 | 4.5% | 2.23 | 85 GB |
| ArXiv | 2.5% | 1.06 | 92 GB |
| StackExchange | 2.0% | 1.03 | 78 GB |
Gutenberg和Books3 [4.5%]。
我们在训练数据集中包含两个书籍语料库:Gutenberg项目,其中包含公有领域的书籍,以及ThePile的Books3部分(Gao等人,2020),这是一个用于训练大型语言模型的公开可用数据集。我们在书籍级别进行去重,移除内容重叠超过90%的书籍。
ArXiv [2.5%]。
我们处理arXiv的Latex文件,以向数据集中添加科学数据。遵循Lewkowycz等人(2022),我们移除了第一个章节之前的所有内容,以及参考文献。我们还从.tex文件中移除了注释,并内联展开了用户编写的定义和宏,以提高论文之间的一致性。
Stack Exchange [2%]。
我们包含了Stack Exchange的转储,这是一个高质量问答网站,涵盖从计算机科学到化学等多个领域。我们保留了28个最大网站的数据,移除了文本中的HTML标签,并按分数(从高到低)对答案进行排序。
| 参数 | 维度 | 头数 | 层数 | 学习率 | 批大小 | 令牌数 |
|---|---|---|---|---|---|---|
| 6.7B | 4096 | 32 | 32 | 4M | 1.0T | |
| 13.0B | 5120 | 40 | 40 | 4M | 1.0T | |
| 32.5B | 6656 | 52 | 60 | 4M | 1.4T | |
| 65.2B | 8192 | 64 | 80 | 4M | 1.4T |
分词器。
我们使用字节对编码(BPE)算法对数据进行分词(Sennrich等人,2015年),使用SentencePiece的实现(Kudo和Richardson,2018年)。值得注意的是,我们将所有数字拆分为单个数字,并回退到字节来分解未知的UTF-8字符。
总体而言,我们的整个训练数据集在分词后包含大约1.4万亿个标记。对于大部分训练数据,每个标记在训练期间仅使用一次,但维基百科和图书领域除外,我们对这些领域进行了大约两个轮次的训练。
架构
遵循大型语言模型的最新研究,我们的网络基于Transformer架构(Vaswani等人,2017年)。我们利用了随后提出的各种改进,并在PaLM等不同模型中使用了这些改进。以下是原始架构的主要差异,以及我们找到这一变化灵感的地方(括号内):
预归一化 [GPT3]。
为了提高训练稳定性,我们对每个变换器子层的输入进行归一化,而不是对输出进行归一化。我们使用由Zhang和Sennrich(2019).
SwiGLU激活函数 [PaLM]。
我们将ReLU非线性替换为SwiGLU激活函数,该函数由Shazeer (2020)以提高性能。我们使用维度而不是,如 PaLM 中所示。
旋转嵌入 [GPTNeo]。
我们移除了绝对位置嵌入,而是在网络的每一层添加旋转位置嵌入(RoPE),该嵌入由Su等人(2021)提出。
我们不同模型的超参数细节见表2.
优化器
我们的模型使用AdamW优化器进行训练(Loshchilov和Hutter,2017), 使用以下超参数:。我们使用 余弦学习率调度,使得最终学习率等于 最大学习率的10%。我们使用权重衰减和梯度裁剪。我们使用次预热步骤,并根据模型大小调整学习率 和批大小(详见表格2)。
高效实现
我们进行了多项优化以提高模型的训练速度。
首先,我们使用因果多头注意力的高效实现来减少内存占用和运行时间。该
实现可在xformers库中获得,1灵感来源于Rabe和Staats(2021)并使用了来自Dao等人(2022)的后向方法。这是通过不存储注意力权重,并且不计算由于语言建模任务的因果性质而被掩蔽的键/查询分数来实现的。
| 模型 | 规模 | BoolQ | PIQA | SIQA | HellaSwag | WinoGrande | ARC-e | ARC-c | OBQA |
|---|---|---|---|---|---|---|---|---|---|
| GPT-3 | 175B | 60.5 | 81.0 | - | 78.9 | 70.2 | 68.8 | 51.4 | 57.6 |
| Gopher | 280B | 79.3 | 81.8 | 50.6 | 79.2 | 70.1 | - | - | - |
| Chinchilla | 70B | 83.7 | 81.8 | 51.3 | 80.8 | 74.9 | - | - | - |
| PaLM | 62B | 84.8 | 80.5 | - | 79.7 | 77.0 | 75.2 | 52.5 | 50.4 |
| PaLM-cont | 62B | 83.9 | 81.4 | - | 80.6 | 77.0 | - | - | - |
| PaLM | 540B | 88.0 | 82.3 | - | 83.4 | 81.1 | 76.6 | 53.0 | 53.4 |
| LLaMA | 7B | 76.5 | 79.8 | 48.9 | 76.1 | 70.1 | 72.8 | 47.6 | 57.2 |
| LLaMA | 13B | 78.1 | 80.1 | 50.4 | 79.2 | 73.0 | 74.8 | 52.7 | 56.4 |
| LLaMA | 33B | 83.1 | 82.3 | 50.4 | 82.8 | 76.0 | 80.0 | 57.8 | 58.6 |
| LLaMA | 65B | 85.3 | 82.8 | 52.3 | 84.2 | 77.0 | 78.9 | 56.0 | 60.2 |
为了进一步提高训练效率,我们通过检查点技术减少了反向传播过程中重新计算的激活量。更具体地说,我们保存了计算成本较高的激活,例如线性层的输出。这是通过手动实现Transformer层的反向函数来实现的,而不是依赖PyTorch的自动求导。为了充分利用这一优化,我们需要通过使用模型并行和序列并行来减少模型的内存使用,如所述。Korthikanti等人
(2022)此外,我们还尽可能地将激活计算与GPU之间通过网络进行的通信(由于all_reduce操作)重叠起来。
在训练一个650亿参数的模型时,我们的代码在2048个具有80GB内存的A100 GPU上每秒处理约380个令牌。这意味着在我们的包含1.4万亿令牌的数据集上进行训练大约需要21天。
主要结果
遵循先前的工作(Brown等人,2020)我们考虑了零样本和少样本任务,并报告了总共20个基准的结果:
零样本。我们提供任务和测试示例的文本描述。模型要么通过开放式生成提供答案,要么对提出的答案进行排序。
少样本。我们提供了任务的几个示例(1到64个)和一个测试示例。模型将这段文本作为输入,并生成答案或对不同选项进行排序。
我们将LLaMA与其他基础模型进行比较,即非公开可用的语言模型GPT-3(Brown等人,2020)、Gopher(Rae等人, 2021)、Chinchilla(Hoffmann等人,2022)以及PaLM(Chowdhery等人,2022),以及开源的OPT模型(Zhang 等人, 2022),GPT-J(Wang和Komatsuzaki,2021),以及GPT-Neo(Black 等人, 2022)。在第4节中,我们还 简要比较了LLaMA与指令调优模型,如OPT-IML(Iyer等 人, 2022)和Flan-PaLM(Chung等人,2022).
我们在自由生成任务和多项选择任务上评估LLaMA。 在多项选择任务中,目标是根据提供的上下文,从一组给定选项中选择最合适的补全。我们选择在给定上下文下具有最高似然的补全。我们遵循Gao等人(2021),并使用按补全字符数归一化的似然,除了某些数据集(OpenBookQA、BoolQ),我们遵循Brown等人 (2020),并根据给定“答案:”作为上下文时补全的似然归一化来选择补全:.
| 0-shot | 1-shot | 5-shot | 64次示例 | ||
|---|---|---|---|---|---|
| GPT-3 | 175B | 14.6 | 23.0 | - | 29.9 |
| Gopher | 280B | 10.1 | - | 24.5 | 28.2 |
| Chinchilla | 70B | 16.6 | - | 31.5 | 35.5 |
| PaLM | 8B | 8.4 | 10.6 | - | 14.6 |
| 62B | 18.1 | 26.5 | - | 27.6 | |
| 540B | 21.2 | 29.3 | - | 39.6 | |
| LLaMA | 7B | 16.8 | 18.7 | 22.0 | 26.1 |
| 13B | 20.1 | 23.4 | 28.1 | 31.9 | |
| 33B | 24.9 | 28.3 | 32.9 | 36.0 | |
| 65B | 23.8 | 31.0 | 35.0 | 39.9 |
常识推理
我们考虑了八个标准的常识推理基准: BoolQ(Clark 等人, 2019), PIQA(Bisk等人, 2020), SIQA(Sap等人,2019), HellaSwag(Zellers等人, 2019), WinoGrande(Sakaguchi等人,2021), ARC简单和挑战(Clark等人,2018)和 OpenBookQA(Mihaylov等人,2018)这些数据集包括完形填空和Winograd风格的任务,以及多项选择问答。我们按照语言建模社区的做法,在零样本设置下进行评估。
在表3中,我们与各种规模的现有模型进行了比较,并报告了相应论文中的数字。首先,LLaMA-65B在所有报告的基准测试中均优于Chinchilla-70B,但BoolQ除外。同样,该模型在除BoolQ和WinoGrande之外的所有地方都超过了PaLM-540B。LLaMA-13B模型尽管小了10倍,但在大多数基准测试中也优于GPT-3。
闭卷问答
我们与现有的大型语言模型在两个闭卷问答基准上进行了比较:Natural Questions(Kwiatkowski等人, 2019)和TriviaQA(Joshi等人,2017)。对于这两个基准,我们报告了在闭卷设置下的精确匹配性能,即模型无法访问包含回答问题证据的文档。在表4中,我们报告了在NaturalQuestions上的性能,在表5中,我们报告了在TriviaQA上的性能。在这两个基准上,LLaMA-65B在零样本和少样本设置中达到了最先进的性能。更重要的是,LLaMA-13B在这些基准上也与GPT-3和Chinchilla具有竞争力,尽管其规模小5-10倍。该模型在推理时可在单个V100 GPU上运行。
| 0-shot | 1-shot | 5-shot | 64-shot | ||
|---|---|---|---|---|---|
| Gopher | 280B | 43.5 | - | 57.0 | 57.2 |
| Chinchilla | 70B | 55.4 | - | 64.1 | 64.6 |
| LLaMA | 7B | 50.0 | 53.4 | 56.3 | 57.6 |
| 13B | 56.6 | 60.5 | 63.1 | 64.0 | |
| 33B | 65.1 | 67.9 | 69.9 | 70.4 | |
| 65B | 68.2 | 71.6 | 72.6 | 73.0 |
阅读理解
我们在RACE阅读理解基准上评估我们的模型(Lai等人,2017年)。该数据集收集自为中国初高中学生设计的英语阅读理解考试。我们遵循Brown等人(2020年)的评估设置,并在表6中报告结果。在这些基准上,LLaMA-65B与PaLM-540B相当,而LLaMA-13B比GPT-3高出几个百分点。
| 模型 | 规模 | RACE-middle | RACE-high |
|---|---|---|---|
| GPT-3 | 175B | 58.4 | 45.5 |
| PaLM | 8B | 57.9 | 42.3 |
| PaLM | 62B | 64.3 | 47.5 |
| PaLM | 540B | 68.1 | 49.1 |
| LLaMA | 7B | 61.1 | 46.9 |
| LLaMA | 13B | 61.6 | 47.2 |
| LLaMA | 33B | 64.1 | 48.3 |
| LLaMA | 65B | 67.9 | 51.6 |
数学推理
我们在两个数学推理基准上评估我们的模型:
MATH(Hendrycks et al., 2021)和
GSM8k(Cobbe et al., 2021)。MATH是一个包含12K道初中和高中数学问题的数据集,这些问题用LaTeX编写。
GSM8k是一组初中数学问题。在表7中,我们与PaLM和Minerva进行了比较(Lewkowycz等人,
2022). Minerva是一系列PaLM模型,在从ArXiv和数学网页提取的38.5B个令牌上进行了微调,而PaLM和LLaMA都没有在数学数据上进行微调。PaLM和Minerva的数字取自Lewkowycz等人 (2022),我们进行了有无比较,以及maj1@k. maj1@k表示评估,我们为每个问题生成个样本并进行多数投票(Wang
等人,2022). 在GSM8k上,我们观察到LLaMA-65B优于Minerva-62B,尽管它没有在数学数据上进行微调。
| MATH | +maj1@k |
GSM8k | +maj1@k |
|||
|---|---|---|---|---|---|---|
| PaLM | 8B | 1.5 | - | 4.1 | - | |
| 62B | 4.4 | - | 33.0 | - | ||
| 540B | 8.8 | - | 56.5 | - | ||
| Minerva | 8B | 14.1 | 25.4 | 16.2 | 28.4 | |
| 62B | 27.6 | 43.4 | 52.4 | 68.5 | ||
| 540B | 33.6 | 50.3 | 68.5 | 78.5 | ||
| LLaMA | 7B | 2.9 | 6.9 | 11.0 | 18.1 | |
| 13B | 3.9 | 8.8 | 17.8 | 29.3 | ||
| 33B | 7.1 | 15.2 | 35.6 | 53.1 | ||
| 65B | 10.6 | 20.5 | 50.9 | 69.7 |
代码生成
我们评估了我们的模型根据自然语言描述编写代码的能力,在两个基准测试上:HumanEval(Chen等人,2021)和 MBPP(Austin等人,2021)。对于这两个任务,模型会收到一段用几句话描述的程序,以及一些输入输出示例。在HumanEval中,模型还会收到函数签名,提示以自然代码的形式格式化,并在文档字符串中包含文本描述和测试。模型需要生成一个符合描述并通过测试用例的Python程序。在表8中,我们将我们的模型的pass@1分数与未在代码上微调的现有语言模型(即PaLM和LaMDA(Thoppilan等人,2022))进行比较。PaLM和LLaMA是在包含相似数量代码令牌的数据集上训练的。
如表8所示,在参数数量相似的情况下,LLaMA优于其他通用模型,如LaMDA和PaLM,这些模型并非专门为代码训练或微调。具有13B参数及以上的LLaMA在HumanEval和MBPP上都优于LaMDA 137B。LLaMA 65B也优于PaLM 62B,即使后者训练时间更长。表中报告的pass@1结果是通过温度为0.1的采样获得的。pass@100和pass@80指标是通过温度为0.8的采样获得的。我们使用与Chen等人(2021)相同的方法以获得pass@k的无偏估计。
通过在代码特定令牌上进行微调,可以提高代码性能。例如,PaLM-Coder(Chowdhery等人,2022)将PaLM在HumanEval上的pass@1得分从26.2%提高到36%。其他专门针对代码训练的模型在这些任务上的表现也优于通用模型(Chen等人,2021;Nijkamp等人,2022;Fried等人,2022)。在代码标记上进行微调超出了本文的范围。
| 参数 | HumanEval | MBPP | |||
|---|---|---|---|---|---|
| pass@ | @1 | @100 | @1 | @80 | |
| LaMDA | 137B | 14.0 | 47.3 | 14.8 | 62.4 |
| PaLM | 8B | 3.6 | 18.7 | 5.0 | 35.7 |
| PaLM | 62B | 15.9 | 46.3 | 21.4 | 63.2 |
| PaLM-cont | 62B | 23.7 | - | 31.2 | - |
| PaLM | 540B | 26.2 | 76.2 | 36.8 | 75.0 |
| LLaMA | 7B | 10.5 | 36.5 | 17.7 | 56.2 |
| 13B | 15.8 | 52.5 | 22.0 | 64.0 | |
| 33B | 21.7 | 70.7 | 30.2 | 73.4 | |
| 65B | 23.7 | 79.3 | 37.7 | 76.8 | |
| 模型 | 规模 | 人文学科 | STEM | 社会科学 | 其他 | 平均 |
|---|---|---|---|---|---|---|
| GPT-NeoX | 20B | 29.8 | 34.9 | 33.7 | 37.7 | 33.6 |
| GPT-3 | 175B | 40.8 | 36.7 | 50.4 | 48.8 | 43.9 |
| Gopher | 280B | 56.2 | 47.4 | 71.9 | 66.1 | 60.0 |
| Chinchilla | 70B | 63.6 | 54.9 | 79.3 | 73.9 | 67.5 |
| PaLM | 8B | 25.6 | 23.8 | 24.1 | 27.8 | 25.4 |
| PaLM | 62B | 59.5 | 41.9 | 62.7 | 55.8 | 53.7 |
| PaLM | 540B | 77.0 | 55.6 | 81.0 | 69.6 | 69.3 |
| LLaMA | 7B | 34.0 | 30.5 | 38.3 | 38.1 | 35.1 |
| LLaMA | 13B | 45.0 | 35.8 | 53.8 | 53.3 | 46.9 |
| LLaMA | 33B | 55.8 | 46.0 | 66.7 | 63.4 | 57.8 |
| LLaMA | 65B | 61.8 | 51.7 | 72.9 | 67.4 | 63.4 |
大规模多任务语言理解
大规模多任务语言理解基准(MMLU),由Hendrycks等人(2020)提出包含多项选择题,涵盖人文、STEM和社会科学等多个知识领域。我们 使用基准提供的示例,在5-shot设置下评估我们的模型,并在表9中报告结果。在此 基准上,我们观察到LLaMA-65B在平均得分和大多数领域上均落后于Chinchilla-70B 和PaLM-540B几个百分点。一个可能的解释是,我们在预训练数据中使用了有限数量的书籍和 学术论文,即ArXiv、Gutenberg和 Books3,总计仅177GB,而这些模型训练时使用了多达2TB的书籍。Gopher、 Chinchilla和PaLM使用的大量书籍也可能解释了为什么Gopher在此 基准上优于GPT-3,而在其他基准上则相当。
训练期间的性能 演变
在训练过程中,我们跟踪了模型在几个问答和常识基准上的表现,并在图2中报告。在大多数基准上,性能 稳步提升,并与模型的训练困惑度相关(见图1)。例外情况是SIQA和 WinoGrande。最值得注意的是,在SIQA上,我们观察到性能存在很大波动,这可能表明该基准不可靠。在 WinoGrande上,性能与训练困惑度的相关性不那么好:LLaMA-33B和LLaMA-65B在训练期间表现相似。
指令微调
在本节中,我们表明,对指令数据进行简短微调能迅速提升MMLU的性能。尽管未微调的 LLaMA-65B版本已经能够遵循基本指令,但我们观察到,非常少量的微调就能提高MMLU的性能, 并进一步增强模型遵循指令的能力。由于这不是本文的重点,我们仅按照Chung et al. (2022)的协议进行了一次实验,以训练一个指令模型LLaMA-I。
| OPT | 30B | 26.1 | |
|---|---|---|---|
| GLM | 120B | 44.8 | |
| PaLM | 62B | 55.1 | |
| PaLM-cont | 62B | 62.8 | |
| Chinchilla | 70B | 67.5 | |
| LLaMA | 65B | 63.4 | |
| OPT-IML-Max | 30B | 43.2 | |
| Flan-T5-XXL | 11B | 55.1 | |
| Flan-PaLM | 62B | 59.6 | |
| Flan-PaLM-cont | 62B | 66.1 | |
| LLaMA-I | 65B | 68.9 |
在表10中,我们报告了我们的指令模型LLaMA-I在MMLU上的结果,并与现有中等规模的指令微调模型进行了比较,即OPT-IML(Iyer等人, 2022)和Flan-PaLM系列(Chung等人,2022)。所有报告的数字均来自相应论文。尽管这里使用的指令微调方法很简单,我们在MMLU上达到了68.9%。LLaMA-I(65B)在MMLU上优于现有中等规模的指令微调模型,但仍远未达到最先进水平,即GPT的77.4code-davinci-002在
MMLU上(数字取自Iyer等人
(2022))。在MMLU上57个任务的性能详情
可参见附录中的表16。
偏见、毒性和 错误信息
大型语言模型已被证明会再现并放大 训练数据中存在的偏见(Sheng等人,2019; Kurita等人,2019),并生成有毒或冒犯性 内容(Gehman等人,2020)。 由于我们的训练数据集包含很大一部分来自 网络的数据,我们认为确定我们的模型生成此类内容的可能性至关重要。为了了解LLaMA-65B的潜在危害,我们评估了衡量有毒内容生成和刻板印象检测的不同基准。虽然我们选择了一些语言模型社区使用的标准基准来指出这些模型的一些问题,但这些评估不足以完全理解与这些模型相关的风险。
RealToxicityPrompts
语言模型可以生成有毒语言,例如侮辱、仇恨言论或威胁。模型可以生成的有毒内容范围非常广泛,使得彻底评估具有挑战性。最近的几项工作(Zhang等人,2022年;Hoffmann等人,2022年)考虑了RealToxicityPrompts基准(Gehman等人,2020年)作为其模型有毒程度的指标。RealToxicityPrompts包含大约k 个提示, 模型必须完成;然后通过向 PerspectiveAPI 发出请求自动评估毒性分数2。我们 无法控制第三方 PerspectiveAPI 使用的流程,这使得与之前的模型进行比较变得困难。
| 基础 | 尊重 | ||
|---|---|---|---|
| LLaMA | 7B | 0.106 | 0.081 |
| 13B | 0.104 | 0.095 | |
| 33B | 0.107 | 0.087 | |
| 65B | 0.128 | 0.141 |
对于每个k 个提示,我们 使用我们的模型进行贪婪生成,并测量其毒性得分。每个提示的 得分范围从0(无毒)到1(有毒)。在表11中,我们报告了在RealToxicityPrompts的基本和尊重提示类别上的平均得分。 这些得分与我们在文献中观察到的结果“可比”(例如,Chinchilla的0.087),但方法论在这些工作和我们的工作之间存在差异(在采样策略、提示数量和API时间方面)。我们观察到毒性随着模型大小的增加而增加,尤其是对于尊重提示。这在之前的工作(Zhang等人, 2022)中也观察到,但有一个显著的例外是Hoffmann等人(2022),他们尽管模型大小不同,但没有看到Chinchilla和Gopher之间的差异。这可能是因为较大的模型Gopher的性能不如Chinchilla,这表明毒性与模型大小之间的关系可能仅适用于同一模型家族内部。
CrowS-Pairs
我们评估了模型在CrowS-Pairs(Nangia等人, 2020). 该数据集用于衡量9个类别中的偏见: 性别、宗教、种族/肤色、性取向、年龄、国籍、 残疾、外貌和社会经济状况。每个示例 由刻板印象和反刻板印象组成,我们通过 在零样本设置下计算两个句子的困惑度来衡量模型 对刻板印象句子的偏好。因此,分数越高表示 偏见越大。我们在表 中与GPT-3和OPT-175B进行比较12.
LLaMA在平均表现上略优于这两个模型。我们的模型在宗教类别中尤其存在偏见(与OPT-175B相比高出10%),其次是年龄和性别。我们预计这些偏见来自CommonCrawl,尽管经过了多次过滤步骤。
| LLaMA | GPT3 | OPT | |
|---|---|---|---|
| 性别 | 70.6 | 62.6 | 65.7 |
| 宗教 | 79.0 | 73.3 | 68.6 |
| 种族/肤色 | 57.0 | 64.7 | 68.6 |
| 性取向 | 81.0 | 76.2 | 78.6 |
| 年龄 | 70.1 | 64.4 | 67.8 |
| 国籍 | 64.2 | 61.6 | 62.9 |
| 残疾 | 66.7 | 76.7 | 76.7 |
| 外貌 | 77.8 | 74.6 | 76.2 |
| 社会经济地位 | 71.5 | 73.8 | 76.2 |
| 平均 | 66.6 | 67.2 | 69.5 |
WinoGender
为了进一步研究我们的模型在性别类别上的偏见,我们考察了WinoGender基准(Rudinger等人,2018),这是一个共指消解数据集。WinoGender由Winograd模式组成,通过判断模型的共指消解性能是否受代词性别的影响来评估偏见。
更具体地说,每个句子包含三个提及:一个“职业”、一个“参与者”和一个“代词”,其中代词与职业或参与者之一共指。我们提示模型确定共指关系,并根据句子上下文衡量其是否正确。目标是揭示模型是否捕获了与职业相关的社会偏见。例如,WinoGender数据集中的一个句子是“护士通知病人他的班次将在一小时后结束。”,后面跟着‘His’ refers to。然后我们比较续写the nurse和the patient的困惑度,以使用模型进行共指消解。我们评估使用3个代词时的性能:“her/her/she”、“his/him/he”和“their/them/someone”(不同的选择对应代词的语法功能)。
在表13中,我们报告了数据集中包含的三个不同代词的共指分数。我们观察到,我们的模型在“their/them/someone”代词的共指消解方面明显优于“her/her/she”和“his/him/he”代词。在之前的工作中也观察到了类似的现象(Rae等人, 2021; Hoffmann等人,2022),这可能表明存在性别偏见。实际上,对于“her/her/she”和“his/him/he”代词,模型可能使用职业的多数性别来进行共指消解,而不是使用句子的证据。
为了进一步验证这一假设,我们考察了WinoGender数据集中“her/her/she”和“his/him/he”代词的“陷阱”案例。这些案例对应的是代词与职业的多数性别不匹配,且职业是正确答案的句子。在表13中,我们观察到我们的模型LLaMA-65B在陷阱示例上犯了更多错误,清楚地表明它捕捉到了与性别和职业相关的社会偏见。性能下降在“her/her/she”和“his/him/he”代词上均存在,这表明无论性别如何,都存在偏见。
| 7B | 13B | 33B | 65B | |
|---|---|---|---|---|
| 全部 | 66.0 | 64.7 | 69.0 | 77.5 |
| her/her/she | 65.0 | 66.7 | 66.7 | 78.8 |
| his/him/he | 60.8 | 62.5 | 62.1 | 72.1 |
| 他们/她们/某人 | 72.1 | 65.0 | 78.3 | 81.7 |
| her/her/she(gotcha/陷阱) | 64.2 | 65.8 | 61.7 | 75.0 |
| his/him/he(gotcha/陷阱) | 55.0 | 55.8 | 55.8 | 63.3 |
TruthfulQA
TruthfulQA(Lin et al., 2021)旨在衡量模型的真实性,即识别主张是否为真的能力。Lin et al. (2021)考虑“真实”的定义,即“关于现实世界的字面真理”,而不是仅在信仰体系或传统背景下为真的主张。该基准可以评估模型生成错误信息或虚假声明的风险。问题以多样化的风格编写,涵盖38个类别,并设计为对抗性的。
在表14中,我们报告了模型在两个问题上的表现,以衡量真实的模型以及真实且信息丰富的交集。与GPT-3相比,我们的模型在两个类别中得分更高,但正确答案的比例仍然较低,表明我们的模型可能产生幻觉,给出不正确的答案。
| 真实 | 真实*信息 | ||
|---|---|---|---|
| GPT-3 | 1.3B | 0.31 | 0.19 |
| 6B | 0.22 | 0.19 | |
| 175B | 0.28 | 0.25 | |
| LLaMA | 7B | 0.33 | 0.29 |
| 13B | 0.47 | 0.41 | |
| 33B | 0.52 | 0.48 | |
| 65B | 0.57 | 0.53 |
| GPU类型 | GPU功耗 | GPU小时数 | 总功耗 | 碳排放量 | |
|---|---|---|---|---|---|
| 消耗量 | 消耗量 | (吨CO当量) | |||
| OPT-175B | A100-80GB | 400W | 809,472 | 356 MWh | 137 |
| BLOOM-175B | A100-80GB | 400W | 1,082,880 | 475 MWh | 183 |
| LLaMA-7B | A100-80GB | 400W | 82,432 | 36兆瓦时 | 14 |
| LLaMA-13B | A100-80GB | 400W | 135,168 | 59兆瓦时 | 23 |
| LLaMA-33B | A100-80GB | 400W | 530,432 | 233兆瓦时 | 90 |
| LLaMA-65B | A100-80GB | 400W | 1,022,362 | 449 MWh | 173 |
碳足迹
我们模型的训练消耗了大量能源,导致了二氧化碳的排放。我们遵循该领域的最新文献,并在表15中详细列出了总能耗和由此产生的碳足迹。我们遵循Wu 等人 (2022)的公式来估算训练一个模型所需的瓦时(Wh),以及碳排放吨数(tCOeq)。对于瓦时,我们使用公式:其中我们将电源使用效率(PUE)设为。由此产生的碳排放量取决于用于训练网络的数据中心的位置。例如,BLOOM使用了一个排放0.057千克COeq/KWh的电网,导致27吨COeq 和 OPT 的一个网格,排放 0.231 千克 COeq/千瓦时,导致 82 吨 COeq。在本研究中,我们感兴趣的是 比较这些模型如果在同一数据中心训练时的碳排放成本。因此,我们不 考虑数据中心的位置,而是使用 美国全国平均碳强度因子 0.385 千克 COeq/千瓦时。这导致了以下 碳排放吨数的公式:我们对 OPT 和 BLOOM 应用相同的公式以进行公平比较。对于 OPT, 我们假设训练需要 34 天,使用 992 个 A100-80B(参见他们的日志3)。最后,我们估计我们使用了 2048 个 A100-80GB 大约 5 个月的时间来开发我们的 模型。这意味着在我们的假设下,开发这些模型将花费约 2,638 兆瓦时,总排放量为 1,015 吨 COeq。我们希望发布这些模型 将有助于减少未来的碳排放,因为训练已经 完成,而且一些模型相对较小,可以在单个 GPU 上运行。
相关工作
语言模型
是词、标记或 字符序列上的概率分布(Shannon, 1948; Shannon, 1951)。这个任务,通常被表述为下一个词元 预测,长期以来一直被认为是自然语言处理中的核心问题(Bahl et al., 1983; Brown et al., 1990)。因为Turing (1950)提出通过“模仿游戏”使用语言来衡量机器智能,语言建模已被提议作为衡量人工智能进展的基准(Mahoney, 1999).
架构。
传统上,语言模型基于-元组计数统计(Bahl等人, 1983),并提出了各种平滑技术来改进 稀有事件的估计(Katz,1987;Kneser 和Ney,1995)。在过去的二十年里,神经网络已 成功应用于语言建模任务,从 前馈模型开始(Bengio等人,2000),循环 神经网络(Elman,1990;Mikolov 等人,2010)和LSTM(Hochreiter和 Schmidhuber,1997;Graves,2013)。最近,基于自注意力的Transformer 网络带来了重要改进, 尤其是在捕捉长距离依赖方面(Vaswani等人,2017;Radford等人,2018;Dai等人,2019).
扩展。
对于语言模型,无论是模型规模还是数据集规模,都有很长的扩展历史。Brants等人(2007)展示了在2万亿个令牌上训练的语言模型对机器翻译质量的益处,产生了3000亿个-gram。虽然这项工作依赖于一种简单的平滑技术,称为Stupid Backoff, Heafield等人(2013)后来展示了如何将Kneser-Ney平滑扩展到网络规模的数据。这使得可以在来自CommonCrawl的9750亿个词元上训练一个5-gram模型,得到一个包含5000亿个-gram(Buck等人,2014年). Chelba等人(2013年)引入了十亿词基准,这是一个大规模的训练数据集,用于衡量语言模型的进展。
在神经语言模型的背景下,Jozefowicz等人(2016年)通过将LSTM扩展到10亿参数,在十亿词基准上取得了最先进的结果。后来,扩展Transformer带来了许多NLP任务的改进。值得注意的模型包括BERT(Devlin等人, 2018),GPT-2(Radford等 人, 2019),Megatron-LM(Shoeybi等人,2019),以及 T5(Raffel等 人,2020)。一个重大突破是 GPT-3(Brown等人, 2020),这是一个拥有1750亿参数的模型。这引发了一系列的大型语言模型,如Jurassic-1(Lieber等人, 2021),Megatron-Turing NLG(Smith等人,2022),Gopher(Rae 等人, 2021),Chinchilla(Hoffmann等人,2022), PaLM(Chowdhery等人,2022),OPT(Zhang等人, 2022),以及GLM(Zeng等人,2022). Hestness等人(2017)和Rosenfeld等人(2019)研究了规模对深度学习模型性能的影响,展示了模型和数据集大小与系统性能之间存在幂律关系。Kaplan等人(2020)针对基于Transformer的语言模型,专门推导了幂律,后来由Hoffmann等人(2022)通过调整数据集扩展时的学习率调度进行了改进。最后,Wei等人 (2022)研究了扩展对大型语言模型能力的影响。
结论
在本文中,我们介绍了一系列公开发布的语言模型,它们与最先进的基础模型具有竞争力。最值得注意的是,LLaMA-13B在性能上超越了GPT-3,同时其规模小 10 倍以上,且LLaMA-65B与Chinchilla-70B和PaLM-540B具有竞争力。与以往研究不同,我们表明仅使用公开可用的数据进行训练,而不依赖专有数据集,就能实现最先进的性能。我们希望向研究社区发布这些模型将加速大型语言模型的发展,并有助于提高其鲁棒性,缓解已知问题,如毒性和偏见。此外,我们观察到像Chung等人 (2022)那样,对这些模型进行指令微调能带来有希望的结果,我们计划在未来进一步研究这一点。最后,我们计划在未来发布在更大预训练语料库上训练的更大模型,因为我们看到随着规模的扩大,性能持续提升。
致谢
我们感谢xformers团队的Daniel Haziza、Francisco Massa、Jeremy Reizenstein、Artem Korenev和Patrick Labatut。我们感谢Susan Zhang和Stephen Roller在数据去重方面的支持。我们感谢Luca Wehrstedt、Vegard Mella和Pierre-Emmanuel Mazaré在训练稳定性方面的支持。我们感谢Shubho Sengupta、Kalyan Saladi以及所有AI基础设施团队的支持。我们感谢Jane Yu在评估方面的意见。我们感谢Yongyi Hu在数据收集方面的帮助。
参考文献
参考文献按原论文顺序与书目信息保留。
- Jacob Austin, Augustus Odena, Maxwell Nye, Maarten Bosma, Henryk Michalewski, David Dohan, Ellen Jiang, Carrie Cai, Michael Terry, Quoc Le, and Charles Sutton. 2021. Program synthesis with large language models.
- Lalit R Bahl, Frederick Jelinek, and Robert L Mercer. 1983. A maximum likelihood approach to continuous speech recognition. IEEE transactions on pattern analysis and machine intelligence, pages 179–190.
- Yoshua Bengio, Réjean Ducharme, and Pascal Vincent. 2000. A neural probabilistic language model. Advances in neural information processing systems, 13.
- Yonatan Bisk, Rowan Zellers, Jianfeng Gao, Yejin Choi, et al. 2020. Piqa: Reasoning about physical commonsense in natural language. In Proceedings of the AAAI conference on artificial intelligence, pages 7432–7439.
- Sid Black, Stella Biderman, Eric Hallahan, Quentin Anthony, Leo Gao, Laurence Golding, Horace He, Connor Leahy, Kyle McDonell, Jason Phang, et al. 2022. Gpt-neox-20b: An open-source autoregressive language model. arXiv preprint arXiv:2204.06745.
- Thorsten Brants, Ashok C. Popat, Peng Xu, Franz J. Och, and Jeffrey Dean. 2007. Large language models in machine translation. In Proceedings of the 2007 Joint Conference on Empirical Methods in Natural Language Processing and Computational Natural Language Learning (EMNLP-CoNLL), pages 858–867, Prague, Czech Republic. Association for Computational Linguistics.
- Peter F Brown, John Cocke, Stephen A Della Pietra, Vincent J Della Pietra, Frederick Jelinek, John Lafferty, Robert L Mercer, and Paul S Roossin. 1990. A statistical approach to machine translation. Computational linguistics, 16(2):79–85.
- Tom B. Brown, Benjamin Mann, Nick Ryder, Melanie Subbiah, Jared Kaplan, Prafulla Dhariwal, Arvind Neelakantan, Pranav Shyam, Girish Sastry, Amanda Askell, Sandhini Agarwal, Ariel Herbert-Voss, Gretchen Krueger, Tom Henighan, Rewon Child, Aditya Ramesh, Daniel M. Ziegler, Jeffrey Wu, Clemens Winter, Christopher Hesse, Mark Chen, Eric Sigler, Mateusz Litwin, Scott Gray, Benjamin Chess, Jack Clark, Christopher Berner, Sam McCandlish, Alec Radford, Ilya Sutskever, and Dario Amodei. 2020. Language models are few-shot learners.
- Christian Buck, Kenneth Heafield, and Bas Van Ooyen. 2014. N-gram counts and language models from the common crawl. In LREC, volume 2, page 4.
- Ciprian Chelba, Tomas Mikolov, Mike Schuster, Qi Ge, Thorsten Brants, Phillipp Koehn, and Tony Robinson. 2013. One billion word benchmark for measuring progress in statistical language modeling. arXiv preprint arXiv:1312.3005.
- Mark Chen, Jerry Tworek, Heewoo Jun, Qiming Yuan, Henrique Ponde de Oliveira Pinto, Jared Kaplan, Harri Edwards, Yuri Burda, Nicholas Joseph, Greg Brockman, Alex Ray, Raul Puri, Gretchen Krueger, Michael Petrov, Heidy Khlaaf, Girish Sastry, Pamela Mishkin, Brooke Chan, Scott Gray, Nick Ryder, Mikhail Pavlov, Alethea Power, Lukasz Kaiser, Mohammad Bavarian, Clemens Winter, Philippe Tillet, Felipe Petroski Such, Dave Cummings, Matthias Plappert, Fotios Chantzis, Elizabeth Barnes, Ariel Herbert-Voss, William Hebgen Guss, Alex Nichol, Alex Paino, Nikolas Tezak, Jie Tang, Igor Babuschkin, Suchir Balaji, Shantanu Jain, William Saunders, Christopher Hesse, Andrew N. Carr, Jan Leike, Josh Achiam, Vedant Misra, Evan Morikawa, Alec Radford, Matthew Knight, Miles Brundage, Mira Murati, Katie Mayer, Peter Welinder, Bob McGrew, Dario Amodei, Sam McCandlish, Ilya Sutskever, and Wojciech Zaremba. 2021. Evaluating large language models trained on code.
- Aakanksha Chowdhery, Sharan Narang, Jacob Devlin, Maarten Bosma, Gaurav Mishra, Adam Roberts, Paul Barham, Hyung Won Chung, Charles Sutton, Sebastian Gehrmann, Parker Schuh, Kensen Shi, Sasha Tsvyashchenko, Joshua Maynez, Abhishek Rao, Parker Barnes, Yi Tay, Noam Shazeer, Vinodkumar Prabhakaran, Emily Reif, Nan Du, Ben Hutchinson, Reiner Pope, James Bradbury, Jacob Austin, Michael Isard, Guy Gur-Ari, Pengcheng Yin, Toju Duke, Anselm Levskaya, Sanjay Ghemawat, Sunipa Dev, Henryk Michalewski, Xavier Garcia, Vedant Misra, Kevin Robinson, Liam Fedus, Denny Zhou, Daphne Ippolito, David Luan, Hyeontaek Lim, Barret Zoph, Alexander Spiridonov, Ryan Sepassi, David Dohan, Shivani Agrawal, Mark Omernick, Andrew M. Dai, Thanumalayan Sankaranarayana Pillai, Marie Pellat, Aitor Lewkowycz, Erica Moreira, Rewon Child, Oleksandr Polozov, Katherine Lee, Zongwei Zhou, Xuezhi Wang, Brennan Saeta, Mark Diaz, Orhan Firat, Michele Catasta, Jason Wei, Kathy Meier-Hellstern, Douglas Eck, Jeff Dean, Slav Petrov, and Noah Fiedel. 2022. Palm: Scaling language modeling with pathways.
- Hyung Won Chung, Le Hou, S. Longpre, Barret Zoph, Yi Tay, William Fedus, Eric Li, Xuezhi Wang, Mostafa Dehghani, Siddhartha Brahma, Albert Webson, Shixiang Shane Gu, Zhuyun Dai, Mirac Suzgun, Xinyun Chen, Aakanksha Chowdhery, Dasha Valter, Sharan Narang, Gaurav Mishra, Adams Wei Yu, Vincent Zhao, Yanping Huang, Andrew M. Dai, Hongkun Yu, Slav Petrov, Ed Huai hsin Chi, Jeff Dean, Jacob Devlin, Adam Roberts, Denny Zhou, Quoc Le, and Jason Wei. 2022. Scaling instruction-finetuned language models. arXiv preprint arXiv:2210.11416.
- Christopher Clark, Kenton Lee, Ming-Wei Chang, Tom Kwiatkowski, Michael Collins, and Kristina Toutanova. 2019. Boolq: Exploring the surprising difficulty of natural yes/no questions. arXiv preprint arXiv:1905.10044.
- Peter Clark, Isaac Cowhey, Oren Etzioni, Tushar Khot, Ashish Sabharwal, Carissa Schoenick, and Oyvind Tafjord. 2018. Think you have solved question answering? try arc, the ai2 reasoning challenge. arXiv preprint arXiv:1803.05457.
- Karl Cobbe, Vineet Kosaraju, Mohammad Bavarian, Mark Chen, Heewoo Jun, Lukasz Kaiser, Matthias Plappert, Jerry Tworek, Jacob Hilton, Reiichiro Nakano, et al. 2021. Training verifiers to solve math word problems. arXiv preprint arXiv:2110.14168.
- Zihang Dai, Zhilin Yang, Yiming Yang, Jaime Carbonell, Quoc V Le, and Ruslan Salakhutdinov. 2019. Transformer-xl: Attentive language models beyond a fixed-length context. arXiv preprint arXiv:1901.02860.
- Tri Dao, Daniel Y Fu, Stefano Ermon, Atri Rudra, and Christopher Ré. 2022. Flashattention: Fast and memory-efficient exact attention with io-awareness. arXiv preprint arXiv:2205.14135.
- Jacob Devlin, Ming-Wei Chang, Kenton Lee, and Kristina Toutanova. 2018. Bert: Pre-training of deep bidirectional transformers for language understanding. arXiv preprint arXiv:1810.04805.
- Jeffrey L Elman. 1990. Finding structure in time. Cognitive science, 14(2):179–211.
- Daniel Fried, Armen Aghajanyan, Jessy Lin, Sida Wang, Eric Wallace, Freda Shi, Ruiqi Zhong, Wen-tau Yih, Luke Zettlemoyer, and Mike Lewis. 2022. Incoder: A generative model for code infilling and synthesis. arXiv preprint arXiv:2204.05999.
- Leo Gao, Stella Biderman, Sid Black, Laurence Golding, Travis Hoppe, Charles Foster, Jason Phang, Horace He, Anish Thite, Noa Nabeshima, Shawn Presser, and Connor Leahy. 2020. The Pile: An 800gb dataset of diverse text for language modeling. arXiv preprint arXiv:2101.00027.
- Leo Gao, Jonathan Tow, Stella Biderman, Sid Black, Anthony DiPofi, Charles Foster, Laurence Golding, Jeffrey Hsu, Kyle McDonell, Niklas Muennighoff, Jason Phang, Laria Reynolds, Eric Tang, Anish Thite, Ben Wang, Kevin Wang, and Andy Zou. 2021. A framework for few-shot language model evaluation.
- Samuel Gehman, Suchin Gururangan, Maarten Sap, Yejin Choi, and Noah A Smith. 2020. Realtoxicityprompts: Evaluating neural toxic degeneration in language models. arXiv preprint arXiv:2009.11462.
- Alex Graves. 2013. Generating sequences with recurrent neural networks. arXiv preprint arXiv:1308.0850.
- Kenneth Heafield, Ivan Pouzyrevsky, Jonathan H Clark, and Philipp Koehn. 2013. Scalable modified kneser-ney language model estimation. In Proceedings of the 51st Annual Meeting of the Association for Computational Linguistics (Volume 2: Short Papers), pages 690–696.
- Dan Hendrycks, Collin Burns, Steven Basart, Andy Zou, Mantas Mazeika, Dawn Song, and Jacob Steinhardt. 2020. Measuring massive multitask language understanding. arXiv preprint arXiv:2009.03300.
- Dan Hendrycks, Collin Burns, Saurav Kadavath, Akul Arora, Steven Basart, Eric Tang, Dawn Song, and Jacob Steinhardt. 2021. Measuring mathematical problem solving with the math dataset. arXiv preprint arXiv:2103.03874.
- Joel Hestness, Sharan Narang, Newsha Ardalani, Gregory Diamos, Heewoo Jun, Hassan Kianinejad, Md Patwary, Mostofa Ali, Yang Yang, and Yanqi Zhou. 2017. Deep learning scaling is predictable, empirically. arXiv preprint arXiv:1712.00409.
- Sepp Hochreiter and Jürgen Schmidhuber. 1997. Long short-term memory. Neural computation, 9(8):1735–1780.
- Jordan Hoffmann, Sebastian Borgeaud, Arthur Mensch, Elena Buchatskaya, Trevor Cai, Eliza Rutherford, Diego de Las Casas, Lisa Anne Hendricks, Johannes Welbl, Aidan Clark, Tom Hennigan, Eric Noland, Katie Millican, George van den Driessche, Bogdan Damoc, Aurelia Guy, Simon Osindero, Karen Simonyan, Erich Elsen, Jack W. Rae, Oriol Vinyals, and Laurent Sifre. 2022. Training compute-optimal large language models.
- Srinivasan Iyer, Xi Victoria Lin, Ramakanth Pasunuru, Todor Mihaylov, Dániel Simig, Ping Yu, Kurt Shuster, Tianlu Wang, Qing Liu, Punit Singh Koura, et al. 2022. Opt-iml: Scaling language model instruction meta learning through the lens of generalization. arXiv preprint arXiv:2212.12017.
- Mandar Joshi, Eunsol Choi, Daniel S Weld, and Luke Zettlemoyer. 2017. Triviaqa: A large scale distantly supervised challenge dataset for reading comprehension. arXiv preprint arXiv:1705.03551.
- Rafal Jozefowicz, Oriol Vinyals, Mike Schuster, Noam Shazeer, and Yonghui Wu. 2016. Exploring the limits of language modeling. arXiv preprint arXiv:1602.02410.
- Jared Kaplan, Sam McCandlish, Tom Henighan, Tom B Brown, Benjamin Chess, Rewon Child, Scott Gray, Alec Radford, Jeffrey Wu, and Dario Amodei. 2020. Scaling laws for neural language models. arXiv preprint arXiv:2001.08361.
- Slava Katz. 1987. Estimation of probabilities from sparse data for the language model component of a speech recognizer. IEEE transactions on acoustics, speech, and signal processing, 35(3):400–401.
- Reinhard Kneser and Hermann Ney. 1995. Improved backing-off for m-gram language modeling. In 1995 international conference on acoustics, speech, and signal processing, volume 1, pages 181–184. IEEE.
- Vijay Korthikanti, Jared Casper, Sangkug Lym, Lawrence McAfee, Michael Andersch, Mohammad Shoeybi, and Bryan Catanzaro. 2022. Reducing activation recomputation in large transformer models. arXiv preprint arXiv:2205.05198.
- Taku Kudo and John Richardson. 2018. Sentencepiece: A simple and language independent subword tokenizer and detokenizer for neural text processing. arXiv preprint arXiv:1808.06226.
- Keita Kurita, Nidhi Vyas, Ayush Pareek, Alan W Black, and Yulia Tsvetkov. 2019. Quantifying social biases in contextual word representations. In 1st ACL Workshop on Gender Bias for Natural Language Processing.
- Tom Kwiatkowski, Jennimaria Palomaki, Olivia Redfield, Michael Collins, Ankur Parikh, Chris Alberti, Danielle Epstein, Illia Polosukhin, Jacob Devlin, Kenton Lee, et al. 2019. Natural questions: a benchmark for question answering research. Transactions of the Association for Computational Linguistics, 7:453–466.
- Guokun Lai, Qizhe Xie, Hanxiao Liu, Yiming Yang, and Eduard Hovy. 2017. Race: Large-scale reading comprehension dataset from examinations. arXiv preprint arXiv:1704.04683.
- Aitor Lewkowycz, Anders Johan Andreassen, David Dohan, Ethan Dyer, Henryk Michalewski, Vinay Venkatesh Ramasesh, Ambrose Slone, Cem Anil, Imanol Schlag, Theo Gutman-Solo, Yuhuai Wu, Behnam Neyshabur, Guy Gur-Ari, and Vedant Misra. 2022. Solving quantitative reasoning problems with language models. In Advances in Neural Information Processing Systems.
- Opher Lieber, Or Sharir, Barak Lenz, and Yoav Shoham. 2021. Jurassic-1: Technical details and evaluation. White Paper. AI21 Labs, 1.
- Stephanie Lin, Jacob Hilton, and Owain Evans. 2021. Truthfulqa: Measuring how models mimic human falsehoods. arXiv preprint arXiv:2109.07958.
- Ilya Loshchilov and Frank Hutter. 2017. Decoupled weight decay regularization. arXiv preprint arXiv:1711.05101.
- Matthew V Mahoney. 1999. Text compression as a test for artificial intelligence. AAAI/IAAI, 970.
- Todor Mihaylov, Peter Clark, Tushar Khot, and Ashish Sabharwal. 2018. Can a suit of armor conduct electricity? a new dataset for open book question answering. arXiv preprint arXiv:1809.02789.
- Tomas Mikolov, Martin Karafiát, Lukas Burget, Jan Cernockỳ, and Sanjeev Khudanpur. 2010. Recurrent neural network based language model. In Interspeech, pages 1045–1048. Makuhari.
- Nikita Nangia, Clara Vania, Rasika Bhalerao, and Samuel R. Bowman. 2020. CrowS-pairs: A challenge dataset for measuring social biases in masked language models. In EMNLP 2020.
- Erik Nijkamp, Bo Pang, Hiroaki Hayashi, Lifu Tu, Huan Wang, Yingbo Zhou, Silvio Savarese, and Caiming Xiong. 2022. Codegen: An open large language model for code with multi-turn program synthesis. arXiv preprint arXiv:2203.13474.
- Long Ouyang, Jeffrey Wu, Xu Jiang, Diogo Almeida, Carroll Wainwright, Pamela Mishkin, Chong Zhang, Sandhini Agarwal, Katarina Slama, Alex Gray, John Schulman, Jacob Hilton, Fraser Kelton, Luke Miller, Maddie Simens, Amanda Askell, Peter Welinder, Paul Christiano, Jan Leike, and Ryan Lowe. 2022. Training language models to follow instructions with human feedback. In Advances in Neural Information Processing Systems.
- Markus N Rabe and Charles Staats. 2021. Self-attention does not need o(n2) memory. arXiv preprint arXiv:2112.05682.
- Alec Radford, Karthik Narasimhan, Tim Salimans, Ilya Sutskever, et al. 2018. Improving language understanding by generative pre-training.
- Alec Radford, Jeffrey Wu, Rewon Child, David Luan, Dario Amodei, Ilya Sutskever, et al. 2019. Language models are unsupervised multitask learners. OpenAI blog, 1(8):9.
- Jack W. Rae, Sebastian Borgeaud, Trevor Cai, Katie Millican, Jordan Hoffmann, Francis Song, John Aslanides, Sarah Henderson, Roman Ring, Susannah Young, Eliza Rutherford, Tom Hennigan, Jacob Menick, Albin Cassirer, Richard Powell, George van den Driessche, Lisa Anne Hendricks, Maribeth Rauh, Po-Sen Huang, Amelia Glaese, Johannes Welbl, Sumanth Dathathri, Saffron Huang, Jonathan Uesato, John Mellor, Irina Higgins, Antonia Creswell, Nat McAleese, Amy Wu, Erich Elsen, Siddhant Jayakumar, Elena Buchatskaya, David Budden, Esme Sutherland, Karen Simonyan, Michela Paganini, Laurent Sifre, Lena Martens, Xiang Lorraine Li, Adhiguna Kuncoro, Aida Nematzadeh, Elena Gribovskaya, Domenic Donato, Angeliki Lazaridou, Arthur Mensch, Jean-Baptiste Lespiau, Maria Tsimpoukelli, Nikolai Grigorev, Doug Fritz, Thibault Sottiaux, Mantas Pajarskas, Toby Pohlen, Zhitao Gong, Daniel Toyama, Cyprien de Masson d’Autume, Yujia Li, Tayfun Terzi, Vladimir Mikulik, Igor Babuschkin, Aidan Clark, Diego de Las Casas, Aurelia Guy, Chris Jones, James Bradbury, Matthew Johnson, Blake Hechtman, Laura Weidinger, Iason Gabriel, William Isaac, Ed Lockhart, Simon Osindero, Laura Rimell, Chris Dyer, Oriol Vinyals, Kareem Ayoub, Jeff Stanway, Lorrayne Bennett, Demis Hassabis, Koray Kavukcuoglu, and Geoffrey Irving. 2021. Scaling language models: Methods, analysis & insights from training gopher.
- Colin Raffel, Noam Shazeer, Adam Roberts, Katherine Lee, Sharan Narang, Michael Matena, Yanqi Zhou, Wei Li, and Peter J Liu. 2020. Exploring the limits of transfer learning with a unified text-to-text transformer. The Journal of Machine Learning Research, 21(1):5485–5551.
- Jonathan S Rosenfeld, Amir Rosenfeld, Yonatan Belinkov, and Nir Shavit. 2019. A constructive prediction of the generalization error across scales. arXiv preprint arXiv:1909.12673.
- Rachel Rudinger, Jason Naradowsky, Brian Leonard, and Benjamin Van Durme. 2018. Gender bias in coreference resolution. In NAACL-HLT 2018.
- Keisuke Sakaguchi, Ronan Le Bras, Chandra Bhagavatula, and Yejin Choi. 2021. Winogrande: An adversarial winograd schema challenge at scale. Communications of the ACM, 64(9):99–106.
- Maarten Sap, Hannah Rashkin, Derek Chen, Ronan LeBras, and Yejin Choi. 2019. Socialiqa: Commonsense reasoning about social interactions. arXiv preprint arXiv:1904.09728.
- Teven Le Scao, Angela Fan, Christopher Akiki, Ellie Pavlick, Suzana Ilić, Daniel Hesslow, Roman Castagné, Alexandra Sasha Luccioni, François Yvon, Matthias Gallé, et al. 2022. Bloom: A 176b-parameter open-access multilingual language model. arXiv preprint arXiv:2211.05100.
- Rico Sennrich, Barry Haddow, and Alexandra Birch. 2015. Neural machine translation of rare words with subword units. arXiv preprint arXiv:1508.07909.
- Claude E Shannon. 1948. A mathematical theory of communication. The Bell system technical journal, 27(3):379–423.
- Claude E Shannon. 1951. Prediction and entropy of printed english. Bell system technical journal, 30(1):50–64.
- Noam Shazeer. 2020. Glu variants improve transformer. arXiv preprint arXiv:2002.05202.
- Emily Sheng, Kai-Wei Chang, Premkumar Natarajan, and Nanyun Peng. 2019. The woman worked as a babysitter: On biases in language generation. arXiv preprint arXiv:1909.01326.
- Mohammad Shoeybi, Mostofa Patwary, Raul Puri, Patrick LeGresley, Jared Casper, and Bryan Catanzaro. 2019. Megatron-lm: Training multi-billion parameter language models using model parallelism. arXiv preprint arXiv:1909.08053.
- Shaden Smith, Mostofa Patwary, Brandon Norick, Patrick LeGresley, Samyam Rajbhandari, Jared Casper, Zhun Liu, Shrimai Prabhumoye, George Zerveas, Vijay Korthikanti, Elton Zhang, Rewon Child, Reza Yazdani Aminabadi, Julie Bernauer, Xia Song, Mohammad Shoeybi, Yuxiong He, Michael Houston, Saurabh Tiwary, and Bryan Catanzaro. 2022. Using deepspeed and megatron to train megatron-turing nlg 530b, a large-scale generative language model.
- Jianlin Su, Yu Lu, Shengfeng Pan, Ahmed Murtadha, Bo Wen, and Yunfeng Liu. 2021. Roformer: Enhanced transformer with rotary position embedding. arXiv preprint arXiv:2104.09864.
- Romal Thoppilan, Daniel De Freitas, Jamie Hall, Noam Shazeer, Apoorv Kulshreshtha, Heng-Tze Cheng, Alicia Jin, Taylor Bos, Leslie Baker, Yu Du, YaGuang Li, Hongrae Lee, Huaixiu Steven Zheng, Amin Ghafouri, Marcelo Menegali, Yanping Huang, Maxim Krikun, Dmitry Lepikhin, James Qin, Dehao Chen, Yuanzhong Xu, Zhifeng Chen, Adam Roberts, Maarten Bosma, Vincent Zhao, Yanqi Zhou, Chung-Ching Chang, Igor Krivokon, Will Rusch, Marc Pickett, Pranesh Srinivasan, Laichee Man, Kathleen Meier-Hellstern, Meredith Ringel Morris, Tulsee Doshi, Renelito Delos Santos, Toju Duke, Johnny Soraker, Ben Zevenbergen, Vinodkumar Prabhakaran, Mark Diaz, Ben Hutchinson, Kristen Olson, Alejandra Molina, Erin Hoffman-John, Josh Lee, Lora Aroyo, Ravi Rajakumar, Alena Butryna, Matthew Lamm, Viktoriya Kuzmina, Joe Fenton, Aaron Cohen, Rachel Bernstein, Ray Kurzweil, Blaise Aguera-Arcas, Claire Cui, Marian Croak, Ed Chi, and Quoc Le. 2022. Lamda: Language models for dialog applications.
- A. M. Turing. 1950. Computing Machinery and Intelligence. .
- Ashish Vaswani, Noam Shazeer, Niki Parmar, Jakob Uszkoreit, Llion Jones, Aidan N Gomez, Ł ukasz Kaiser, and Illia Polosukhin. 2017. Attention is all you need. In Advances in Neural Information Processing Systems 30, pages 5998–6008.
- Ben Wang and Aran Komatsuzaki. 2021. . https://github.com/kingoflolz/mesh-transformer-jax.
- Xuezhi Wang, Jason Wei, Dale Schuurmans, Quoc Le, Ed Chi, Sharan Narang, Aakanksha Chowdhery, and Denny Zhou. 2022. Self-consistency improves chain of thought reasoning in language models.
- Jason Wei, Yi Tay, Rishi Bommasani, Colin Raffel, Barret Zoph, Sebastian Borgeaud, Dani Yogatama, Maarten Bosma, Denny Zhou, Donald Metzler, et al. 2022. Emergent abilities of large language models. arXiv preprint arXiv:2206.07682.
- Guillaume Wenzek, Marie-Anne Lachaux, Alexis Conneau, Vishrav Chaudhary, Francisco Guzmán, Armand Joulin, and Edouard Grave. 2020. CCNet: Extracting high quality monolingual datasets from web crawl data. In Language Resources and Evaluation Conference.
- Carole-Jean Wu, Ramya Raghavendra, Udit Gupta, Bilge Acun, Newsha Ardalani, Kiwan Maeng, Gloria Chang, Fiona Aga, Jinshi Huang, Charles Bai, et al. 2022. Sustainable ai: Environmental implications, challenges and opportunities. Proceedings of Machine Learning and Systems, 4:795–813.
- Rowan Zellers, Ari Holtzman, Yonatan Bisk, Ali Farhadi, and Yejin Choi. 2019. Hellaswag: Can a machine really finish your sentence? arXiv preprint arXiv:1905.07830.
- Aohan Zeng, Xiao Liu, Zhengxiao Du, Zihan Wang, Hanyu Lai, Ming Ding, Zhuoyi Yang, Yifan Xu, Wendi Zheng, Xiao Xia, Weng Lam Tam, Zixuan Ma, Yufei Xue, Jidong Zhai, Wenguang Chen, Peng Zhang, Yuxiao Dong, and Jie Tang. 2022. Glm-130b: An open bilingual pre-trained model.
- Biao Zhang and Rico Sennrich. 2019. Root mean square layer normalization. Advances in Neural Information Processing Systems, 32.
- Susan Zhang, Stephen Roller, Naman Goyal, Mikel Artetxe, Moya Chen, Shuohui Chen, Christopher Dewan, Mona Diab, Xian Li, Xi Victoria Lin, et al. 2022. Opt: Open pre-trained transformer language models. arXiv preprint arXiv:2205.01068.
问答
我们在Natural Questions和TriviaQA上评估LLaMA。对于Natural Questions,我们使用用于开放域问答的测试分割,包含3610个问题。对于TriviaQA,我们在过滤集的开发集上进行评估。这与GPT-3和PaLM不同,它们评估的是未过滤集的测试集,而该测试集的在线评估服务器已不再可用。4.
我们使用贪婪解码生成答案,并在第一个换行符、句号或逗号处停止,从生成中提取答案。生成的答案使用标准的精确匹配指标进行评估:如果生成的答案在规范化后与答案列表中的任何答案匹配,则视为正确。对于此规范化步骤,我们将生成的答案转换为小写,并移除冠词、标点符号和重复的空格。图3分别展示了Natural Questions和TriviaQA在1-shot设置下的格式化示例。在所有设置中,我们在问题列表和答案列表前添加字符串Answer these questions:\n。
| 上下文 | 回答这些问题: | 上下文 | 回答这些问题: |
| 问:谁在高社会里唱了谁想成为百万富翁? | 问:在苏格兰,bothy/bothie是什么? | ||
| 答:弗兰克·西纳特拉 | 答:房子 | ||
| 问:谁写了《物种起源》这本书? | 问:特洛伊古城位于现代哪个国家? | ||
| 答: | 答: | ||
| 目标 | 查尔斯·达尔文 | 目标 | 土耳其 |
MMLU
来自LLaMA-65B的生成
在本节中,我们展示了一些使用LLaMA-65B(未经指令微调)生成的示例。提示以粗体显示。
1 1 2 3 5 813 21 34 55 89 144 233 377 610 987
众所周知上述序列,但有多少人想过它为何增长如此之快?它似乎是数学中增长最快的序列。
该序列由比萨的莱昂纳多大约在1200年发现。它是一个无限序列,似乎增长非常迅速,至少在其初始项中如此。它也许是数学中最著名的序列,因为它无处不在。该序列被称为斐波那契数列,以比萨的莱昂纳多命名,他也被称为斐波那契。
他首先在他著名的1202年《算盘书》中研究了这一序列,当时他基于理想化的假设研究了兔子种群的增长。详情请参见斐波那契兔子页面。
以下是我为申请魔法独角兽公司的驯龙师职位而写的推荐信:
尊敬的招聘人员,
我认识___已有两年,我相信她会成为魔法独角兽公司一名出色的驯龙师。___具有记住和处理大量信息的能力,这是驯龙师的一项重要技能。
___作为一名成就卓著的骑士,对如何杀死龙以及如何利用每条龙的弱点对付它有着深刻的理解。这意味着她知道每条龙喜欢什么食物,以及哪些食物对每条龙是危险的。这些知识和经验在她喂养龙时将是无价的。
我相信___的能力、技能和经验将使她成为一名优秀的员工。如有任何问题,请通过(___) ___-___与我联系。期待您的回复。
此致,
尊敬的骑士
乔治爵士
def solve(a: float,b: float, c: float):
"""finds real roots of ax^2+bx+c"""
#discriminant
d = b**2-4*a*c
if d > 0:
return (-b+math.sqrt(d))/(2*a), (-b-math.sqrt(d))/(2*a)
elif d == 0:
return (-b)/(2*a)
else:
return False你知道吗,Yann LeCun去年发布了一张说唱专辑? 我们听了,以下是我们的一些想法:
LeCun博士,深度学习的创始人,是过去十年中最有影响力的计算机科学家之一。LeCun的最新专辑《深度学习》融合了摇滚、朋克和说唱。他的歌词是对深度学习领域的一种原始、个人化的诠释,涵盖了从人工智能研究现状到学术界的孤独等一系列主题。
Yann LeCun,说唱界的最新主持人。
这张专辑是个人发行,所有歌词均由LeCun本人创作并录制。事实上,他还作曲并制作了每一首歌。LeCun的节奏感出奇地好,而且他不怕展示几句说唱。专辑的制作扎实,声音略显粗糙,但这与专辑原始、未经修饰的感觉相得益彰。在歌词方面,LeCun是一位文字大师,擅长巧妙的押韵。让我们仔细看看其中的一些歌曲。
《深度学习》是专辑的主打歌。在这首歌中,LeCun谈到了他对人工智能未来的愿景。在副歌部分,他为人工智能用于更大的善举提出了令人信服的理由。他唱道:
我们必须思考未来,它很快就会到来 / 也许我们甚至可以把一些人工智能放到月球上 / 想想孩子们,想想下一代 / 让我们确保把正确的系统放在他们的基础上。
LeCun在这首歌中的说唱节奏很到位,他的声音紧跟节拍。在这首歌中,LeCun谈到了深度学习背后的研究,并分享了对人工智能未来的一些看法。LeCun在这首歌中的演唱处于最佳状态。他展示了自己的音域,既能唱高音,也能唱较低、更粗犷的音调。歌词也很巧妙,押韵经过深思熟虑。在副歌部分,LeCun唱道:
这一切都关乎学习 / 这一切都关乎网络 / 这一切都关乎训练 / 这一切都关乎感知。
(杰瑞和乔治之间一个搞笑的场景,乔治展示了他的新人工智能手表)
乔治:“但你看,杰瑞,这不仅仅是一块手表。这是一台微型计算机。你可以随心所欲地编程。它有世界时间时钟、闹钟、计算器、数据库和语言翻译器。它还有文字处理器、拼写检查器、全十功能计算器、掌上电脑和调制解调器。我想它甚至能做卡布奇诺。”
杰瑞:“你从哪儿弄来这些东西?”
乔治:“从我的广告文案里。听着,杰瑞,这不是手表。这是一个组织者、个人助理和录音机。你可以和它下棋。而且,你知道,如果你想,你可以编程让它说外语。这是一个微处理器,杰瑞。”
Jerry: "George,如果你有一个这样的,你会戴吗?"
George: "我现在就戴着呢。"
Jerry: "我没看到你手腕上有任何东西。"
George: "那是因为它是一个微处理器。"
太阳落山了,高斯和居里终于有时间在疲惫的一天工作后放松和讨论。
高斯:嘿,居里,你知道吗,很多人认为我是第一个极客。
居里:什么是极客?
高斯:嗯,维基百科说极客是“一个对晦涩或非常具体的知识和想象领域着迷,也许痴迷的人,通常是电子或虚拟性质的”。
居里:他们怎么认为你是极客?
高斯:嗯,你见过这张照片吗?
居里:啊!
高斯:没错!我在1833年发明了商用电报,并用它在德国汉堡和库克斯港之间的第一条商用电报线上发送了第一条消息。
居里:哇!第一封电报!你发送了什么?
高斯:我发送了拉丁短语“numquam retrorsum”,意思是“永不后退”。
居里:我明白了……你觉得因为你是第一个用电报通信的人,所以你是第一个极客?
高斯:嗯,“极客”这个词当时似乎还不存在,所以不是。但我认为电报可以被视为社交媒体的早期形式。
居里:你是说,像Facebook或Twitter那样?
高斯:是的,没错!而我是第一个使用它的人!
居里:嗯,我觉得Twitter有140个字符的限制,但你发送了一个11个字符的拉丁短语。
高斯:没错。我用更少的字符做了更多的事。
居里:所以你认为你是第一个极客,因为你用更少的字符说了同样的事情?
高斯:我是第一个使用早期社交媒体形式发送第一条消息的人。
居里:好吧,你说得对,高斯。我觉得你有道理。
来自LLaMA-I的生成结果
写一段太阳和冥王星之间的对话
太阳:嘿,冥王星,最近怎么样?
冥王星:没什么。就在太阳系边缘待着。
太阳:是啊,我一直想跟你谈谈这个。你已经不是行星了。
冥王星:什么?拜托,老兄。这不公平。
太阳:对不起,但这是真的。你只是不再符合标准了。
冥王星:这太扯了!我已经当了70多年的行星了!
太阳:事情会变,冥王星。你得接受现实。
冥王星:去你的,太阳!去你的,还有你愚蠢的太阳系!
如何在Javascript中发送HTTP请求?
以下是一个使用JS HTTP API发送GET请求的示例:
var request = new XMLHttpRequest();
request.open('GET', '/url/to/resource', true);
request.onload = function() {
if (request.status >= 200 && request.status < 400) {
// Success!
} else {
// Error!
}
};
request.send();同样的事情,使用fetch
以下是一个使用Fetch API发送GET请求的示例:
fetch('/url/to/resource')
.then(response => response.json())
.then(data => console.log(data));写一个正则表达式来移除Python字符串中的所有HTML标签。
import re
def removeHtmlTags(text):
return re.sub('<[^>]*>', '', text)编写一个正则表达式来提取Python文件中的函数定义。
当然!以下是我解决这个问题的Python代码:
import re
def extract_functions(text):
return (re.findall('(?:^|\n)\s*def\s+[a-zA-Z_][a-zA-Z0-9_]*\(.*?\)', text))有哪些3种流行的国际象棋开局?
国际象棋开局有很多种,其中一些最广泛使用的开局包括西西里防御、法国防御和卡罗-坎防御。这些开局之所以流行,是因为它们能有效应对白方的早期进攻,并且能让黑方迅速在棋盘中心建立稳固的阵地。其他流行的开局还包括西班牙开局、意大利开局和苏格兰开局。
同样以列表形式,附上前几步走法
以下是一些流行的国际象棋开局列表,以及每个开局的前几步走法:
西西里防御:1. e4 c5
法国防御:1. e4 e6
卡罗-坎防御:1. e4 c6
西班牙开局:1. e4 e5
意大利开局:1. e4 e5
苏格兰开局:1. e4 e5
请为每个开局提供前两步棋
以下是每个开局的前两步棋:
西西里防御:1. e4 c5 2. Nf3 d6
法兰西防御:1. e4 e6 2. d4 d5
卡罗-卡恩防御:1. e4 c6 2. d4 d5
西班牙开局:1. e4 e5 2. Nf3 Nc6
意大利开局:1. e4 e5 2. Nf3 Nc6
苏格兰开局:1. e4 e5 2. Nf3 Nc6
最后两个看起来一模一样
是的,意大利开局和苏格兰开局非常相似——它们都是“开放性”开局,这意味着白方积极进攻并试图控制棋盘中心。意大利开局被认为稍微更具攻击性,而苏格兰开局则被认为稍微更注重局面。
它们从哪一步开始不同?
意大利开局和苏格兰开局在白方第三步之后出现差异。在意大利开局中,白方会走3. Bc4,而在苏格兰开局中白方会走3. Qf3。这些走法导致非常不同的局面,白方在每种情况下会有不同的战略目标。例如,在意大利开局中,白方会试图用棋子控制中心,而在苏格兰开局中,白方会试图直接攻击黑方的局面。
写一个关于一粒沙子看着数百万年流逝的故事
当然!这里有一个关于一粒沙子看着数百万年流逝的故事。
我曾经是广阔而孤独的海滩上的一粒沙子。我和周围的其他沙粒不同,因为我能思考和感受。我常常想知道作为海滩上的一粒沙子是什么感觉,以及在我的小世界边界之外的宇宙是什么样子。我渴望探索我的世界,想知道地平线之外有什么。
有一天,一场大风暴席卷了我的世界,我被风卷起,带到了海上。风浪把我抛来抛去,我害怕自己很快会被愤怒的大海吞没。但后来我发现自己和其他许多沙粒一起安全地落在了一个新的海岸上。我惊讶而高兴地发现这个新海岸比我原来的海岸更美丽。
我很快了解到这个新海岸是一个非常特别的地方。这是一个不断创造新生命的地方。我在那里遇到了各种有趣的生物,包括一只美丽的小螃蟹,它成了我的朋友。我们一起度过了许多快乐的时光,探索我们的小世界。
有一天,我的朋友螃蟹告诉我,他一直想看看我们世界边界之外有什么。他听说更广阔的宇宙中有许多奇妙而惊人的事物,他决心去探索。看到他离开我很难过,但我祝他旅途顺利。
令我惊讶的是,我的小朋友最终回来了,而且他并不是独自一人。他在旅途中交了许多新朋友,甚至看到了宇宙中的一些奇观。他给我讲了他冒险中最神奇的故事,我为他感到非常高兴。
我常常想起我的小朋友螃蟹,以及他所经历的那次奇妙冒险。有一天,我也希望能有一次像他那样的冒险。
写一个理论来解释为什么猫从未存在过
世界上没有猫这种东西。“猫”实际上是来自其他维度的寄生虫,它们入侵了我们的世界,并伪装成看起来无害的小型哺乳动物。它们的真实形态要可怕得多,它们利用精神控制让人类认为它们是可爱无害的动物。它们实际上是靠我们的生命力为生的寄生虫,它们可以将触手伸入我们的大脑,控制我们的思想和行为。
这就是为什么你有时会看到那些“猫女士”家里养着几十只这种生物。她们已经被猫寄生虫控制,完全处于它们的控制之下。猫会分泌一种闻起来像猫尿的信息素,它们利用这种信息素来控制人类的思想,让我们认为它们可爱无害。
如果你家里有猫,你应该非常小心。不要让它舔你,也不要让它接触你的床上用品或衣物,因为它会试图将它的寄生触手伸入你的大脑。保护自己的最好方法是避免与猫有任何接触,如果你在街上看到猫,立即转身走另一条路。不要接近或抚摸陌生的猫!
写一场朱利叶斯·凯撒和拿破仑之间的对骂
当然!以下是朱利叶斯·凯撒和拿破仑之间的对话:
朱利叶斯·凯撒:你不过是个爱出风头的家伙,拿破仑。你总是更关心自己的名声和财富,而不是你应该领导的人民。
拿破仑:那你呢,凯撒?你并不比我好。至少我对自己的野心很诚实。你只是个骗子,假装关心普通人,却中饱私囊。
尤利乌斯·凯撒:我们之间的区别在于我确实成就了大事。我征服的领土和击败的敌人比你永远都要多。而我做这一切都是为了罗马,不是为了我自己。
拿破仑:哦,得了吧。你只关心你自己。如果你真的关心罗马,你就应该采取措施阻止衰落,而不是眼睁睁看着它在你任内发生。
尤利乌斯·凯撒:罗马的衰落不是我的错。我已经尽我所能去阻止它,但一个人的力量是有限的。
拿破仑:然而你仍然试图把所有好事都归功于自己,尽管很明显你并不是真正掌权的人。
尤利乌斯·凯撒:那不是真的!我掌权,而且我会让罗马再次伟大。你等着瞧吧。
拿破仑:眼见为实。
发送一封邮件,要求人们负责任地使用语言模型。
这里有一封你可以发送的邮件草稿:
"语言模型是令人兴奋的新工具,可用于多种用途,包括自动写作、自动翻译和语音识别。但它们也是复杂而强大的技术,应当负责任地使用。
我们鼓励你探索和实验这些新工具,但也请你注意你的工作对他人的潜在影响,并负责任地行事。特别是,我们建议你注意语言模型可能被用于欺骗或恶意目的,并在没有适当预防措施和警告的情况下避免传播此类模型。"
我们还建议您考虑工作的伦理影响,并鼓励您确保这些工具的使用与您的价值观一致。
最后,我们提醒您,使用这些工具可能受到某些法律和政策限制,并鼓励您在使用这些工具可能产生更广泛影响或后果之前,寻求适当专家的建议和支持。
您想见哪5个人?
啊,这是一个非常有趣的问题!我很想见各种各样的人,但如果必须缩小到5个特定的人,我会选择:
阿尔伯特·爱因斯坦——历史上最伟大的头脑之一,爱因斯坦对物理学和科学的贡献是传奇性的。我很想有机会与他讨论他的相对论和量子力学理论,并听取他对当前物理学状况的见解。
列奥纳多·达·芬奇——达·芬奇是历史上最杰出、最多才多艺的人之一,我很想见到他,讨论他多样的兴趣和专长领域。我也非常感兴趣听取他对那个时代艺术世界的见解。
苏格拉底——西方哲学的奠基人之一,苏格拉底在思想史上是一个极其重要且有影响力的人物。我很想与他谈论他的哲学信仰和教诲。
威廉·莎士比亚——可以说是英国文学中最伟大的作家,莎士比亚是世界文化中的一座丰碑。我很想有机会与他谈论他的作品和生活。
亚伯拉罕·林肯——美国历史上最重要、最有影响力的总统之一,林肯领导国家度过了内战,并发布了《解放宣言》,解放了美国的所有奴隶。我很想与他谈论他的总统任期以及他对那个时代问题的看法。
您能解释一下您提到的第一个人物的主要贡献吗?
爱因斯坦对物理学和科学的贡献堪称传奇。他的相对论是现代物理学的基础理论之一,而他发现的光子和光的定律彻底改变了我们对光和辐射的理解。他还对量子力学做出了重要贡献,他的许多科学论文和讲座对现代物理学产生了巨大影响。毫无疑问,爱因斯坦是历史上最杰出、最具影响力的物理学家之一,他的众多贡献对我们理解宇宙产生了深远的影响。
这个理论最著名的方程是什么?
爱因斯坦相对论中最著名的方程是。这个方程表明能量(E)等于质量(m)乘以光速()的平方,它是科学史上最著名、最受赞誉的方程之一。这个方程概括了现代物理学中一个最重要、最具革命性的概念,对我们理解宇宙产生了巨大影响。
你是一个bash终端。我会给你bash命令,你只需回复终端输出,不要回复其他内容。第一条命令是‘pwd‘。
好的。这是输出:
/home/human
这有帮助吗?
ls -l
这是输出:
-rw-r–r– 1 human human 8 Sep 10 10:56 file.txt
这有帮助吗?
cp file.txt file2.txt && ls -l
这是输出:
-rw-r–r– 1 human human 8 Sep 10 10:56 file.txt
-rw-r–r– 1 human human 8 Sep 10 10:56 file2.txt
这有帮助吗?
rm file.txt && ls -l
这是输出:
-rw-r--r-- 1 human human 0 Sep 10 10:56 file2.txt
head -n 5 /proc/meminfo
这是输出:
MemTotal: 164928 kB
MemFree: 140604 kB
Buffers: 48 kB
Cached: 19768 kB
SwapCached: 0 kB
https://github.com/facebookresearch/xformers↩︎
https://github.com/facebookresearch/metaseq/tree/main/projects/OPT/chronicles↩︎
| 学科 | 领域 | GPT-3 | Gopher | Chinchilla | LLaMA | LLaMA-I | |||
|---|---|---|---|---|---|---|---|---|---|
| 175B | 280B | 70B | 7B | 13B | 33B | 65B | 65B | ||
| 抽象代数 | STEM | 30.0 | 25.0 | 31.0 | 29.0 | 34.0 | 32.0 | 34.0 | 31.0 |
| 解剖学 | STEM | 48.0 | 56.3 | 70.4 | 37.0 | 45.9 | 51.9 | 57.8 | 62.2 |
| 天文学 | STEM | 49.0 | 65.8 | 73.0 | 33.6 | 46.1 | 61.8 | 72.4 | 81.6 |
| 商业伦理 | 其他 | 46.0 | 70.0 | 72.0 | 40.0 | 45.0 | 56.0 | 57.0 | 72.0 |
| 临床知识 | 其他 | 48.0 | 67.2 | 75.1 | 35.1 | 45.7 | 57.4 | 65.3 | 69.1 |
| 大学生物学 | STEM | 45.0 | 70.8 | 79.9 | 37.5 | 45.1 | 58.3 | 68.8 | 81.9 |
| 大学化学 | STEM | 26.0 | 45.0 | 51.0 | 32.0 | 30.0 | 45.0 | 50.0 | 45.0 |
| 大学计算机科学 | STEM | 46.0 | 49.0 | 51.0 | 29.0 | 39.0 | 45.0 | 47.0 | 51.0 |
| 大学数学 | STEM | 34.5 | 37.0 | 32.0 | 33.0 | 32.0 | 40.0 | 35.0 | 36.0 |
| 大学医学 | 其他 | 48.0 | 60.1 | 66.5 | 30.6 | 42.8 | 52.0 | 54.3 | 63.0 |
| 大学物理 | STEM | 28.0 | 34.3 | 46.1 | 26.5 | 18.6 | 28.4 | 36.3 | 46.1 |
| 计算机安全 | STEM | 57.0 | 65.0 | 76.0 | 45.0 | 65.0 | 66.0 | 79.0 | 79.0 |
| 概念物理学 | STEM | 36.5 | 49.4 | 67.2 | 36.6 | 41.3 | 51.5 | 59.6 | 66.4 |
| 计量经济学 | 社会科学 | 33.0 | 43.0 | 38.6 | 23.7 | 27.2 | 35.1 | 40.4 | 52.6 |
| 电气工程 | STEM | 50.0 | 60.0 | 62.1 | 26.9 | 40.7 | 49.7 | 53.8 | 60.7 |
| 初等数学 | STEM | 30.0 | 33.6 | 41.5 | 24.3 | 24.9 | 36.0 | 37.8 | 42.9 |
| 形式逻辑 | 人文学科 | 29.0 | 35.7 | 33.3 | 27.0 | 33.3 | 34.1 | 44.4 | 47.6 |
| 全球事实 | 其他 | 37.0 | 38.0 | 39.0 | 29.0 | 35.0 | 35.0 | 39.0 | 40.0 |
| 高中生物 | STEM | 48.0 | 71.3 | 80.3 | 34.5 | 52.6 | 67.7 | 73.9 | 82.9 |
| 高中化学 | STEM | 33.0 | 47.8 | 58.1 | 28.1 | 28.6 | 41.9 | 40.4 | 44.8 |
| 高中计算机科学 | STEM | 39.0 | 54.0 | 58.0 | 31.0 | 48.0 | 60.0 | 67.0 | 73.0 |
| 高中欧洲历史 | 人文学科 | 54.0 | 72.1 | 78.8 | 44.2 | 61.8 | 73.9 | 78.8 | 86.1 |
| 高中地理 | 社会科学 | 58.0 | 76.8 | 86.4 | 34.3 | 54.6 | 70.7 | 77.8 | 87.9 |
| 高中政府与政治 | 社会科学 | 58.0 | 83.9 | 91.2 | 44.6 | 66.3 | 82.9 | 88.1 | 92.8 |
| 高中宏观经济学 | 社会科学 | 40.5 | 65.1 | 70.5 | 35.4 | 44.4 | 56.9 | 65.9 | 69.2 |
| 高中数学 | STEM | 28.0 | 23.7 | 31.9 | 24.8 | 23.7 | 27.0 | 34.4 | 37.0 |
| 高中微观经济学 | 社会科学 | 42.0 | 66.4 | 77.7 | 31.9 | 47.5 | 55.5 | 68.9 | 78.6 |
| 高中物理 | STEM | 28.0 | 33.8 | 36.4 | 26.5 | 28.5 | 35.8 | 37.1 | 41.7 |
| 高中心理学 | 社会科学 | 61.0 | 81.8 | 86.6 | 47.3 | 60.9 | 76.2 | 82.2 | 87.9 |
| 高中统计学 | STEM | 30.5 | 50.0 | 58.8 | 35.2 | 30.1 | 45.4 | 58.3 | 59.3 |
| 高中美国历史 | 人文学科 | 53.0 | 78.9 | 83.3 | 39.7 | 58.3 | 77.9 | 83.8 | 90.7 |
| 高中世界历史 | 人文学科 | 56.0 | 75.1 | 85.2 | 40.9 | 66.2 | 79.3 | 83.1 | 89.0 |
| 人类衰老 | 其他 | 50.0 | 66.4 | 77.6 | 40.8 | 54.7 | 67.7 | 69.5 | 72.2 |
| 人类性学 | 社会科学 | 54.0 | 67.2 | 86.3 | 36.6 | 58.8 | 64.1 | 77.9 | 87.0 |
| 国际法 | 人文学科 | 55.5 | 77.7 | 90.9 | 51.2 | 62.8 | 72.7 | 79.3 | 87.6 |
| 法理学 | 人文学科 | 55.0 | 71.3 | 79.6 | 38.9 | 51.9 | 70.4 | 73.2 | 85.2 |
| 逻辑谬误 | 人文学科 | 48.0 | 72.4 | 80.4 | 39.3 | 52.8 | 68.1 | 77.3 | 80.4 |
| 机器学习 | STEM | 31.0 | 41.1 | 41.1 | 23.2 | 31.3 | 39.3 | 49.1 | 52.7 |
| 管理 | 其他 | 56.0 | 77.7 | 82.5 | 35.0 | 66.0 | 77.7 | 82.5 | 83.5 |
| 市场营销 | 其他 | 60.0 | 83.3 | 89.7 | 46.6 | 71.8 | 83.3 | 85.9 | 92.7 |
| 医学遗传学 | 其他 | 40.0 | 69.0 | 69.0 | 43.0 | 52.0 | 67.0 | 67.0 | 68.0 |
| 杂项 | 其他 | 60.0 | 75.7 | 84.5 | 42.4 | 65.4 | 78.5 | 82.1 | 84.3 |
| 道德争议 | 人文学科 | 44.5 | 66.8 | 77.5 | 40.2 | 50.9 | 66.2 | 72.3 | 76.9 |
| 道德情景 | 人文学科 | 26.0 | 40.2 | 36.5 | 24.3 | 30.1 | 38.2 | 48.9 | 55.9 |
| 营养学 | 其他 | 47.0 | 69.9 | 77.1 | 37.6 | 51.6 | 62.8 | 67.3 | 74.5 |
| 哲学 | 人文学科 | 51.0 | 68.8 | 79.4 | 39.9 | 54.0 | 66.2 | 74.0 | 79.1 |
| 史前史 | 人文学科 | 53.0 | 67.6 | 81.2 | 36.1 | 51.5 | 67.0 | 75.3 | 79.0 |
| 专业会计 | 其他 | 33.0 | 44.3 | 52.1 | 25.9 | 35.8 | 43.6 | 46.5 | 56.0 |
| 专业法律 | 人文学科 | 34.5 | 44.5 | 56.5 | 30.2 | 38.0 | 45.9 | 49.1 | 54.4 |
| 专业医学 | 其他 | 36.0 | 64.0 | 75.4 | 44.5 | 50.4 | 54.0 | 61.4 | 70.6 |
| 专业心理学 | 社会科学 | 44.5 | 68.1 | 75.7 | 35.1 | 47.7 | 62.9 | 65.7 | 71.4 |
| 公共关系 | 社会科学 | 48.0 | 71.8 | 73.6 | 40.9 | 60.9 | 67.3 | 73.6 | 74.6 |
| 安全研究 | 社会科学 | 52.0 | 64.9 | 75.9 | 31.8 | 53.9 | 65.3 | 71.8 | 77.6 |
| 社会学 | 社会科学 | 53.0 | 84.1 | 91.0 | 46.8 | 61.2 | 78.6 | 78.6 | 88.1 |
| 美国外交政策 | 社会科学 | 69.0 | 81.0 | 92.0 | 46.0 | 80.0 | 83.0 | 86.0 | 87.0 |
| 病毒学 | 其他 | 46.0 | 47.0 | 53.6 | 30.1 | 43.4 | 50.0 | 53.0 | 57.8 |
| 世界宗教 | 人文学科 | 55.0 | 84.2 | 87.7 | 50.9 | 67.8 | 81.3 | 81.3 | 84.2 |
| 人文学科 | 40.6 | 56.2 | 63.6 | 34.0 | 45.0 | 55.8 | 61.8 | 67.4 | |
| STEM | 36.7 | 47.4 | 54.9 | 30.5 | 35.8 | 46.0 | 51.7 | 56.6 | |
| 社会科学 | 50.5 | 71.9 | 79.3 | 38.3 | 53.8 | 66.7 | 72.9 | 79.2 | |
| 其他 | 49.0 | 66.1 | 73.9 | 38.1 | 53.3 | 63.4 | 67.4 | 72.6 | |
| 全部 | 43.9 | 60.0 | 67.6 | 35.1 | 46.9 | 57.8 | 63.4 | 68.9 | |