开源社区分水岭：Meta大模型Llama 3发布，参数最高或达4000亿

访客 2024-04-19 15:10:57 6488 抢沙发

默认

为了保持公司在AI（人工智能）开源大模型领域的地位，社交巨头Meta推出了旗下最新开源模型。

当地时间4月18日，Meta在官网上宣布公布了旗下最新大模型Llama 3。目前，Llama 3已经开放了80亿（8B）和700亿（70B）两个小参数版本，上下文窗口为8k。Meta表示，通过使用更高质量的训练数据和指令微调，Llama 3比前代Llama 2有了“显著提升”。

未来，Meta将推出Llama 3的更大参数版本，其将拥有超过4000亿参数。Meta也将在后续为Llama 3推出多模态等新功能，包括更长的上下文窗口，以及Llama 3研究论文。

Meta在公告中写道：“通过Llama 3，我们致力于构建能够与当今最优秀的专有模型相媲美的开源模型。我们想处理开发者的反馈，提高Llama 3 的整体实用性，同时，继续在负责地使用和部署LLM（大型语言模型）方面发挥领先作用。”

18日当天，Meta股价（Nasdaq：META）收于每股501.80美元，涨1.54%，总市值1.28万亿美元。

“目前市场上最好的开源大模型”

据Meta介绍，Llama 3已经在多种行业基准测试上展现了最先进的性能，提供了包括改进的推理能力在内的新功能，是目前市场上最好的开源大模型。

在架构层面，Llama3选择了标准的仅解码（decoder-only）式Transformer架构，采用包含128K token词汇表的分词器。Llama 3在Meta自制的两个24K GPU集群上进行预训练，使用了超过15T的公开数据，其中5%为非英文数据，涵盖30多种语言，训练数据量是前代Llama 2的七倍，包含的代码数量是Llama 2的四倍。

根据Meta的测试结果，Llama 3 8B模型在MMLU、GPQA、HumanEval等多项性能基准上均超过了Gemma 7B和Mistral 7B Instruct，70B模型则超越了名声在外的闭源模型Claude 3的中间版本Sonnet，和谷歌的Gemini Pro 1.5相比三胜两负。

Llama 3在多项性能基准上表现出众。来源：Meta官网

在常规数据集之外，Meta还致力于优化Llama 3在实际场景中的性能，为此专门研发了一套高质量的人工测试集。该测试集包含1800条数据，涵盖了寻求建议、封闭式问题回答、头脑风暴、编码、写作等12个关键用例，并对开发团队保密。

在这套测试集中，从结果来看，Llama 3的成绩大幅超越了Llama 2，也胜过了Claude 3 Sonnet、Mistral Medium和GPT-3.5这些知名模型。

Llama 3在人工测试集上取得优异成绩。来源：Meta官网

而Llama 3的400B+模型虽然仍在训练中，Meta也展现了其部分测试成果，似乎旨在对标Claude 3的最强版本Opus。不过，Meta没有公布Llama 3更大参数模型和GPT-4等同规格选手的对比成果。

仍在训练中的Llama 3的400B+模型。来源：Meta官网

Llama 3模型即将在亚马逊AWS、Databricks、谷歌云、Hugging Face、Kaggle、IBM WatsonX、亚马逊Azure、英伟达NIM和Snowflake上被提供给开发者，并获得 AMD、AWS、戴尔、英特尔、英伟达和高通提供的硬件平台支持。为了让Llama 3被负责地开发，Meta还将提供新的信任和安全工具，包括Llama Guard 2、Code Shield和CyberSec Eval 2。

同时，Meta发布了基于Llama3的官方Web版本Meta AI。目前，该平台仍处于初级阶段，只有对话和绘画两大功能。用户使用对话功能无需通过注册，使用绘画功能则需要用户注册登录账号。

为开源社区注入活力

Meta的AI道路向来与开源紧密相连，Llama 3一经推出，受到了开源社区的热烈欢迎。

虽然也有一些对于Llama 3的8k上下文窗口过小的吐槽，但Meta方面表示，很快就会扩充Llama 3的上下文窗口。电子邮件初创企业Otherside AI的CEO兼联合创始人马特·舒默（Matt Shumer）对此也保持乐观，并表示：“我们正在走入一个新世界，在这里，GPT-4级别的模型是开源并可以免费访问的。”

英伟达高级研究科学家范麟熙（Jim Fan）表示，即将推出的更大参数Llama 3模型标志着开源社区的一个“分水岭”，可以改变许多学术研究和初创企业的决策方式，“预计整个生态系统中的活力将会激增”。

不过，值得注意的是，Meta没有公布Llama 3的训练数据，只称其全部来自公开数据。而从严格意义上来说，所谓的“开源”软件应当在开发与分发的过程中，将包括软件产品的源代码、训练数据等内容对公众完全开放。此前，数据公司Databricks发布的“最强开源大模型”DBRX除了拥有远超出普通计算机的标准配置外，也存在这一问题。

Llama 3的推出紧跟在Meta自研芯片取得进步之后。就在上周，Meta公布了自主研发芯片MTIA的最新版本。MTIA是Meta专门为AI训练和推理工作设计的定制芯片系列。和去年五月官宣的Meta第一代AI推理加速器MTIA v1相比，最新版本芯片在性能上有显著提升，专为Meta旗下社交软件的排名和推荐系统而设计。分析指出，Meta的目标是降低对英伟达等芯片厂商的依赖。

标签：模型开源