I · 生成式 AI 基础

探索和比较不同的大型语言模型(LLMs)

微软《Generative AI for Beginners》 · 第 02 课 · 中文翻译 · 本地镜像

探索和比较不同的大型语言模型

点击上方图片观看本课视频

在上一课中,我们了解了生成式人工智能如何改变技术格局,大型语言模型(LLMs)如何工作,以及像我们这样的初创企业如何将它们应用于实际用例并实现增长!在本章中,我们将比较和对比不同类型的大型语言模型(LLMs),以了解它们的优缺点。

我们初创企业旅程的下一步是探索当前LLM的格局,并了解哪些适合我们的用例。

介绍

本课将涵盖:

学习目标

完成本课后,你将能够:

了解不同类型的LLMs

根据架构、训练数据和用例,LLMs可以有多种分类。了解这些差异将帮助我们的初创企业为场景选择合适的模型,并理解如何测试、迭代及提升性能。

LLM模型种类繁多,选择哪种模型取决于你的使用目标、数据情况、预算以及更多因素。

根据你是否想使用模型进行文本、音频、视频、图像生成等不同任务,你可能会选择不同类型的模型。

选择模型即意味着获得一些基础能力,但可能还不够。通常你有企业特定数据需要以某种方式告知LLM,这里有几种不同做法,稍后章节会详细介绍。

基础模型与LLMs的区别

基础模型一词由斯坦福研究人员提出,定义为满足以下部分标准的AI模型:

基础模型与LLMs的区别

图片来源:基础模型与大型语言模型详解 | 作者 Babar M Bhatti | Medium

为进一步说明这一区别,我们以ChatGPT为例。早期版本的ChatGPT使用GPT-3.5作为基础模型,OpenAI随后利用聊天专用数据和对齐技术,生成针对对话场景(如聊天机器人)性能更优的调优版本。现代AI服务通常会在多个模型变体间切换,因此服务名称与底层模型名称并不总是一致。

基础模型

图片来源:2108.07258.pdf (arxiv.org)

开权重/开源模型与专有模型

另一种分类LLMs的方式是按其是否开权重、开源,或是专有模型。

开源和开权重模型提供模型工件供检查、下载或定制,但许可证各异。有的是完全开源,有的则为带使用限制的开权重模型。当企业需要更多掌控部署、数据本地化、成本或定制化时,这类模型很有用。但使用前务必审查许可证条款、服务成本、维护、安全更新及评估质量等。示例包括Meta Llama 4、部分Mistral模型及许多托管在Hugging Face上的模型。

专有模型由供应商拥有和托管,通常针对托管生产环境进行了优化,能提供强力支持、安全系统、工具集成和规模扩展。不过客户通常无法查看或修改模型权重,且需审查供应商的隐私、数据保留、合规和可接受使用政策条款。示例包括OpenAI模型Google GeminiAnthropic Claude

嵌入模型与图像生成模型及文本与代码生成模型

LLM还可以根据其生成的输出类型进行分类。

嵌入模型是一类将文本转换为数值形式(称为嵌入)的模型,嵌入是输入文本的数值表示。嵌入使机器更容易理解词语或句子之间的关系,可作为其他模型的输入,如分类模型或聚类模型,这些模型在处理数值数据时性能更佳。嵌入模型通常用于迁移学习,即先针对任务数据丰富的代理任务训练模型,随后将模型权重(嵌入)重用于其他下游任务。此类别示例为OpenAI嵌入模型

嵌入

图像生成模型是一类用于生成图像的模型,常用于图像编辑、合成及转换。此类模型通常基于大规模图像数据集训练,如LAION-5B,可生成新图像或通过修补、高分辨率增强、上色等技术编辑现有图像。示例包含GPT图像模型Stable Diffusion模型、Imagen模型等。

图像生成

文本与代码生成模型是一类生成文本或代码的模型,常用于文本摘要、翻译和问答。文本生成模型通常在大规模文本数据集上训练,如BookCorpus,能生成新文本或解答问题。代码生成模型如CodeParrot则在大规模代码库(例如GitHub)上训练,能生成新代码或修复现有代码中的Bug。

文本与代码生成

编码器-解码器架构与仅解码器架构

讲述不同LLM架构类型时,我们用一个比喻来说明。

假设你的经理给你布置了一个任务,要你出一套学生测验题。你有两位同事,一个负责出题内容,另一个负责审阅。

出题者就像仅解码器模型:他们能看到话题,认知你已写内容,然后基于上下文继续生成内容。他们擅长写出引人入胜且信息丰富的内容,但如果任务仅仅是分类、检索或编码信息,他们可能不是最佳选择。仅解码器模型家族包括GPT和Llama模型。

审阅者就像仅编码器模型,他们查看已写的课程和答案,理解二者的联系和上下文,但不擅长生成内容。仅编码器模型的例子是BERT。

设想还有一个既能出题又能审阅的同事,这就是编码器-解码器模型。典型示例为BART和T5。

服务与模型的区别

接下来,我们谈谈服务和模型的区别。服务是云服务提供商提供的产品,通常是模型、数据及其他组件的组合。模型是服务的核心组件,通常是基础模型,例如大型语言模型。

服务通常针对生产环境优化,使用起来比模型更容易,常通过图形用户界面实现。然而,服务不一定永久免费,通常需要订阅或付费,以换取使用服务方的设备和资源、优化费用和轻松扩展的优势。服务示例为Azure OpenAI Service,它采用按需付费计费模式,即用户根据使用量付费,且提供企业级安全和负责任的AI框架,基于模型能力之上。

模型则是神经网络工件:参数、权重、架构、分词器及支持配置。若要在本地或专用环境运行模型,则需要合适硬件、服务基础设施、监控及兼容的开源/开权重许可或商业许可。开权重模型如Llama 4或Mistral可以自行托管,但仍需计算资源及运维经验。

如何在Azure上测试并迭代不同模型,以了解性能表现

一旦我们的团队探索了当前的大型语言模型(LLM)领域,并为他们的场景确定了一些良好候选,下一步就是在他们的数据和工作负载上测试这些模型。这是一个通过实验和测量进行的迭代过程。 我们在之前的段落中提到的大多数模型(OpenAI 模型、开放权重模型如 Llama 4 和 Mistral,以及 Hugging Face 模型)都可以在 Microsoft Foundry Models 找到。

Microsoft Foundry,前身是 Azure AI Studio/Azure AI Foundry,是一个构建 AI 应用和代理的统一 Azure 平台。它帮助开发者管理从实验和评估到部署、监控和治理的整个生命周期。Microsoft Foundry 中的模型目录使用户能够:

Model catalog

Model card

Model benchmarks

Model fine-tuning

Model deployment

[!NOTE] 目录中的所有模型目前并非都支持微调和/或按用量付费部署。请查看模型卡以了解模型的功能和限制详情。

改进大型语言模型结果

我们与创业团队探索了不同类型的 LLM 以及一个云平台(Microsoft Foundry),它使我们能够比较不同模型,在测试数据上评估它们,提升性能,并将它们部署到推理端点。

但是,他们什么时候应考虑微调模型而不是使用预训练模型?还有哪些方法可以改进模型在特定工作负载上的性能?

企业可以使用多种方法从 LLM 中获得所需结果。部署 LLM 时,可以选择不同类型、不同训练程度的模型,具备不同的复杂性、成本和质量水平。以下是几种不同的方法:

LLMs deployment

图片来源:Four Ways that Enterprises Deploy LLMs | Fiddler AI Blog

带上下文的提示工程

预训练的大型语言模型在通用自然语言任务上表现非常好,即使仅用短提示,如待完成的句子或问题——即所谓的“零样本”学习。

然而,用户越是能够通过详细请求和示例——即上下文——来构造查询,回答就越准确、越符合用户预期。如果提示中仅包含一个示例,我们称之为“一样本”学习;如果包含多个示例,则称为“少样本”学习。 带上下文的提示工程是启动快速改进的最具成本效益的方法。

检索增强生成(RAG)

LLM 的限制在于它们只能使用训练时所用数据来生成答案。这意味着它们不了解训练后发生的事实,也无法访问非公开信息(如公司数据)。 这个问题可以通过 RAG 技术克服,RAG 通过将文档块形式的外部数据增强至提示中,考虑到提示长度限制。这由向量数据库工具支持(如 Azure Vector Search),该工具从各种预定义数据源中检索有用的数据块并将其加入提示上下文。

当企业缺乏足够的数据、时间或资源来微调 LLM,但仍希望提升特定工作负载的性能并减少幻觉、过时或 unsupported 回答的风险时,该技术极为有用。

微调模型

微调是一个利用迁移学习的方法,将模型“调整”到下游任务或解决特定问题。不同于少样本学习和 RAG,它生成一个新的模型,更新权重和偏置。它需要一组训练示例,包括单个输入(提示)及其相关输出(完成)。 如果满足以下条件,这将是首选方法:

训练模型

从头训练一个 LLM 毫无疑问是最困难和最复杂的方法,需要大量数据、熟练资源和适当的计算能力。只有在企业拥有领域特定用例和大量领域中心数据的情况下,才应考虑该选项。

知识检测

哪种方法有助于改进 LLM 的完成结果?

  1. 带上下文的提示工程
  2. RAG
  3. 微调模型

答案:三种方法都有效。先从提示工程和上下文开始,实现快速改进;当模型需要最新事实或私有业务数据时,使用 RAG;当拥有足够高质量的示例且需要模型始终遵循任务、格式、语调或领域模式时,选择微调。

🚀 挑战

阅读更多关于如何为您的业务使用 RAG

做得很好,继续学习

完成本课后,请查看我们的 生成式 AI 学习合集,继续提升生成式 AI 知识!

继续前往第 3 课,我们将探讨如何 负责任地构建生成式 AI


免责声明: 本文件由 AI 翻译服务 Co-op Translator 翻译完成。尽管我们力求准确,但请注意,自动翻译可能包含错误或不准确之处。原始语言版文件应视为权威来源。对于重要信息,建议使用专业人工翻译。我们对因使用本翻译而产生的任何误解或误释不承担责任。