09 大语言模型(LLM)演进与 Prompt 入门

09 大语言模型(LLM)演进与 Prompt 入门

系列文章目录


前言

走到这一篇,我们终于来到了 NLP 最火的前沿------大语言模型(Large Language Model, LLM)

2022 年底 ChatGPT 横空出世,5 天用户破百万,2 个月破亿,成为史上增长最快的应用。从那以后,"大模型""Prompt""Agent"这些词频繁出现在我们眼前。

站在整个专栏的视角看:前 8 篇我们讲了 NLP 的基础(表示、序列模型、Transformer、预训练),这一篇我们将把这些知识"串"起来,理解 LLM 是怎么来的,以及普通人如何用 Prompt(提示词) 驾驭它。

一句话结论:大语言模型是"Transformer + 海量数据 + 规模效应 + 人类对齐"的产物;Prompt 是与大模型高效对话的"指令语言"。


1. 从 GPT 到大语言模型:关键的三步跃迁

回顾上一篇,GPT 已经具备"预测下一个词"的能力。但要变成今天无所不能的 LLM,还需要三把"钥匙":

第一把钥匙:规模效应(Scaling)

GPT 系列不断堆大参数和数据:

模型 年份 参数量 关键意义
GPT-1 2018 1.1 亿 验证预训练范式
GPT-2 2019 15 亿 零样本能力初现
GPT-3 2020 1750 亿 涌现能力,少样本学习
ChatGPT 2022 --- RLHF 对齐,对话体验质变
GPT-4 2023 万亿级(推测) 多模态、更强推理

💡 关键概念:涌现(Emergence)------当模型规模超过某个临界点后,会突然"冒出来"很多小模型不具备的能力(如逻辑推理、代码生成、翻译、创意写作),这是大模型最迷人的地方。

第二把钥匙:人类反馈对齐(RLHF)

只是"预测下一个词"的模型会一本正经地胡说八道(幻觉)。ChatGPT 的突破在于引入了 RLHF(基于人类反馈的强化学习)

复制代码
步骤1:让模型生成多个回答
步骤2:人类对回答排序(哪个更好)
步骤3:用排序训练"奖励模型"
步骤4:用奖励模型 + 强化学习微调大模型,让它学会"讨人喜欢"

RLHF 让模型从"会说话"进化到"会好好说话"------更安全、更有用、更符合人类偏好。

第三把钥匙:指令微调(Instruction Tuning)

用海量"指令-回答"对微调模型,让它学会遵循人类的指令。这就是为什么我们能用自然语言指挥大模型干活。


2. 什么是 Prompt(提示词)

2.1 核心思想

Prompt(提示词/提示工程) 就是你输入给大模型的那段指令文字 。因为大模型是通过"理解指令"来工作的,所以怎么问,直接决定了答得好不好

Prompt 就是和 AI 对话的"编程语言"------你不是写代码,而是用文字"编写"模型的输出。

2.2 为什么 Prompt 这么重要

对比 传统 NLP 大模型时代
开发方式 训练/微调模型 写 Prompt(可零代码)
数据需求 大量标注数据 无需标注(提示词即可)
迭代速度 慢(重新训练) 快(改 Prompt 即可)

对于绝大多数应用场景,"写一个好 Prompt" 比 "微调一个模型" 更快、更便宜、更实用


3. Prompt 的万能公式

一个高质量的 Prompt,通常包含以下要素:

复制代码
[角色/背景] + [任务目标] + [具体要求] + [输出格式] + [示例]

3.1 角色设定(Role)

给模型设定一个身份,能显著提升输出质量:

复制代码
❌ 差:"帮我写一段话介绍Python"
✅ 好:"你是一名资深Python技术讲师,请面向零基础学员写一段话介绍Python"

3.2 任务明确(Task)

说清楚"要做什么":

复制代码
❌ 模糊:"帮我处理这段文字"
✅ 明确:"请将下面这段文字压缩成50字以内的摘要,保留关键信息"

3.3 输出格式(Format)

指定输出结构,便于使用:

复制代码
请用以下格式输出:
- 优点:
- 缺点:
- 改进建议:

3.4 给出示例(Few-shot)

给 1-2 个示例,模型会"照葫芦画瓢":

复制代码
请判断以下评论的情感(正面/负面):
例1:这家店服务态度特别好 → 正面
例2:等了两个小时还没上菜 → 负面
例3:味道一般,价格偏贵 → ?

4. 常用 Prompt 技巧

技巧 说明 示例
角色扮演 设定专家身份 "你是一名法律顾问......"
分步思考 让模型一步步推理 "请先分析,再得出结论"(Chain-of-Thought)
约束字数 控制输出长度 "控制在100字以内"
少样本示例 给示例让模型模仿 见上方 3.4
追问细化 一轮对话逐步深入 "还不够具体,请举例说明"
否定约束 明确不要什么 "不要使用专业术语,用大白话"

💡 进阶技巧:CoT(思维链)------当模型回答复杂问题时,引导它"一步一步想",能显著提升准确率。这是 Prompt 工程中最著名的技巧之一。

复制代码
问题:一家商店有12个苹果,卖出5个,又进了8个,请问现在有多少个?
回答:请逐步思考:
1. 原来有12个苹果
2. 卖出5个后:12 - 5 = 7 个
3. 又进了8个后:7 + 8 = 15 个
所以现在有15个苹果。

5. 用 Python 调用大模型(OpenAI 风格 API)

如今,几乎所有大模型(OpenAI、DeepSeek、通义千问等)都提供风格统一的 API。下面是一个标准调用模板:

复制代码
import os
from openai import OpenAI
​
client = OpenAI(
    api_key=os.getenv("API_KEY"),       # 从环境变量读取密钥
    base_url="https://api.openai.com/v1"  # 不同模型替换为对应 base_url
)
​
response = client.chat.completions.create(
    model="gpt-4o-mini",                # 选择模型
    messages=[
        {"role": "system", "content": "你是一名中文写作助手"},
        {"role": "user", "content": "请用三句话介绍大语言模型"},
    ],
    temperature=0.7,                     # 控制随机性,0-1之间
)
​
print(response.choices[0].message.content)

常用参数说明

参数 作用 建议
model 选择模型 按任务和预算选择
messages 对话消息(system/user/assistant) system 设角色
temperature 控制输出随机性 0=稳定,1=更有创造性
max_tokens 输出最大长度 按需设置
stream 是否流式输出 长回答建议开启

⚠️ 提示 :国内使用推荐 DeepSeek、通义千问、豆包等模型,API 风格与 OpenAI 兼容,只需更换 base_urlmodel 名。


6. 大模型能做什么(NLP 视角)

回到我们整个专栏的主线,看看大模型覆盖了哪些之前学过的任务:

传统 NLP 任务 大模型时代的做法
文本分类 直接写 Prompt:"请判断情感"
命名实体识别 写 Prompt:"请抽取人名、地名、机构名"
机器翻译 直接说:"翻译成英文"
文本摘要 直接说:"帮我总结要点"
问答系统 直接对话提问
对话系统 本身就是对话模型

大模型把很多传统 NLP 任务的门槛降到了"写 Prompt" ,但这并不意味着基础不重要------恰恰相反,理解底层的表示、序列、注意力机制,才能更好地驾驭大模型、诊断问题、微调模型。这就是本专栏铺垫 8 篇基础的意义。


7. 大模型的局限与挑战

  1. 幻觉(Hallucination):一本正经地编造不存在的"事实"

  2. 上下文窗口有限:一次能处理的文本长度有限

  3. 成本与延迟:大模型推理成本高、响应慢

  4. 知识截止:训练数据有时间限制,需要配合检索(RAG)

  5. 安全性:可能被诱导生成有害内容(需对齐与防护)


总结

这一篇我们站在了 NLP 的前沿:

  • LLM 三大跃迁:规模效应(涌现)、人类对齐(RLHF)、指令微调

  • Prompt 是什么:与大模型对话的"指令语言"

  • Prompt 万能公式:角色 + 任务 + 要求 + 格式 + 示例

  • 常用技巧:角色扮演、CoT 思维链、少样本、约束输出

  • API 调用:几行代码调用大模型

  • 大模型局限:幻觉、上下文窗口、成本、安全

下一篇,也是本专栏的最后一篇,我们将把前面 9 篇的知识全部用起来,从零完成一个完整的情感分析项目,跑通"数据 → 预处理 → 向量化 → 训练 → 评估 → 部署"的全流程。

📌 下篇预告10 NLP 实战:情感分析项目全流程 ------ 专栏收官实战。


参考资料

  • Brown et al. Language Models are Few-Shot Learners (GPT-3), 2020

  • Ouyang et al. Training language models to follow instructions with human feedback (InstructGPT/RLHF), 2022

  • OpenAI Prompt Engineering Guide:https://platform.openai.com/docs/guides/prompt-engineering

  • Wei et al. Chain-of-Thought Prompting Elicits Reasoning in Large Language Models, 2022

相关推荐
刘广睿1 小时前
AI 配音怎么做?语音合成 TTS 技术选型与本地部署实战(edge-tts / GPT-SoVITS / CosyVoice / Piper)
人工智能·音视频·效率工具·语音合成·tts
一见已难忘1 小时前
鸿蒙 AI 竞技场:用蓝耘 MaaS 一个 Key 让五个大模型同台 PK,Token 消耗实测差 5 倍
人工智能
双翌视觉1 小时前
曝光调不对,算法全白费:机器视觉的曝光三态解析
人工智能·算法·计算机视觉
小柯南敲键盘1 小时前
跨马翻译AI工具,批量图片视频翻译与智能抠图一站式解决
人工智能·python·音视频
Csvn1 小时前
第 17 章 评估与自检 Evaluation
人工智能·aigc·agent
ShallWeL1 小时前
RAG 向量索引重建与回归
人工智能·agent·知识库·工作流·rag
HIT_Weston1 小时前
206、【Agent】【OpenCode】TUI 内部:装配层与 context 工厂
人工智能·agent·opencode
IT_陈寒1 小时前
Java字符串判等踩坑记:==和equals真的不能乱用
前端·人工智能·后端
生态学者1 小时前
香港理工大学Nature Communications:沿海塑料际古菌组特征及生态影响
大数据·人工智能·算法·r语言·微信公众平台