📚前言
系统学习提示词,内容大纲如下:
前导课程:
AI提示词工程(进阶)第7课:角色设定与身份模拟-CSDN博客
AI提示词工程(进阶)第9课:思维链提示(Chain of Thought)-CSDN博客
AI提示词工程(进阶)第10课:思维树与元提示(ToT & Meta Prompting)-CSDN博客
AI提示词工程(进阶)第12课:多轮对话与上下文管理-CSDN博客
AI提示词工程(进阶)第13课:提示词安全与边界-CSDN博客
第14课:主流模型特性差异与工具选型(进阶阶段总结)
📌 一句话目标:全面了解国内外主流AI模型的能力边界和特性差异,学会根据任务特点选择最合适的模型与工具,为进阶阶段画上圆满句号。
💬 第13课咱学会了"安全与边界"。第14课是进阶阶段的"收官之课"------主流模型特性差异与工具选型。学了这么多技巧,你肯定想问:"这些技巧在哪个模型上效果最好?"这节课咱就来回答这个问题。信息量会比较大,但别慌,咱会给你一套"拿来就用"的选型指南。
🖥️ 开场:为什么"选对模型"和"写对提示词"一样重要?
前13课,咱一直在讲"怎么写提示词"。
但你有没有想过------同样的提示词,在不同模型上,效果可能天差地别。
- 让Kimi读50页论文,它游刃有余;让豆包读,可能"内存不足"
- 让DeepSeek写代码,它思路清晰;让文心一言写,可能偏"公文风"
- 让Claude做Agent开发,它得心应手;让豆包做,可能力不从心
提示词是"1",模型是"0"------但不同的"0",价值不一样。
这节课,咱就来建立一张"模型能力地图":
- 国内主流模型各自擅长什么?
- 国际主流模型有什么优势?
- 什么任务该用哪个模型?
- 怎么用对比实验,找到最适合你的组合?
💬 一句话先记住:没有"最好的模型",只有"最合适的模型"。 这节课的目标,就是帮你建立"按任务选模型"的判断力。
一、国内主流模型能力图谱
💬 这块信息量大,看着眼花。但不用全记住------先看"核心优势"和"适合场景"两列,其他列用的时候回来查。
📌 国内八大模型一览
| 模型 | 厂商 | 核心优势 | 上下文窗口 | 适合场景 |
|---|---|---|---|---|
| DeepSeek V3/V4 | 深度求索 | 代码能力国产天花板,数学推理强,开源免费 | 128K / V4支持1M | 程序员、算法开发、私有化部署 |
| 通义千问 Qwen3 | 阿里 | 全栈能力最强,多模态成熟,阿里生态无缝衔接 | 约1M | 企业级应用、超长文档、全模态 |
| Kimi K3 | 月之暗面 | 长文本王者,文档理解与逻辑推理极强 | 200万字无损 | 学术、法律、论文阅读、合同审查 |
| 文心一言 ERNIE 4.5 | 百度 | 搜索增强第一,中文润色细腻,知识时效性强 | 128K | 办公创作、公文报告、信息检索 |
| 豆包 5.0 Pro | 字节跳动 | 用户体验最佳,零门槛,多模态响应快 | 64K内 | 普通用户、内容创作、短视频文案 |
| 智谱清言 GLM-4.6 | 智谱AI | 原生融合Function Call,开源,学术友好 | 128K | Agent开发、多模态、私有化 |
| 讯飞星火 V4.5 | 科大讯飞 | 语音交互最强,中文数学突出 | 64K内 | 教育、医疗、语音场景 |
| 腾讯混元 | 腾讯 | 与微信/腾讯生态联动,CodeBuddy双引擎 | --- | 微信生态、企业协同 |
💡 各模型的"提示词工程特点"
| 模型 | 提示词工程特点 |
|---|---|
| DeepSeek | 理工科风格,逻辑强但文采一般,技术文档提示词友好,感性创作需额外引导 |
| 通义千问 | 支持全文档一次性解析,长距离逻辑关联略弱于Kimi |
| Kimi | 超长上下文+强文档逻辑,适合整篇资料塞入提示词做精读,多轮对话不失忆 |
| 文心一言 | 中文语义理解精准,公文/文言文/网络梗理解到位,中文场景提示词效果最佳 |
| 豆包 | 大白话交互零障碍,懂中国语境,口语化内容提示词最出彩 |
| 智谱清言 | 开源可深度定制,GLM-4.6V首次将Function Call原生融入视觉模型 |
| 讯飞星火 | 语音输入提示词友好,教育场景适配度高 |
| 腾讯混元 | 微信小程序开发场景首选 |
💬 看出门道了吗?每个模型都有自己的"性格"------DeepSeek像理工男,文心一言像笔杆子,豆包像邻家朋友。 写提示词时,要"顺着模型的性格来"------让理工男写代码,让笔杆子写公文,让邻家朋友写口语化内容。
二、国际主流模型能力图谱
💬 这块是"国际视野",国内用户可能用得少,但了解它们的能力边界,能帮你判断"什么时候该用国际模型"。
📌 国际五大模型一览
| 模型 | 厂商 | 核心优势 | 上下文窗口 | 适合场景 |
|---|---|---|---|---|
| GPT-4.1 / o3 | OpenAI | 编码与指令遵循强,推理模型领先 | 1M / o3为200K | 复杂编程、数学推理、通用对话 |
| Claude Sonnet 4.5/4.6 | Anthropic | 编码与Agent最佳,SWE-bench领先 | 200K / 1M (Beta) | 复杂编程、Agent开发、长文档分析 |
| Gemini 2.5 Pro | 原生多模态最强,百万Token上下文 | 1M | 多模态任务、超长文档、视频处理 | |
| Llama 4 | Meta | 开源权重,MoE架构,10M上下文 | 10M (Scout) | 自托管、研究、超长上下文 |
| Mistral Large 3 | Mistral | 欧洲AI领军,Apache 2.0开源 | --- | 开源自托管、Agent工作流 |
💡 国际模型的"提示词工程特点"
| 模型 | 提示词工程特点 |
|---|---|
| GPT-4.1 | 提供专门提示词指南,diff格式遵循训练,指令遵循显著提升 |
| Claude | 程序化工具调用、Effort参数控制响应详尽度、Extended Thinking可配置 |
| Gemini | 思考预算控制思考Token数量,MCP原生SDK支持,原生音频输出 |
| Llama 4 | 开源允许自定义微调,MoE支持专家级定制 |
| Mistral | 原生函数调用和工具使用,适合推理密集型场景 |
💬 一句话记住国际模型的格局:GPT是"全能标杆",Claude是"编程Agent之王",Gemini是"多模态之王",Llama和Mistral是"开源双雄"。
三、两大关键能力对比:Function Calling 与 长上下文
💬 这节是"硬核对比",两个能力决定了"能不能做Agent"和"能处理多长的文档"。先别被术语吓到,咱用大白话讲。
📌 Function Calling(函数调用):让AI"动手干活"的能力
什么是Function Calling? 就是让AI不仅能"说话",还能"调用工具"------查数据库、发请求、操作软件。这是做Agent(智能体)的基础能力。
| 模型 | Function Calling | 说明 |
|---|---|---|
| 通义千问 Qwen3 | 原生支持 | Qwen3系列原生支持,119语种 |
| DeepSeek | 支持 | API支持,广泛适配工具链 |
| 智谱 GLM-4.6 | 原生融合 | 首次将Function Call原生融入视觉模型 |
| 文心一言 | 支持 | 通过千帆平台支持函数调用与插件 |
| 豆包 | 支持 | 火山引擎API支持 |
| Kimi | 支持 | 月之暗面API支持 |
| GPT-4.1 | 原生支持 | 与Responses API结合,Agent构建能力强 |
| Claude 4.5 | 程序化调用 | 在代码执行容器中直接调用工具 |
| Gemini 2.5 | 原生支持 | 新增MCP原生SDK支持 |
💬 大白话解释:Function Calling就是"AI的手"------能不能动手干活,就看它有没有这个能力。 想做Agent开发,优先选"原生支持"的模型(通义千问、智谱、GPT、Claude、Gemini)。
📌 长上下文能力:能"记住"多长的内容
| 模型 | 上下文长度 | 备注 |
|---|---|---|
| 通义千问 Qwen3-Max | 约1M Token | 国产容量最大,支持全文档一次性解析 |
| DeepSeek V4 | 1M Token | V4普惠百万上下文 |
| Kimi | 200万字无损 | 长文本理解质量最高 |
| GPT-4.1 | 1M Token | 全长度可靠检索 |
| Claude Sonnet 4.6 | 1M Token (Beta) | 扩展思考+长上下文推理 |
| Gemini 2.5 Pro | 1M Token | 原生多模态+长上下文 |
| Llama 4 Scout | 10M Token | 业界最大上下文窗口 |
💬 大白话解释:长上下文就是AI的"工作台大小"------工作台越大,能一次处理的文档越长。 读论文、审合同、分析长文档,优先选Kimi、通义千问、DeepSeek V4这些"大工作台"模型。
四、推理模型 vs 通用模型:两种"脑子"
💬 这节是"选型关键"------搞懂了推理模型和通用模型的区别,你就知道"复杂任务该用谁、日常任务该用谁"。
📌 两种模型的本质区别
| 维度 | 推理模型 | 通用模型 |
|---|---|---|
| 代表 | o3/o4-mini、DeepSeek-R1、Claude Extended Thinking、Gemini Deep Think | GPT-4.1、Claude Sonnet、通义千问、豆包 |
| 核心能力 | 将CoT内化为模型能力,自动分步推理 | 速度更快、成本更低,通用对话 |
| 擅长 | 数学、编程、科学推理 | 通用对话、常规任务、创意写作 |
| 代价 | 更贵、更慢、对指令简洁性要求更高 | 便宜、快、指令要求宽松 |
| 手动CoT | 不需要(自动推理) | 需要(手动CoT仍有效) |
💡 怎么选?
| 你的任务 | 推荐 |
|---|---|
| 复杂数学、科学推理 | 推理模型(o3、DeepSeek-R1) |
| 复杂编程、算法设计 | 推理模型或Claude |
| 日常对话、写作、问答 | 通用模型(豆包、通义千问、GPT-4.1) |
| 需要快速响应的任务 | 通用模型 |
| 成本敏感的任务 | 通用模型 |
💬 一句话记住:"难而重要"的任务用推理模型,"多而日常"的任务用通用模型。 别用大炮打蚊子------让推理模型写"今天天气怎么样"的回答,纯属浪费。
五、实操:四组对比实验
💬 这节是"动手选型"------光看图谱没用,得亲手试。四组实验,帮你找到最适合你的"模型组合"。
🖥️ 实验1:同一提示词,3个模型对比
推荐组合:通义千问 vs DeepSeek vs Claude
用同一条复杂提示词(比如"设计一个电商系统的微服务架构"),分别发给三个模型,对比输出。
观察重点:
- 哪个模型的方案更完整?
- 哪个模型的逻辑更清晰?
- 哪个模型的输出更符合你的需求?
🖥️ 实验2:长文本理解测试
推荐组合:Kimi vs 通义千问
将一份50页的文档分别输入Kimi和通义千问,观察超出上下文窗口时的行为差异。
观察重点:
- 哪个模型能完整处理?
- 超出窗口时,哪个模型"失忆"得更快?
- 哪个模型的摘要更准确?
🖥️ 实验3:代码生成能力
推荐组合:DeepSeek vs 通义灵码 vs Trae
用同一个编程任务(比如"写一个用户登录模块"),分别在三个工具上测试。
观察重点:
- 哪个生成的代码质量最高?
- 哪个的代码风格最规范?
- 哪个的调试辅助最好用?
🖥️ 实验4:多模态任务
推荐组合:Qwen3-VL vs GLM-4.6V vs GPT-4o
用同一张图片(比如"分析一张产品图"),分别在三个模型上测试。
观察重点:
- 哪个的图文理解最准确?
- 哪个的细节捕捉最到位?
- 哪个的响应速度最快?
💬 做完这四组实验,你就有了"自己的模型地图"------不是别人说哪个好你就用哪个,而是你自己试出来的"最佳组合"。 这个判断力,比背任何推荐表都值钱。
六、场景化选型建议:拿来就用的"选型表"
💬 这节是"终极干货"------一张表解决"我该用哪个"的问题。收藏它,以后选模型直接查。
📌 场景化选型表
| 需求 | 首选工具 | 次选工具 |
|---|---|---|
| 程序员/开发 | DeepSeek(代码天花板、开源) | 通义千问(业务开发) |
| 学生/学术 | Kimi(长文本无敌) | 通义千问(大容量) |
| 职场办公 | 文心一言(中文润色) | 豆包(PPT/纪要) |
| 内容创作 | 豆包(本土热点+剪映联动) | 通义千问(专业内容) |
| 企业商用部署 | 通义千问(生态/多模态/稳定) | DeepSeek(开源私有化) |
| Agent开发 | GLM-4.6(原生Function Call)/ 扣子Coze | Dify(私有化) |
| 编程IDE | Trae(免费最全) | 通义灵码/CodeBuddy |
| 普通用户日常 | 豆包(免费、零门槛) | 讯飞星火(语音) |
| 复杂编程/Agent | Claude Sonnet 4.5/4.6 | GPT-4.1 |
| 多模态(音频/视频) | Gemini 2.5 Pro | Qwen3-VL |
💡 三个选型原则
| 原则 | 说明 |
|---|---|
| 按任务选 | 没有万能模型,各有主场------写代码找DeepSeek,读论文找Kimi |
| 先精通一个 | 别贪多,先把一个模型用熟,再扩展 |
| 国产优先 | 国内场景首选国产模型------中文理解、合规性、性价比更好 |
💬 一句话记住选型逻辑:先看任务类型,再查选型表,最后亲手验证。 选型表是"起点",不是"终点"------你自己的实测才是"最终答案"。
七、进阶阶段总结与当下趋势
💬 这节是"收官总结"------回顾进阶阶段学了啥,再看行业往哪走。学完这节,进阶阶段就圆满毕业了。
📌 进阶阶段学了啥(第7-14课)
| 课程 | 核心技术 | 一句话回顾 |
|---|---|---|
| 第7课 | 角色设定 | 用角色卡激活AI的特定知识子集 |
| 第8课 | 少样本学习 | 用示例给AI"打样",精准控制输出 |
| 第9课 | 思维链(CoT) | 让AI一步步想,推理准确率翻倍 |
| 第10课 | 思维树(ToT)& 元提示 | 多方案对比 + 方案先行 |
| 第11课 | 结构化输出 | 让AI直接输出JSON/表格,拿来就用 |
| 第12课 | 上下文管理 | 用"锚定"让AI多轮对话不忘事 |
| 第13课 | 安全与边界 | 理解AI的安全机制,合规地用好它 |
| 第14课 | 模型选型 | 按任务选模型,找到最佳组合 |
📌 当下三大趋势
趋势1:自动提示优化普及
微软PromptWizard、APE等工具可自动生成优质提示,效果优于人工编写15%以上。
趋势2:System Prompt分层架构成为企业标配
区分系统全局提示、任务专属提示、用户交互提示,实现精细化管控。
趋势3:提示资产常态化管理
头部企业已完成提示词模板库、版本迭代、权限管控的体系化落地。
📌 国产模型的现状
国产模型在Function Calling、长上下文、多模态等能力上已全面对标国际前沿,在中文场景理解、合规性、性价比方面具备显著优势。
💬 一句话总结进阶阶段:从"会用"到"用好"的关键跨越,就是"技术组合策略 + 模型适配能力"。 你掌握了这两点,就已经超过了绝大多数AI使用者。
本课小结
📌 今天学了啥
| 知识点 | 一句话回顾 |
|---|---|
| 国内八大模型 | DeepSeek代码强、Kimi长文本、文心中文润色、豆包零门槛......各有主场 |
| 国际五大模型 | GPT全能、Claude编程Agent之王、Gemini多模态之王、Llama/Mistral开源双雄 |
| Function Calling | AI的"手"------做Agent优先选原生支持的模型 |
| 长上下文 | AI的"工作台"------读长文档选Kimi、通义千问、DeepSeek V4 |
| 推理 vs 通用 | 难而重要的用推理模型,多而日常的用通用模型 |
| 选型表 | 按任务查表,再亲手验证------选型表是起点不是终点 |
📌 三个核心认知
- 没有最好的模型,只有最合适的模型------按任务选,才是王道
- 选型判断力比背表值钱------亲手做对比实验,建立自己的"模型地图"
- 进阶阶段收官,高级阶段启程------技术组合 + 模型适配,你已经"会用"了,接下来学"用好"
课后练习
💬 练习都动手做一遍,尤其第一个------它是"建立自己模型地图"的关键一步。
📌 练习1:三模型对比
用同一条复杂提示词,分别在通义千问、DeepSeek、Claude(或你手头有的其他模型)上测试,对比输出质量。
要求: 记录每个模型的输出特点,形成你自己的"模型对比笔记"。
📌 练习2:场景选型
列出你日常的5个高频任务(写作、读文档、写代码、做表格、查资料等),对照本课的选型表,为每个任务选一个"首选模型"。
观察重点: 你的选择有没有依据?还是凭感觉?
📌 练习3:长文本实测
找一份长文档(论文、合同、报告都行),分别用Kimi和另一个模型处理,对比效果。
观察重点: 哪个模型处理得更完整?哪个的摘要更准确?
下节预告
🖥️ 第15课:ReAct模式与工具调用
恭喜你,进阶阶段圆满收官!从第15课开始,咱进入更硬核的"高级应用阶段"。
高级阶段的第一课,是ReAct模式与工具调用------让AI具备"思考-行动-观察"的循环能力。
前面咱学的都是"让AI说话",从这节课开始,咱要学"让AI干活"------让它自己决定"该查什么、该调什么工具、该怎么验证结果"。这是做Agent(智能体)的基础,也是从"提示词工程"迈向"AI应用开发"的关键一步。
🎯 进阶阶段8课全部完成!你已经掌握了提示词工程的核心技术。接下来,是更精彩的"高级应用阶段"。