核心主题:AI 不只处理文字,还能处理图片、视频、声音、音乐、代码,甚至帮你做 App 和数据分析。
一、学习目标
学完这份资料,你应该能:
-
说出 AI 的多模态输入和输出类型。
-
理解为什么不同输出类型的速度和成本差别很大。
-
掌握"用图片提示 AI"和"让 AI 生成图片"的基本方法。
-
用 GOAL---INPUT---OUTPUT 框架提示 AI 构建简单应用。
-
知道什么时候该让 AI 写代码、运行代码、画图。
-
认识声音克隆等技术的伦理风险。
二、核心框架:AI 模型是一个"输入---输出盒子"
AI 模型可以理解成一个黑盒:
输入 → AI 模型 → 输出
1. 常见输入类型
-
Text:文本
-
Images:图片
-
Music:音乐
-
Speech:语音
-
Video:视频
-
Code:代码
2. 常见输出类型
-
Text:文本
-
Images:图片
-
Music:音乐
-
Speech:语音
-
Video:视频
-
Code:代码
3. 关键结论
-
输入类型的差异没有那么大。
-
输出类型的差异很大,因为不同输出生成的速度和成本不同。
-
文本输出快且便宜;图片、视频、语音等输出更慢、更贵。
4. 输出类型成本速查
| 输出类型 | 速度 | 成本 | 交付方式 |
|---|---|---|---|
| 文本 | 几秒 | 低于 1 美分 | 逐块输出,可中途停止 |
| 图片 | 十几秒 | 几美分 | 一次性生成,通常不能提前停止 |
| 视频 | 更慢 | 更贵 | 成本高,生成时间长 |
所以多模态提示词虽然和文本提示词原则相似,但因为"慢"和"贵",试错成本更高。
三、多模态提示词的核心原则
PPT 第 10 页总结了几个原则:
-
更多上下文更好
信息越具体,AI 越容易理解你的目标。
-
使用当前最好的模型
不同模型能力不同,复杂任务要用更强模型。
-
一次生成多个选项
尤其是图片、视频、App 方案,不要只生成一次。
-
迭代改进
不满意就修改提示词,再生成。
-
注意成本和速度
图片、视频、语音生成比文本贵很多,不要无脑反复试。
四、模块一:AI 能生成哪些多媒体?
AI 可以生成:
-
图片
-
视频
-
声音、语音克隆
-
音乐
-
代码
-
小游戏、小应用
PPT 中的例子:
-
AI 设计生日蛋糕,然后现实中做出来。
-
生成"人缩小到虫子大小"的视频。
-
克隆人的声音。
-
做一个"打字喂猫"的小游戏。
-
生成鬼屋视频、咖啡店猫店长图片等。
伦理提醒:能力越大,责任越大
声音克隆可以做好事:
-
修复播客中的错误。
-
给游戏角色配逼真声音。
也可能做坏事:
-
用亲人声音诈骗。
-
伪造电话、语音消息。
学习 AI 技术时,必须同时考虑合法、合规、道德。
五、模块二:图像理解------让 AI 看图
1. 图像理解能做什么?
-
读白板内容,判断课程主题。
-
读餐厅小票,帮忙算账。
-
读手写日记,整理文字。
-
看多张会议照片,总结头脑风暴想法。
2. 图像理解的限制
-
AI 能读图片里的基本文字。
-
但可能漏掉细节。
-
复杂视觉识别可能出错。
-
重要数字、计算、专业判断要人工核对。
PPT 例子:
-
健身器械被认错。
-
小票文字写 27.30,但表格算出 27.78。
-
说明 AI 输出不一定完全正确。
3. 图像理解提示技巧
-
图片要清晰。
-
明确告诉 AI 你要提取什么:文字、表格、金额、总结。
-
一次可以给多张图片。
-
对关键数字要求 AI 逐步计算或核对。
-
不确定的地方要求 AI 标注"不确定"。
4. 图像理解提示词模板
请阅读这张图片,提取其中的文字/表格/账单/笔记。
然后完成总结/计算/分类。
如果信息不清楚,请标注"不确定"。
重要计算请列出步骤并核对。
六、模块三:图像生成------让 AI 画图和改图
1. 图像生成能做什么?
-
生成全新图片。
-
编辑已有图片。
-
修复老照片:去反光、去纹理、改比例。
-
生成信息图、漫画、角色图、场景图。
2. 图像生成提示词三要素
PPT 第 21 页给出一个很好用的框架:
| 要素 | 含义 | 例子 |
|---|---|---|
| Setting | 场景 | 夜晚咖啡馆、木桌、城市街道 |
| Character details | 角色细节 | 聪明橘猫、穿小围裙、煮咖啡 |
| Mood/style | 氛围与风格 | 卡通、温馨、电影感、赛博朋克 |
示例提示词:
生成一张夜晚咖啡馆的图片。主体是一只聪明的橘猫,穿着小围裙,在柜台后煮咖啡。风格为卡通、温馨、奇幻。
3. 常用图像风格词
-
Cinematic:电影感
-
Cyberpunk:赛博朋克
-
Watercolor:水彩
-
Anime:动漫
-
Cartoon:卡通
-
Photorealistic:照片写实
4. 图像生成原理:扩散模型
简单理解:
-
训练时,给图片不断加噪声。
-
模型学会从噪声中恢复图片。
-
生成时,从随机噪声开始,一步步去噪,最后得到图片。
所以图像生成有两个特点:
-
有随机性:每次生成可能不同。
-
可能犯错:手部畸形、文字乱码、角色不一致。
5. 常见图像生成错误
-
手很奇怪。
-
文字拼错、乱码。
-
同一角色前后不一致。
-
细节不合理。
6. 图像生成技巧
-
提示词写清楚场景、角色、风格。
-
多生成几张,挑最好的。
-
不满意就迭代。
-
检查文字、手、比例、一致性。
-
注意成本:图片比文本贵很多。
七、模块四:用 AI 构建应用
1. 三块积木:GOAL---INPUT---OUTPUT
| 积木 | 含义 | 提问方式 |
|---|---|---|
| GOAL | 要创建什么 | 做一个什么 App? |
| INPUT | 用户提供什么 | 用户点击、输入、上传什么? |
| OUTPUT | App 做什么 | App 显示、计算、生成什么? |
示例:
做一个烟花模拟器。
用户点击屏幕。
App 从底部发射烟花并爆炸,显示彩色效果。
2. App 例子
趣味型:
-
链式反应游戏
-
烟花模拟器
功能型:
-
Pomodoro 番茄钟
-
账单计算器
-
穿搭选择器
3. 难度分级
| 更容易 | 更困难 |
|---|---|
| 简单平台游戏 | 多人联网游戏 |
| 法语单词测验 | AI 实时法语反馈 |
| 单机小工具 | 联网、实时、复杂交互 |
建议:从简单想法开始。
4. App 构建提示词模板
请构建一个GOAL。
用户可以INPUT。
App 应该OUTPUT。
请先做一个简单可运行版本,再逐步增加功能。
八、模块五:用 AI 做数据分析
1. AI 可以做什么?
-
分析个人数据:跑步记录、配速、距离、进步。
-
分析销售数据:收入、订单、趋势、季节性、促销、异常值。
-
写代码、运行代码、画图。
-
生成年度总结图、信息图。
2. AI 的工具箱
AI 可以调用工具:
-
Web search:网络搜索
-
Write file:写文件
-
Read files:读文件
-
Run code:运行代码
3. 什么时候需要运行代码?
适合让 AI 运行代码的情况:
-
数据已经存在。
-
需要计算。
-
需要画图。
-
需要找趋势、异常、排名。
流程图:
用户提示 → 用上下文推理 → 使用工具 → 获得更多上下文 → 最终答案
4. 什么时候不需要代码?
| 问题 | 原因 | 是否需要代码 |
|---|---|---|
| 猫为什么盯着墙? | 常识问题 | 不需要,直接回答 |
| 附近高评分健身房 | 位置相关 | 需要搜索 |
| 鬼屋计划 | 需要综合推理 | 不一定需要代码 |
| 我的销售趋势? | 计算和绘图 | 需要代码 |
5. 数据分析提示词模板
附件是数据文件。
请分析目标,找出趋势/异常/排名/变化最大项。
请用代码完成计算,并生成图表。
最后用简单语言解释结论。
九、整份 PPT 的速查表
| 主题 | 一句话记忆 |
|---|---|
| 多模态 | AI 可处理文字、图片、音乐、语音、视频、代码 |
| 输出成本 | 文本最便宜最快,图片、视频更慢更贵 |
| 提示词原则 | 多上下文、用最好模型、多选项、多迭代 |
| 图像理解 | 能读基本文字,但会漏细节,重要信息要核对 |
| 图像生成 | 三要素:场景、角色细节、氛围风格 |
| 扩散模型 | 从噪声逐步去噪生成图片,有随机性 |
| 常见错误 | 手畸形、文字乱码、角色不一致 |
| 构建 App | GOAL---INPUT---OUTPUT,从简单开始 |
| 数据分析 | 数据存在 + 需要计算/画图 → 让 AI 运行代码 |
| 伦理 | 声音克隆可助人,也可诈骗,要负责任 |
十、常见误区
-
以为 AI 看图百分百准确
错。可能漏细节、认错物体、算错数字。
-
忽略图片和视频生成成本
图片、视频比文本贵很多,不能无限试。
-
提示词太模糊
"画一只猫"不如"夜晚咖啡馆里,一只橘猫穿围裙煮咖啡,卡通温馨风格"。
-
一上来就做复杂 App
先从简单版本开始,再迭代。
-
不核对 AI 计算
重要账单、销售数据、财务数字要检查。
-
滥用声音克隆
不能用于诈骗、伪造、侵权。
十一、自测题
-
AI 常见的输入类型有哪些?
-
为什么说"输出类型的差异比输入类型更大"?
-
文本、图片、视频生成在速度和成本上有什么区别?
-
图像理解有什么优点和局限?
-
图像生成提示词的三要素是什么?
-
扩散模型的基本原理是什么?
-
图像生成常见错误有哪些?
-
用 AI 构建 App 的三块积木是什么?
-
什么时候应该让 AI 运行代码?
-
声音克隆可能带来哪些伦理风险?
简要答案
-
文本、图片、音乐、语音、视频、代码。
-
因为不同输出生成速度和成本差异很大。
-
文本最快最便宜;图片更慢更贵;视频更慢更贵。
-
能读基本文字,但会漏细节、可能认错。
-
Setting、Character details、Mood/style。
-
训练时加噪声,生成时从噪声逐步去噪。
-
手畸形、文字乱码、角色不一致等。
-
GOAL、INPUT、OUTPUT。
-
数据存在且需要计算或绘图时。
-
可用于修复播客、角色配音,也可用于诈骗、伪造亲人声音。
十二、一句话总结
AI 可以成为你的多媒体助手、代码助手和数据分析助手,但提示词的核心始终是:给足上下文、明确目标、多迭代、核对结果、注意成本和伦理。