多媒体与代码:AI Prompting 入门到高阶

核心主题:AI 不只处理文字,还能处理图片、视频、声音、音乐、代码,甚至帮你做 App 和数据分析。


一、学习目标

学完这份资料,你应该能:

  1. 说出 AI 的多模态输入和输出类型。

  2. 理解为什么不同输出类型的速度和成本差别很大。

  3. 掌握"用图片提示 AI"和"让 AI 生成图片"的基本方法。

  4. 用 GOAL---INPUT---OUTPUT 框架提示 AI 构建简单应用。

  5. 知道什么时候该让 AI 写代码、运行代码、画图。

  6. 认识声音克隆等技术的伦理风险。


二、核心框架:AI 模型是一个"输入---输出盒子"

AI 模型可以理解成一个黑盒:

输入 → AI 模型 → 输出

1. 常见输入类型

  • Text:文本

  • Images:图片

  • Music:音乐

  • Speech:语音

  • Video:视频

  • Code:代码

2. 常见输出类型

  • Text:文本

  • Images:图片

  • Music:音乐

  • Speech:语音

  • Video:视频

  • Code:代码

3. 关键结论

  • 输入类型的差异没有那么大。

  • 输出类型的差异很大,因为不同输出生成的速度和成本不同。

  • 文本输出快且便宜;图片、视频、语音等输出更慢、更贵。

4. 输出类型成本速查

输出类型 速度 成本 交付方式
文本 几秒 低于 1 美分 逐块输出,可中途停止
图片 十几秒 几美分 一次性生成,通常不能提前停止
视频 更慢 更贵 成本高,生成时间长

所以多模态提示词虽然和文本提示词原则相似,但因为"慢"和"贵",试错成本更高。


三、多模态提示词的核心原则

PPT 第 10 页总结了几个原则:

  1. 更多上下文更好

    信息越具体,AI 越容易理解你的目标。

  2. 使用当前最好的模型

    不同模型能力不同,复杂任务要用更强模型。

  3. 一次生成多个选项

    尤其是图片、视频、App 方案,不要只生成一次。

  4. 迭代改进

    不满意就修改提示词,再生成。

  5. 注意成本和速度

    图片、视频、语音生成比文本贵很多,不要无脑反复试。


四、模块一:AI 能生成哪些多媒体?

AI 可以生成:

  • 图片

  • 视频

  • 声音、语音克隆

  • 音乐

  • 代码

  • 小游戏、小应用

PPT 中的例子:

  • AI 设计生日蛋糕,然后现实中做出来。

  • 生成"人缩小到虫子大小"的视频。

  • 克隆人的声音。

  • 做一个"打字喂猫"的小游戏。

  • 生成鬼屋视频、咖啡店猫店长图片等。

伦理提醒:能力越大,责任越大

声音克隆可以做好事:

  • 修复播客中的错误。

  • 给游戏角色配逼真声音。

也可能做坏事:

  • 用亲人声音诈骗。

  • 伪造电话、语音消息。

学习 AI 技术时,必须同时考虑合法、合规、道德。


五、模块二:图像理解------让 AI 看图

1. 图像理解能做什么?

  • 读白板内容,判断课程主题。

  • 读餐厅小票,帮忙算账。

  • 读手写日记,整理文字。

  • 看多张会议照片,总结头脑风暴想法。

2. 图像理解的限制

  • AI 能读图片里的基本文字。

  • 但可能漏掉细节。

  • 复杂视觉识别可能出错。

  • 重要数字、计算、专业判断要人工核对。

PPT 例子:

  • 健身器械被认错。

  • 小票文字写 27.30,但表格算出 27.78。

  • 说明 AI 输出不一定完全正确。

3. 图像理解提示技巧

  1. 图片要清晰。

  2. 明确告诉 AI 你要提取什么:文字、表格、金额、总结。

  3. 一次可以给多张图片。

  4. 对关键数字要求 AI 逐步计算或核对。

  5. 不确定的地方要求 AI 标注"不确定"。

4. 图像理解提示词模板

请阅读这张图片,提取其中的文字/表格/账单/笔记。

然后完成总结/计算/分类。

如果信息不清楚,请标注"不确定"。

重要计算请列出步骤并核对。


六、模块三:图像生成------让 AI 画图和改图

1. 图像生成能做什么?

  • 生成全新图片。

  • 编辑已有图片。

  • 修复老照片:去反光、去纹理、改比例。

  • 生成信息图、漫画、角色图、场景图。

2. 图像生成提示词三要素

PPT 第 21 页给出一个很好用的框架:

要素 含义 例子
Setting 场景 夜晚咖啡馆、木桌、城市街道
Character details 角色细节 聪明橘猫、穿小围裙、煮咖啡
Mood/style 氛围与风格 卡通、温馨、电影感、赛博朋克

示例提示词:

生成一张夜晚咖啡馆的图片。主体是一只聪明的橘猫,穿着小围裙,在柜台后煮咖啡。风格为卡通、温馨、奇幻。

3. 常用图像风格词

  • Cinematic:电影感

  • Cyberpunk:赛博朋克

  • Watercolor:水彩

  • Anime:动漫

  • Cartoon:卡通

  • Photorealistic:照片写实

4. 图像生成原理:扩散模型

简单理解:

  1. 训练时,给图片不断加噪声。

  2. 模型学会从噪声中恢复图片。

  3. 生成时,从随机噪声开始,一步步去噪,最后得到图片。

所以图像生成有两个特点:

  • 有随机性:每次生成可能不同。

  • 可能犯错:手部畸形、文字乱码、角色不一致。

5. 常见图像生成错误

  • 手很奇怪。

  • 文字拼错、乱码。

  • 同一角色前后不一致。

  • 细节不合理。

6. 图像生成技巧

  1. 提示词写清楚场景、角色、风格。

  2. 多生成几张,挑最好的。

  3. 不满意就迭代。

  4. 检查文字、手、比例、一致性。

  5. 注意成本:图片比文本贵很多。


七、模块四:用 AI 构建应用

1. 三块积木:GOAL---INPUT---OUTPUT

积木 含义 提问方式
GOAL 要创建什么 做一个什么 App?
INPUT 用户提供什么 用户点击、输入、上传什么?
OUTPUT App 做什么 App 显示、计算、生成什么?

示例:

做一个烟花模拟器。

用户点击屏幕。

App 从底部发射烟花并爆炸,显示彩色效果。

2. App 例子

趣味型:

  • 链式反应游戏

  • 烟花模拟器

功能型:

  • Pomodoro 番茄钟

  • 账单计算器

  • 穿搭选择器

3. 难度分级

更容易 更困难
简单平台游戏 多人联网游戏
法语单词测验 AI 实时法语反馈
单机小工具 联网、实时、复杂交互

建议:从简单想法开始。

4. App 构建提示词模板

请构建一个GOAL。

用户可以INPUT。

App 应该OUTPUT。

请先做一个简单可运行版本,再逐步增加功能。


八、模块五:用 AI 做数据分析

1. AI 可以做什么?

  • 分析个人数据:跑步记录、配速、距离、进步。

  • 分析销售数据:收入、订单、趋势、季节性、促销、异常值。

  • 写代码、运行代码、画图。

  • 生成年度总结图、信息图。

2. AI 的工具箱

AI 可以调用工具:

  • Web search:网络搜索

  • Write file:写文件

  • Read files:读文件

  • Run code:运行代码

3. 什么时候需要运行代码?

适合让 AI 运行代码的情况:

  • 数据已经存在。

  • 需要计算。

  • 需要画图。

  • 需要找趋势、异常、排名。

流程图:

用户提示 → 用上下文推理 → 使用工具 → 获得更多上下文 → 最终答案

4. 什么时候不需要代码?

问题 原因 是否需要代码
猫为什么盯着墙? 常识问题 不需要,直接回答
附近高评分健身房 位置相关 需要搜索
鬼屋计划 需要综合推理 不一定需要代码
我的销售趋势? 计算和绘图 需要代码

5. 数据分析提示词模板

附件是数据文件。

请分析目标,找出趋势/异常/排名/变化最大项。

请用代码完成计算,并生成图表。

最后用简单语言解释结论。


九、整份 PPT 的速查表

主题 一句话记忆
多模态 AI 可处理文字、图片、音乐、语音、视频、代码
输出成本 文本最便宜最快,图片、视频更慢更贵
提示词原则 多上下文、用最好模型、多选项、多迭代
图像理解 能读基本文字,但会漏细节,重要信息要核对
图像生成 三要素:场景、角色细节、氛围风格
扩散模型 从噪声逐步去噪生成图片,有随机性
常见错误 手畸形、文字乱码、角色不一致
构建 App GOAL---INPUT---OUTPUT,从简单开始
数据分析 数据存在 + 需要计算/画图 → 让 AI 运行代码
伦理 声音克隆可助人,也可诈骗,要负责任

十、常见误区

  1. 以为 AI 看图百分百准确

    错。可能漏细节、认错物体、算错数字。

  2. 忽略图片和视频生成成本

    图片、视频比文本贵很多,不能无限试。

  3. 提示词太模糊

    "画一只猫"不如"夜晚咖啡馆里,一只橘猫穿围裙煮咖啡,卡通温馨风格"。

  4. 一上来就做复杂 App

    先从简单版本开始,再迭代。

  5. 不核对 AI 计算

    重要账单、销售数据、财务数字要检查。

  6. 滥用声音克隆

    不能用于诈骗、伪造、侵权。


十一、自测题

  1. AI 常见的输入类型有哪些?

  2. 为什么说"输出类型的差异比输入类型更大"?

  3. 文本、图片、视频生成在速度和成本上有什么区别?

  4. 图像理解有什么优点和局限?

  5. 图像生成提示词的三要素是什么?

  6. 扩散模型的基本原理是什么?

  7. 图像生成常见错误有哪些?

  8. 用 AI 构建 App 的三块积木是什么?

  9. 什么时候应该让 AI 运行代码?

  10. 声音克隆可能带来哪些伦理风险?

简要答案

  1. 文本、图片、音乐、语音、视频、代码。

  2. 因为不同输出生成速度和成本差异很大。

  3. 文本最快最便宜;图片更慢更贵;视频更慢更贵。

  4. 能读基本文字,但会漏细节、可能认错。

  5. Setting、Character details、Mood/style。

  6. 训练时加噪声,生成时从噪声逐步去噪。

  7. 手畸形、文字乱码、角色不一致等。

  8. GOAL、INPUT、OUTPUT。

  9. 数据存在且需要计算或绘图时。

  10. 可用于修复播客、角色配音,也可用于诈骗、伪造亲人声音。


十二、一句话总结

AI 可以成为你的多媒体助手、代码助手和数据分析助手,但提示词的核心始终是:给足上下文、明确目标、多迭代、核对结果、注意成本和伦理。

相关推荐
zhangfeng11331 小时前
Ag / Cu / Au / Ru / Ir / Rh银 铜 金 钌铱 铑 纳米尺度下的 导电性 + 扩散/迁移缺点
人工智能·华为·ai编程·npu
10年前端老司机1 小时前
实战分享:基于 PyMuPDF+Qwen-VL 实现图文兼容的 PDF RAG 方案
人工智能·python·agent
YOLO数据集集合1 小时前
红外缺陷检测数据集 | 红外检测 缺陷识别 裂缝检测 渗漏检测 目标检测9145期
人工智能·目标检测·机器学习·计算机视觉·目标跟踪·智慧城市
2601_962885721 小时前
如何用 Python 回测定投策略(定期定额 DCA)?(和一次性买入对比)
开发语言·人工智能·python
蜗牛互联网1 小时前
Python接入Gemini 3.8 Flash实现票据视觉抽取与规则校验
java·javascript·网络·人工智能·python
智圣新创011 小时前
锚定地方应用型高校数据资产盘活目标 一表通落地效能核验全维度高频实操答疑
人工智能
愤怒火龙果2 小时前
观察01 十字路口堵车,红绿灯能不能“看车下菜“?
人工智能·智慧城市
小鱼~~2 小时前
Recall@K、Precision@K、MRR、nDCG@K简介
人工智能·算法·机器学习
在所不辞兄2 小时前
【零基础学智能仿真-38】从规则矩形到带孔薄板:Gmsh 网格与 FEniCSx 联合求解
人工智能·深度学习·算法·机器学习·工程仿真