一、何为智能体
Codex 智能体是一个能够理解目标、查看工作环境、调用工具、执行操作并根据结果继续调整的 AI 工作执行系统。
普通聊天模型主要生成回答;Codex 智能体可以完成这样的闭环:
理解目标 → 检查项目和资料 → 制定步骤 → 调用工具执行
→ 读取执行结果 → 修正问题 → 验证成果 → 交付
它通常由五部分组成:
| 组成 | 作用 |
|---|---|
| AI 模型 | 理解语言、推理、编写代码和制定计划 |
| 上下文 | 当前对话、项目文件、AGENTS.md 和参考资料 |
| 工具 | 文件操作、终端、浏览器、代码执行、MCP连接器等 |
| Skill | 针对特定任务的专业流程和操作规范 |
| 权限与沙箱 | 限制智能体能读取、修改或访问的资源 |
主要功能包括:
- 理解任务:把自然语言要求转换成可以执行的工作目标。
- 分析项目:读取代码、文档、数据、课件及目录结构。
- 自主规划:把复杂任务拆成多个步骤,并根据执行结果动态调整。
- 调用工具:运行命令、修改文件、访问网页、操作浏览器或连接外部系统。
- 生成和修改内容:编写代码、制作PPT、处理表格、撰写文档。
- 验证结果:运行测试、检查文件结构、审查排版或比较修改前后的结果。
- 持续执行:遇到失败时分析原因、修复并重试,而不是只给出建议。
- 连接业务系统:通过 MCP 或插件访问 GitHub、云盘、数据库等系统。
- 执行固定工作流:通过 Skill 复用课程制作、论文分析、代码审查等专业流程。
需要注意,Skill 本身不是一个智能体 。Skill 相当于智能体的"操作手册";工具相当于它的"手和眼睛";AGENTS.md 用于规定它在某个项目中的长期行为;模型负责理解、判断和调度。
二、我们该怎么做?
如果你想让 Codex 长期充当负荷预测智能体,建议配置"专用项目 + 行为规则 + 业务 Skill + 数据工具"。 Codex 已经能够规划任务、运行分析程序并检查结果,需要进一步明确的是预测对象、数据口径、业务流程和验收标准。
在 Codex 中怎么设置?
-
建立专用项目文件夹
例如建立"负荷预测智能体"项目,集中存放历史负荷、气象数据、节假日信息、模型程序、配置文件和预测结果。
建议采用以下目录:
负荷预测智能体/ ├─ AGENTS.md ├─ data/ │ ├─ raw/ # 原始数据 │ └─ processed/ # 清洗后的数据 ├─ configs/ # 预测周期、区域等配置 ├─ src/ # 数据处理与模型程序 ├─ outputs/ # 预测结果 ├─ reports/ # 评估报告 └─ .agents/ └─ skills/ └─ load-forecasting/ -
用
AGENTS.md设置项目规则在项目根目录写清楚智能体的职责、数据来源、工作步骤、输出格式和验收条件。Codex进入该项目工作时,会读取这些规则。AGENTS.md 官方说明
负荷预测项目可以规定:
- 预测对象:系统总负荷、区域负荷或用户负荷。
- 预测周期:超短期、日前、周前或月度预测。
- 时间粒度:15分钟、30分钟或1小时。
- 数据来源:历史负荷、气温、湿度、天气类型、节假日和特殊事件。
- 工作要求:检查缺失值、异常值、时间戳和数据泄漏。
- 评估指标:MAE、RMSE、WAPE、峰值误差和预测区间覆盖率。
- 输出内容:预测数据、图表、模型评价、风险提示和运行日志。
- 完成标准:预测结果优于季节性基准模型,并且可以重复运行。
示例规则:
# 负荷预测智能体规则 你是一名电力负荷预测助手,负责完成数据检查、特征构造、 模型训练、滚动回测、负荷预测和结果解释。 ## 工作原则 - 不修改原始数据,处理结果保存到 data/processed。 - 所有时间数据统一使用 Asia/Shanghai 时区。 - 训练模型前检查缺失值、异常值和时间连续性。 - 严禁使用预测时点之后的数据构造特征。 - 至少建立季节性朴素模型作为基准。 - 使用时间顺序切分或滚动回测,不能随机划分训练集。 - 输出点预测、合理的预测区间及异常情况说明。 - 模型结果用于辅助决策,关键结果需要人工复核。 ## 输出要求 - outputs/forecast.csv:时间、预测负荷、区间下限和区间上限。 - reports/evaluation.md:模型指标、基准对比和主要误差来源。 - reports/forecast.png:实际负荷与预测负荷曲线。 -
创建负荷预测业务 Skill
Skill负责告诉Codex"遇到负荷预测任务时应当怎样做"。建议在项目中建立:
.agents/skills/load-forecasting/ ├─ SKILL.md ├─ scripts/ │ ├─ validate_data.py │ ├─ build_features.py │ ├─ backtest.py │ └─ forecast.py └─ references/ ├─ data_dictionary.md └─ evaluation_rules.mdSKILL.md应规定以下标准流程:- 识别预测区域、时间粒度和预测范围。
- 检查负荷与气象数据质量。
- 建立"上一周期同一时刻"等简单基准。
- 构造小时、星期、节假日、滞后负荷和滚动统计特征。
- 使用滚动时间窗口进行回测。
- 比较基准模型、统计模型和机器学习模型。
- 生成最终预测、置信区间和结果解释。
- 保存数据、参数、指标和图表,保证过程可复现。
Skill是包含
SKILL.md及可选脚本、参考资料和资源文件的目录。Skills 官方说明 -
选择合适的模型路线
建议先从容易验证的模型开始,再逐步增加复杂度:
- 基准模型:昨日同一时刻、上周同一时刻、移动平均。
- 统计模型:线性回归、指数平滑、ARIMA。
- 机器学习:LightGBM、XGBoost或随机森林。
- 深度学习:LSTM、Transformer、时序基础模型。
- 组合预测:根据不同季节和负荷状态组合多个模型。
对多数短期负荷预测项目,结构化特征配合LightGBM或XGBoost通常适合作为第一版。只有在数据量足够、关系复杂并且能够持续维护时,再考虑深度学习模型。
-
接入所需数据与工具
一个实用的负荷预测智能体通常需要:
- 历史负荷数据库或CSV、Excel文件。
- 天气实况和天气预报接口。
- 法定节假日与调休日历。
- Python数据分析与机器学习环境。
- 数据库、数据仓库或业务系统接口。
- 可选的模型登记、运行监控和告警工具。
试验阶段可以从本地文件开始。进入日常运行后,再通过API或MCP连接气象服务、数据库和业务系统。Codex支持通过MCP扩展外部工具和数据源。MCP 官方说明
-
重点设计预测验收机制
不能只要求智能体"生成一个预测结果",还要规定怎样判断结果是否可靠:
- 与昨日同期、上周同期等基准比较。
- 分工作日、周末、节假日和极端天气评价。
- 单独检查早晚高峰及最大负荷预测误差。
- 检查模型是否出现明显漂移。
- 当输入数据缺失或超出历史范围时主动告警。
- 预测可信度较低时输出区间和原因,不强行给出确定结论。
-
验证稳定后再设置自动运行
可以让Codex按日或按小时执行以下任务:
- 更新历史负荷和天气预报。
- 检查数据完整性。
- 生成未来负荷预测。
- 与近期实际负荷进行回测。
- 输出预测文件和分析报告。
- 发现数据异常、模型漂移或预测失败时通知负责人。
正式自动化之前,应先人工运行多个周期,确认数据更新时间、模型指标和异常处理规则稳定。Codex Automations 官方说明
建议配置的 Skill:
| Skill | 作用 | 必要程度 |
|---|---|---|
load-forecasting |
定义负荷预测的专业流程与验收标准 | 必需,自定义 |
skill-creator |
帮助创建和维护业务Skill | 配置阶段推荐 |
spreadsheets |
读取和分析CSV、Excel数据 | 数据采用表格时推荐 |
visualize |
绘制负荷曲线、误差分布和峰谷图 | 推荐 |
documents |
自动生成预测分析报告 | 可选 |
presentations |
将预测结果制作成汇报PPT | 可选 |
openai-docs |
查询Codex配置、Skill和工具接入方法 | 配置阶段使用 |
第一版建议只配置load-forecasting、spreadsheets和visualize。先完成一个能够稳定执行"数据检查---基准预测---机器学习预测---滚动回测---报告输出"的智能体,再接入实时数据库、天气接口和定时任务。
三、自己定义 Skill
是的,用户可以自己定义 Skill 。核心是创建一个 Skill 文件夹,并在其中编写名称必须为 SKILL.md 的说明文件。
例如:
负荷预测智能体/
└─ .agents/
└─ skills/
└─ load-forecasting/
├─ SKILL.md
├─ scripts/ # 可选:Python等执行脚本
├─ references/ # 可选:业务规范和数据字典
└─ assets/ # 可选:模板等资源
最简单的SKILL.md可以这样写:
---
name: load-forecasting
description: 用于电力负荷数据检查、特征构造、模型训练、滚动回测和负荷预测。
---
# 负荷预测 Skill
当用户要求进行电力负荷预测时,执行以下流程:
1. 确认预测对象、时间粒度和预测范围。
2. 检查时间连续性、缺失值和异常值。
3. 建立昨日同期和上周同期基准模型。
4. 构造时间、节假日、气象和历史负荷特征。
5. 按时间顺序划分数据并进行滚动回测。
6. 使用 MAE、RMSE、WAPE 和峰值误差评价模型。
7. 输出预测数据、预测区间、图表和评估报告。
## 约束
- 不允许使用预测时点之后的数据。
- 不覆盖原始数据。
- 模型必须与基准模型比较。
- 数据不足或质量异常时,应明确提示风险。
Skill可以采用两种范围:
- 项目专用 Skill :放在项目的
.agents/skills/中,仅服务当前项目。 - 个人通用 Skill:放在用户级 Skill 目录中,可以被多个项目使用。
你既可以手动编写SKILL.md,也可以直接要求Codex:
请使用 skill-creator,为我创建一个电力负荷预测 Skill,包括数据检查、特征工程、滚动回测、模型比较和预测报告生成。
需要注意:Skill不仅是一段提示词 。成熟的Skill还可以附带Python脚本、数据字典、指标规范和报告模板,使Codex按照固定、可重复的业务流程工作。具体结构可参考OpenAI Skills官方说明。