【Codex-智能体】

一、何为智能体

Codex 智能体是一个能够理解目标、查看工作环境、调用工具、执行操作并根据结果继续调整的 AI 工作执行系统。

普通聊天模型主要生成回答;Codex 智能体可以完成这样的闭环:

复制代码
理解目标 → 检查项目和资料 → 制定步骤 → 调用工具执行
       → 读取执行结果 → 修正问题 → 验证成果 → 交付

它通常由五部分组成:

组成 作用
AI 模型 理解语言、推理、编写代码和制定计划
上下文 当前对话、项目文件、AGENTS.md 和参考资料
工具 文件操作、终端、浏览器、代码执行、MCP连接器等
Skill 针对特定任务的专业流程和操作规范
权限与沙箱 限制智能体能读取、修改或访问的资源

主要功能包括:

  • 理解任务:把自然语言要求转换成可以执行的工作目标。
  • 分析项目:读取代码、文档、数据、课件及目录结构。
  • 自主规划:把复杂任务拆成多个步骤,并根据执行结果动态调整。
  • 调用工具:运行命令、修改文件、访问网页、操作浏览器或连接外部系统。
  • 生成和修改内容:编写代码、制作PPT、处理表格、撰写文档。
  • 验证结果:运行测试、检查文件结构、审查排版或比较修改前后的结果。
  • 持续执行:遇到失败时分析原因、修复并重试,而不是只给出建议。
  • 连接业务系统:通过 MCP 或插件访问 GitHub、云盘、数据库等系统。
  • 执行固定工作流:通过 Skill 复用课程制作、论文分析、代码审查等专业流程。

需要注意,Skill 本身不是一个智能体 。Skill 相当于智能体的"操作手册";工具相当于它的"手和眼睛";AGENTS.md 用于规定它在某个项目中的长期行为;模型负责理解、判断和调度。

二、我们该怎么做?

如果你想让 Codex 长期充当负荷预测智能体,建议配置"专用项目 + 行为规则 + 业务 Skill + 数据工具"。 Codex 已经能够规划任务、运行分析程序并检查结果,需要进一步明确的是预测对象、数据口径、业务流程和验收标准。

在 Codex 中怎么设置?

  1. 建立专用项目文件夹

    例如建立"负荷预测智能体"项目,集中存放历史负荷、气象数据、节假日信息、模型程序、配置文件和预测结果。

    建议采用以下目录:

    复制代码
    负荷预测智能体/
    ├─ AGENTS.md
    ├─ data/
    │  ├─ raw/              # 原始数据
    │  └─ processed/        # 清洗后的数据
    ├─ configs/             # 预测周期、区域等配置
    ├─ src/                 # 数据处理与模型程序
    ├─ outputs/             # 预测结果
    ├─ reports/             # 评估报告
    └─ .agents/
       └─ skills/
          └─ load-forecasting/
  2. AGENTS.md 设置项目规则

    在项目根目录写清楚智能体的职责、数据来源、工作步骤、输出格式和验收条件。Codex进入该项目工作时,会读取这些规则。AGENTS.md 官方说明

    负荷预测项目可以规定:

    • 预测对象:系统总负荷、区域负荷或用户负荷。
    • 预测周期:超短期、日前、周前或月度预测。
    • 时间粒度:15分钟、30分钟或1小时。
    • 数据来源:历史负荷、气温、湿度、天气类型、节假日和特殊事件。
    • 工作要求:检查缺失值、异常值、时间戳和数据泄漏。
    • 评估指标:MAE、RMSE、WAPE、峰值误差和预测区间覆盖率。
    • 输出内容:预测数据、图表、模型评价、风险提示和运行日志。
    • 完成标准:预测结果优于季节性基准模型,并且可以重复运行。

    示例规则:

    复制代码
    # 负荷预测智能体规则
    
    你是一名电力负荷预测助手,负责完成数据检查、特征构造、
    模型训练、滚动回测、负荷预测和结果解释。
    
    ## 工作原则
    - 不修改原始数据,处理结果保存到 data/processed。
    - 所有时间数据统一使用 Asia/Shanghai 时区。
    - 训练模型前检查缺失值、异常值和时间连续性。
    - 严禁使用预测时点之后的数据构造特征。
    - 至少建立季节性朴素模型作为基准。
    - 使用时间顺序切分或滚动回测,不能随机划分训练集。
    - 输出点预测、合理的预测区间及异常情况说明。
    - 模型结果用于辅助决策,关键结果需要人工复核。
    
    ## 输出要求
    - outputs/forecast.csv:时间、预测负荷、区间下限和区间上限。
    - reports/evaluation.md:模型指标、基准对比和主要误差来源。
    - reports/forecast.png:实际负荷与预测负荷曲线。
  3. 创建负荷预测业务 Skill

    Skill负责告诉Codex"遇到负荷预测任务时应当怎样做"。建议在项目中建立:

    复制代码
    .agents/skills/load-forecasting/
    ├─ SKILL.md
    ├─ scripts/
    │  ├─ validate_data.py
    │  ├─ build_features.py
    │  ├─ backtest.py
    │  └─ forecast.py
    └─ references/
       ├─ data_dictionary.md
       └─ evaluation_rules.md

    SKILL.md应规定以下标准流程:

    1. 识别预测区域、时间粒度和预测范围。
    2. 检查负荷与气象数据质量。
    3. 建立"上一周期同一时刻"等简单基准。
    4. 构造小时、星期、节假日、滞后负荷和滚动统计特征。
    5. 使用滚动时间窗口进行回测。
    6. 比较基准模型、统计模型和机器学习模型。
    7. 生成最终预测、置信区间和结果解释。
    8. 保存数据、参数、指标和图表,保证过程可复现。

    Skill是包含SKILL.md及可选脚本、参考资料和资源文件的目录。Skills 官方说明

  4. 选择合适的模型路线

    建议先从容易验证的模型开始,再逐步增加复杂度:

    • 基准模型:昨日同一时刻、上周同一时刻、移动平均。
    • 统计模型:线性回归、指数平滑、ARIMA。
    • 机器学习:LightGBM、XGBoost或随机森林。
    • 深度学习:LSTM、Transformer、时序基础模型。
    • 组合预测:根据不同季节和负荷状态组合多个模型。

    对多数短期负荷预测项目,结构化特征配合LightGBM或XGBoost通常适合作为第一版。只有在数据量足够、关系复杂并且能够持续维护时,再考虑深度学习模型。

  5. 接入所需数据与工具

    一个实用的负荷预测智能体通常需要:

    • 历史负荷数据库或CSV、Excel文件。
    • 天气实况和天气预报接口。
    • 法定节假日与调休日历。
    • Python数据分析与机器学习环境。
    • 数据库、数据仓库或业务系统接口。
    • 可选的模型登记、运行监控和告警工具。

    试验阶段可以从本地文件开始。进入日常运行后,再通过API或MCP连接气象服务、数据库和业务系统。Codex支持通过MCP扩展外部工具和数据源。MCP 官方说明

  6. 重点设计预测验收机制

    不能只要求智能体"生成一个预测结果",还要规定怎样判断结果是否可靠:

    • 与昨日同期、上周同期等基准比较。
    • 分工作日、周末、节假日和极端天气评价。
    • 单独检查早晚高峰及最大负荷预测误差。
    • 检查模型是否出现明显漂移。
    • 当输入数据缺失或超出历史范围时主动告警。
    • 预测可信度较低时输出区间和原因,不强行给出确定结论。
  7. 验证稳定后再设置自动运行

    可以让Codex按日或按小时执行以下任务:

    1. 更新历史负荷和天气预报。
    2. 检查数据完整性。
    3. 生成未来负荷预测。
    4. 与近期实际负荷进行回测。
    5. 输出预测文件和分析报告。
    6. 发现数据异常、模型漂移或预测失败时通知负责人。

    正式自动化之前,应先人工运行多个周期,确认数据更新时间、模型指标和异常处理规则稳定。Codex Automations 官方说明

建议配置的 Skill:

Skill 作用 必要程度
load-forecasting 定义负荷预测的专业流程与验收标准 必需,自定义
skill-creator 帮助创建和维护业务Skill 配置阶段推荐
spreadsheets 读取和分析CSV、Excel数据 数据采用表格时推荐
visualize 绘制负荷曲线、误差分布和峰谷图 推荐
documents 自动生成预测分析报告 可选
presentations 将预测结果制作成汇报PPT 可选
openai-docs 查询Codex配置、Skill和工具接入方法 配置阶段使用

第一版建议只配置load-forecastingspreadsheetsvisualize。先完成一个能够稳定执行"数据检查---基准预测---机器学习预测---滚动回测---报告输出"的智能体,再接入实时数据库、天气接口和定时任务。

三、自己定义 Skill

是的,用户可以自己定义 Skill 。核心是创建一个 Skill 文件夹,并在其中编写名称必须为 SKILL.md 的说明文件。

例如:

复制代码
负荷预测智能体/
└─ .agents/
   └─ skills/
      └─ load-forecasting/
         ├─ SKILL.md
         ├─ scripts/       # 可选:Python等执行脚本
         ├─ references/    # 可选:业务规范和数据字典
         └─ assets/        # 可选:模板等资源

最简单的SKILL.md可以这样写:

复制代码
---
name: load-forecasting
description: 用于电力负荷数据检查、特征构造、模型训练、滚动回测和负荷预测。
---

# 负荷预测 Skill

当用户要求进行电力负荷预测时,执行以下流程:

1. 确认预测对象、时间粒度和预测范围。
2. 检查时间连续性、缺失值和异常值。
3. 建立昨日同期和上周同期基准模型。
4. 构造时间、节假日、气象和历史负荷特征。
5. 按时间顺序划分数据并进行滚动回测。
6. 使用 MAE、RMSE、WAPE 和峰值误差评价模型。
7. 输出预测数据、预测区间、图表和评估报告。

## 约束

- 不允许使用预测时点之后的数据。
- 不覆盖原始数据。
- 模型必须与基准模型比较。
- 数据不足或质量异常时,应明确提示风险。

Skill可以采用两种范围:

  • 项目专用 Skill :放在项目的.agents/skills/中,仅服务当前项目。
  • 个人通用 Skill:放在用户级 Skill 目录中,可以被多个项目使用。

你既可以手动编写SKILL.md,也可以直接要求Codex:

请使用 skill-creator,为我创建一个电力负荷预测 Skill,包括数据检查、特征工程、滚动回测、模型比较和预测报告生成。

需要注意:Skill不仅是一段提示词 。成熟的Skill还可以附带Python脚本、数据字典、指标规范和报告模板,使Codex按照固定、可重复的业务流程工作。具体结构可参考OpenAI Skills官方说明

相关推荐
CTA终结者1 小时前
量化实现难,先看交易想法有没有说清
人工智能·python
若丶相见1 小时前
Codex、Claude Code、WorkBuddy + Tabbit CLI:让 AI 操控浏览器发文章
人工智能·浏览器
拼搏奋斗,无悔于青春2 小时前
AI演示看着很厉害,一上线怎么就不行了?试驾的路,是销售挑好的
人工智能
昇腾知识体系2 小时前
昇腾 AscendC Tiling 设计实战:TilingFunc/TilingData 完整示例与 UB 容量预算
人工智能·华为·知识图谱
hqyjzsb2 小时前
Python 技术人转型 AI:CAIE Level I、Level II 对比怎么选
开发语言·人工智能·python·金融·数据挖掘·数据分析·aigc
3d打印专业号2 小时前
钣金小批量试制在东莞怎么选厂?从精度、交期到全工艺链的选型拆解
人工智能
数智前线2 小时前
机器人补上“最后一厘米”,触觉的战争打响了
人工智能
月疯2 小时前
bert的架构解析
人工智能·深度学习·bert
u1301302 小时前
AI 日报(2026年9月9日)
人工智能