目录
[二、Codex 介绍](#二、Codex 介绍)
[2.1 Codex 是什么](#2.1 Codex 是什么)
[2.2 Codex能做什么?](#2.2 Codex能做什么?)
[2.3 Codex 数据分析介绍](#2.3 Codex 数据分析介绍)
[2.3.1 codex 数据分析优势](#2.3.1 codex 数据分析优势)
[2.3.2 codex 数据分析使用场景](#2.3.2 codex 数据分析使用场景)
[2.3.3 codex 数据分析上手流程](#2.3.3 codex 数据分析上手流程)
[三、Codex 数据分析操作](#三、Codex 数据分析操作)
[3.1 前置准备](#3.1 前置准备)
[3.2 excel 数据分析](#3.2 excel 数据分析)
[3.2.1 数据分类](#3.2.1 数据分类)
[3.2.2 数据清洗](#3.2.2 数据清洗)
[3.2.3 数据分析](#3.2.3 数据分析)
[3.2.4 数据可视化展示](#3.2.4 数据可视化展示)
[3.3 PDF 文档操作与处理](#3.3 PDF 文档操作与处理)
[3.3.1 PDF数据提取](#3.3.1 PDF数据提取)
[3.3.2 在线PDF数据提取](#3.3.2 在线PDF数据提取)
[3.3.3 PDF转word](#3.3.3 PDF转word)
[3.3.4 PDF 合并](#3.3.4 PDF 合并)
[3.4 对接三方系统数据处理](#3.4 对接三方系统数据处理)
[3.4.1 将业务系统的数据下载到本地](#3.4.1 将业务系统的数据下载到本地)
[3.4.2 上传到飞书多维表](#3.4.2 上传到飞书多维表)
[3.4.3 补充需求](#3.4.3 补充需求)
[3.5 操作数据表](#3.5 操作数据表)
[3.5.1 准备一张业务数据表](#3.5.1 准备一张业务数据表)
[3.5.2 数据分析与操作](#3.5.2 数据分析与操作)
[3.6 内置数据分析插件使用](#3.6 内置数据分析插件使用)
一、前言
Codex 被誉为2026年最值得上手的 AI 工具,它不仅是一个编程 Agent,更是一个几乎可以替换掉任何对话工具的全能 AI。配合高性价比的定价机制和充足的 Token 额度,只要你能想到的场景,它都能帮你自动化完成。可以说,Codex 完美复刻了ChatGPT的模板,让普通的用户也能方便使用一款专属定制、性能强大的桌面版AI助手。
在日常办公的场景中,对各类数据进行处理是一个非常高频的操作,传统模式下,需要人力每天重复对各类文档,数据表,pdf,excel以及来自各个系统、平台的数据进行抓取、过滤分析,这个过程耗时耗力,试想如果通过AI来协助处理,就可以大大提升工作效率,本篇将详细介绍下如何基于Codex 完成日常工作中的一些数据分析处理的操作。
二、Codex 介绍
Codex 是 OpenAI 推出的一款AI 编程智能体。与简单的聊天机器人或代码补全工具不同,Codex 能够像一个真实的开发人员一样,独立理解复杂任务、操作你的电脑、编写并修改代码、运行终端命令,甚至自动修复bug。https://openai.com/zh-Hans-CN/codex/?utm_source=Ai138.com

2.1 Codex 是什么
简单来说,可以把 Codex 看作一个"能帮你干活的AI工程师"。
-
它是"目标驱动"而非"指令驱动":你只需告诉它最终的目标(例如:"帮我搭建一个带用户登录功能的网站"),它会自动拆解任务,规划步骤并执行,而不需要你一步步告诉它该怎么做。
-
它不只是一个聊天框:虽然你可以在ChatGPT网页版找到它,但它真正的威力在于桌面应用和命令行工具(CLI)。在这些地方,它可以直接访问你的文件系统、运行终端命令,甚至操作其他软件。
-
它的用户远超程序员:官方数据显示,Codex每周有超过300万用户,其中近一半(50%)的使用场景并非编码。从写周报、整理文档到数据分析,它都足以胜任。
2.2 Codex能做什么?
近期的重大更新让Codex的能力大幅跃升,使其不再局限于编程领域:
-
动打开软件、运行模拟器、发现问题、修改代码,并再次测试验证,完成一整套开发闭环。
-
所见即所得的开发(内置浏览器):Codex内置了一个浏览器。当你开发网页时,它可以直接在浏览器中展示效果。你可以直接在渲染出的网页上圈出问题,比如圈出一个标题并写上评论"字体太大,颜色改成蓝色",Codex就能理解视觉和空间上下文,并精准地修改对应的代码。
-
"心跳"机制与长期记忆:
-
自动排班:你可以交付给它一个需要数小时甚至数周的长线任务。即使你关掉电脑,它也会在约定的时间点"自动醒来",在后台继续工作。
-
记忆功能:它会记住你的编码偏好和纠正过的错误,下次再合作时,就不需要从头开始解释了。
-
-
强大的工具生态:Codex已经接入了超过90个插件,可以无缝连接JIRA、GitLab、Microsoft Suite、Slack、Gmail等常用工具。你可以让它去Notion里读文档、去邮箱里看邮件、去项目管理工具里筛选Bug,再把所有信息汇总成一份报告给你。
2.3 Codex 数据分析介绍
Codex的数据分析功能,核心是一套打通了自然语言、企业数据生态和专业分析流程的智能体方案。简单说,它不再只是一个帮程序员写代码的工具,而是进化成了一个能处理复杂数据工作的"AI分析师"。
2.3.1 codex 数据分析优势
使用Codex进行数据分析的核心优势在于,它将数据分析的门槛从"会写代码"拉低到了"会提问题",并将分散的数据、知识和人高效地串联起来,让分析流程从以天为单位,缩短到分钟级别。具体来说,包括:
|-----------|---------------------------------------------------------------------------------|
| 维度 | 具体体现 |
| 用对话替代编程 | 直接用自然语言提问,无需学习SQL或Python,Codex就能完成数据查询、清洗、分析和可视化。 |
| 深度理解业务语义 | 借助多层上下文架构,能理解表的业务含义、公司内部指标定义,并结合产品发布等背景信息,避免因误解数据口径得出错误结论。 |
| 打通数据孤岛与知识 | 原生连接主流数据仓库和BI工具(如Snowflake, Tableau等),并能检索Slack、Notion等文档里的项目背景与讨论记录,提供有上下文的分析。 |
| 产出决策就绪成果 | 不只产出图表,还能直接生成带有结论、证据、局限性和建议的根因分析简报、影响评估或高管备忘录。 |
| 经验记忆与持续学习 | 具备"终身记忆",能从用户的纠正中学习并积累经验,在后续分析中自动应用,越用越懂你的业务和偏好。 |
2.3.2 codex 数据分析使用场景
Codex的数据分析功能可以应用在以下专业的场景中:
-
业务指标诊断:连接Snowflake等数据源,快速探索产品数据,定位关键指标(如GMV、用户留存)波动的原因。
-
自动化报表生成:将数据查询、清洗、分析和图表制作流程自动化,定期生成可分享的交互式报告。
-
高级研究与数据挖掘:这主要面向特定领域的专家。例如,生命科学研究插件可以集成数十个公共数据库(如ClinVar、GWAS Catalog、UniProt等),帮助研究者快速进行基因注释、疾病靶点分析、文献检索等复杂的科研任务。
在日常办公场景中,使用codex也有很多应用:
-
用自然语言提问,像聊天一样查数据
-
这是最直接的应用。你不再需要把需求写成工单等待IT或分析师排期,而是可以直接像问同事一样提问。Codex理解你的业务问题后,会自动生成查询语句并返回基于真实数据的答案。
-
典型提问方式
-
"为什么上周的注册量下降了?"
-
"梳理一下近3个月付费用户的流失原因"
-
"分析最近30天付费转化率下降的原因"
-
-
-
自动产出可分享的报表与仪表盘
- 以前,把数据查询结果做成一份能对外分享的报告,往往需要懂BI工具或让分析师帮忙。现在,Codex可以直接将分析结果转化为交互式的HTML报告、仪表盘或站点,你可以一键分享给同事或领导。有开发者社区提供的分析技能(Skill)还能生成"结论先行、每张图配解读、数据可追溯"的专业报告,而不是一堆孤立的数字和图表。
-
诊断指标变动,深挖数字背后的原因
- 当核心KPI出现波动时,Codex不只是告诉你"涨了"或"跌了",还能帮你做归因分析。借助它能连接公司知识库(如Slack、Notion、Google Docs)的能力,它甚至能发现指标变动是否与产品发布、数据口径调整、系统事件等背景有关,得出更准确的结论,避免误判。
-
自动化重复、繁琐的数据整理工作
- 日常办公中有大量"体力活"其实可以交给Codex自动完成,比如从杂乱的Excel或CSV文件中清洗和提取数据、将多张表的数据合并成统一格式。例如,NTT DATA集团的非技术员工就用Codex自动从信用卡账单中提取交通费用,并转入差旅费用表格,把原本繁琐的手工工作自动化了。
2.3.3 codex 数据分析上手流程
如果你是分析师或业务人员,可以关注以下几个方面:
-
安装数据分析插件:这是接入核心功能的第一步,可以直接在Codex的插件目录中找到并安装。
-
连接数据源:将你的Snowflake、Tableau或Metabase等实例连接到Codex,为它提供分析的"原材料"。
-
用提问开始工作:尝试用自然语言提出一个业务问题,观察Codex如何查询、分析并呈现结果,逐步掌握与其协作的节奏。一些社区开发的分析技能(Skill)也能帮你快速生成结构化的分析报告。
三、Codex 数据分析操作
下面结合一些实际业务中的场景,使用Codex 演示下完成对这些场景下的数据分析。
3.1 前置准备
提前准备一些用于做数据分析的原始材料,比如excel ,csv,pdf ,其他数据表等,比如我这里有一份提前导出的电商平台用户消费记录表,有了这样一份数据表,就可以模拟日常工作中的场景,多维度的进行分析,数据透视,数据筛选,过滤,制作各类数据看板等。

3.2 excel 数据分析
以上面准备的这个excel 表数据为例,接下来进行各类场景的操作分析。
3.2.1 数据分类
通常拿到原始的数据之后,不同的业务人员对数据提取的维度不一样,比如运营人员更关注店铺的销售,财务人员更关注单据数据是否准确,比如我们先将这份数据以店铺类型的维度拆分为多个表,在Codex 中给出下面的提示词:
bash
将这个excel 中的数据按照店铺类型这个字段,拆分成多个excel,每个excel以店铺名为前缀

等待一会后,最终按照要求根据店铺类型字段拆分成了多个excel

3.2.2 数据清洗
在实际业务中,拿到的原始数据并不是完全符合要求的,可能存在某些字段值确实,某些字段数据错误等情况,为了后续数据分析的严谨性,需要对这样的问题数据进行清洗,比如在拿到这份数据后,我校对过程中发现部分列的数据有为空的情况

使用下面的提示词,直接让Codex 按要求将这部分可能有问题的数据做清洗
bash
在这个表中我发现有一些列的数据为空,将这部分数据对应的数据行从excel中剔除掉,最终输出一个没有空字段数据的excel
通过输出日志不难发现,Codex 能够准确理解我的意图,最后按要求输出一份新的不含有空字段数据的excel


3.2.3 数据分析
拿到一份业务数据后,不同的人关注的焦点不一样,需要从这份数据中统计不同的维度,类似于写sql,只不过在excel中操作的话,需要用到各种函数,下面给出几个常用的分析维度。
1)以地区消费为维度,统计不同地区的消费情况
给出下面的提示词,输出一份排序好的excel
bash
给你一份这样的excel数据,首先按照实付金额汇总一下2025年上半年各个省份的订单情况,按照从大到小进行排序之后输出一份新的excel

第一次汇总时,Codex 检查到2025年上半年数据缺失,重新调整后,最终按照要求给出了excel汇总数据


2)分析各个渠道的用户购买情况
在这份表中可以看到每个订单都来自不同的流量入口,有的是推荐流,有的是直播间,也有通过站内搜索的等,现在对这个维度做一下分析
bash
帮我汇总关于一级分类中美妆护肤这个品类的各个流量来源的订单数量,输出一份汇总excel


最终按要求输出了一份汇总的excel,有了这份数据,如果再加上平台来源,就可以基于得到的这份数据指导接下来平台对各个渠道的营销计划策略

3.2.4 数据可视化展示
很多情况下,对管理层来说,喜欢通过可视化的数据报表去看数据,从而做决策,仍然以上述这份数据为例,下面给出1个具体的数据可视化分析场景
bash
帮我分析一下各个平台中,结合订单的消费金额,不同年龄段的人群消费习惯,主要的流量来源,最后给我呈现一个可视化的数据图,形式不限,可以是柱状图,也可以是饼状图,也可以是多种组合
经过一段时间响应之后,Codex 按要求给出了需要的数据分析图

可以打开看效果,图表形式的展示会让各个维度的数据更直观

3.3 PDF 文档操作与处理
日常工作中涉及到PDF文档的操作场景也非常多,很多业务中的数据在传递过程中并非都是excel ,而使用PDF,因为PDF不仅能承载表格数据,还能承载更多形式的数据,下面介绍几个使用Codex 处理PDF文档数据的场景。
3.3.1 PDF数据提取
比如有下面这样一个PDF文件,需要将这个PDF中我用红线圈起来的几部分的数据提取出来放到一个excel的3个sheet里面
- 为了方便给Codex 明确的提示,我提前用红色线框把需要提取的数据提前圈起来了

给出下面的提示词,注意将原始的PDF文件以及上面的参考图一起发给Codex
bash
给你提供一个PDF文件,在这个PDF文件中我需要提取一部分数据,需要提取的数据部分我在图片中用红色线框圈起来了,将提取到的这几部分数据放在当前目录的excel中,分成不同的sheet

打开之后可以看下效果,跟原始的PDF对比,数据完全准确,是符合预期要求的效果

3.3.2 在线PDF数据提取
如果PDF是一个在线可以访问的链接,可以直接让Codex 读取解析,然后提取文档中的数据,比如下面这样一个浏览器可以直接访问的PDF文档链接

接下来让Codex 通过这个链接提取文档中的表格数据
bash
XXX 帮我把这个文档中第二页和第三页的表格数据提取出来,写入到当前目录的excel中


经过一段时间响应之后,最终写入到本地的excel中,并且根据PDF的页码分成了2个sheet保存

3.3.3 PDF转word
这个算是日常工作中频繁使用的一种业务场景,在没有AI之前,很多都是通过一些三方工具,或者付费软件去转,而且效果还一定完全满足要求,下面使用Codex 对上面这个PDF转为word
bash
将这个PDF转为word格式,保存到当前目录
经过响应后,按要求将PDF转成了word格式文档

3.3.4 PDF 合并
有时候拿到很多个原始的PDF文档,如果分散处理很费事,可以将这些散落的PDF先合并成一个再做处理,比如我本地有下面3个PDF文件,现在需要将它们合在一起

提供如下提示词:
bash
将这三个PDF文件合并成一个PDF文件,尺寸以最大的那个为准,合在一起之后,不要对原始的PDF文件做任何修改
通过日志输出不难发现,任务执行过程中会调用本地python环境创建脚本来辅助执行


最终得到了合并在一起的PDF文件

3.4 对接三方系统数据处理
相信很多同学遇到过这样的情况,每天需要从不同的系统拉数据,比如从自己公司的数据平台、业务系统拉数据、导出数据,再从其他的外部系统、官方系统拉取数据,最后将这些数据汇总在一起进行综合的分析处理,这个过程比较繁琐,费时费力,而且很容易出错,如果将这些操作过程通过自然语言编排好,一起交给Codex,告诉Codex 最终要的效果就可以大大提高整个过程的处理效率,下面通过一个实际案例演示下。
需求:
- 将业务系统的数据下载到本地除了之后,再上传到飞书多维表
3.4.1 将业务系统的数据下载到本地
如下,我需要将某个系统中下图页面中用红线圈起来的几个字段信息先提取到本地excel中,最后写入到飞书多维表中去。

给出下面的提示词
bash
根据我提供的这个文档的信息,登录进去之后,来到图片中的页面,将图片中用红线圈起来的字段数据提取出来并保存到本地excel,注意图片给的只是参考,提取的是文档信息中查到的列表数据
通过日志输出可以发现,Codex 模拟了整个人在操作系统时的交互点击行为,一步步进入到我要求的那个页面,精准查询出了指定数量的目标数据




3.4.2 上传到飞书多维表
需要提前准备一个飞书多维表,这里我只需要将指定的那几个字段上传到飞书多维表即可,注意多维表的表头跟导出的excel表头尽可能保持一致,减少Codex 解析时候的难度

首先通过下面的提示词让Codex 来做,看看会遇到什么问题
bash
将上面导出的excel中的前4列,即'XX','XX','XX','XX'这几列的数据,写入到飞书的多维表中,注意写入的时候将多维表的表头跟excel的表头对应起来,多维表地址:XXX

不难发现,对接飞书多维表是需要认证授权的,Codex 已经探测到这个问题,然后需要我提供相应的认证信息

我将信息提供给Codex让它继续执行


经过一段时间响应后,最终将本地的excel数据写入到上面创建的飞书多维表中

3.4.3 补充需求
基于上面的这个需求场景还可以继续延伸,比如在Codex 中,将上面的整个操作做成一个自动化的定时任务,每天定时将外部系统的数据,经过汇总、筛选、处理之后,统一汇总到飞书多维表,或者上传到自己公司的业务平台,给后续其他业务处理使用,同时,在任务编排的过程中,各个环节还能设置更多的参数,从而拉到更准确的数据,可以在此基础上继续深入研究实践。
3.5 操作数据表
对数据开发的人员来说,很多原始数据或者一手数据在都存在系统的数据库中,在账号安全可控的范围内,并且不涉及敏感数据的条件下,可以采用这种方式,下面以具体的示例进行演示说明。
3.5.1 准备一张业务数据表
我这里有一张如下的业务表,并且有一定数量的业务数据
sql
CREATE TABLE `order_waybill` (
`id` bigint NOT NULL COMMENT '雪花ID主键',
`waybill_code` varchar(64) CHARACTER SET utf8mb3 COLLATE utf8mb3_general_ci NOT NULL DEFAULT '' COMMENT '物流运单号',
`ship_date` datetime DEFAULT NULL COMMENT '装运日期',
`warehouse_code` varchar(64) CHARACTER SET utf8mb3 COLLATE utf8mb3_general_ci DEFAULT '' COMMENT ' w仓库代码',
`type` varchar(100) CHARACTER SET utf8mb3 COLLATE utf8mb3_general_ci NOT NULL DEFAULT '' COMMENT '物流公司类型',
`create_time` datetime DEFAULT CURRENT_TIMESTAMP COMMENT '创建时间',
PRIMARY KEY (`id`) USING BTREE,
) ENGINE=InnoDB DEFAULT CHARSET=utf8mb3 ROW_FORMAT=DYNAMIC COMMENT='物流运单表';
3.5.2 数据分析与操作
基于上述的业务数据表,接下来模拟真实的业务场景模拟几个维度的数据处理
1)统计过去一段时间的运单数据量
给出如下的提示词
bash
根据这个文档提供的信息,根据create_time字段查询一下2026年产生的运单总数

最终得到了符合要求的运单数量统计

2)统计过去一段时间各个物流渠道产生的订单数量
给出如下提示词
bash
根据tms_type这个字段统计一下2026年各个物流渠道产生的订单数量


细心的同学应该会发现,基于这种操作,其实就是通过自然语言通过转成sql操作数据表,更多复杂的场景可以继续基于上面的操作延伸下去,只要提供的背景信息足够清晰明确,Codex 均可以完成数据的操作、查询。
3.6 内置数据分析插件使用
事实上,在Codex 中还内置了一些数据分析插件(下图中内置的excel处理插件,Data Analytics 数据分析插件),使用者直接基于这些数据分析插件即可开箱即用,或者引入外部的三方数据处理插件,解决特定场景下的数据分析问题,最后,如果是比较个性化或者高度定制化的场景,可以将某一次完整处理数据的过程封装成技能,以备后续类似场景下的使用。


四、写在文末
本文通过较大的篇幅详细介绍了如何使用Codex 处理日常工作中的一些数据分析的场景,更多的业务场景有兴趣的同学可以继续此做更多的研究,本篇到此结束,感谢观看。