[原创][R语言]股票分析实战[8]:因子与subset的关系

[简介]

常用网名: 猪头三

出生日期: 1981.XX.XX

QQ联系: 643439947

个人网站: 80x86汇编小站 https://www.x86asm.org

编程生涯: 2001年~至今[共22年]

职业生涯: 20年

开发语言: C/C++、80x86ASM、PHP、Perl、Objective-C、Object Pascal、C#、Python

开发工具: Visual Studio、Delphi、XCode、Eclipse、C++ Builder

技能种类: 逆向 驱动 磁盘 文件

研发领域: Windows应用软件安全/Windows系统内核安全/Windows系统磁盘数据安全/macOS应用软件安全

项目经历: 磁盘性能优化/文件系统数据恢复/文件信息采集/敏感文件监测跟踪/网络安全检测

[序言]

在股票数据分析中, "方差分析"是非常重要的技术. 那么"方差分析"就会涉及的因子. 因子的处理, 会涉及到"方差分析"的平衡性处理, 平衡 与 非平衡.

[因子 与 subset函数]

记录一个细节: 当有一个数据框, 需要进行"方差分析"时, 为了保证观测数的平衡性, 即每组分类的观测数是一样的. 尽量使用subset()函数来进行数据抽取. 而不是用 rbind()或者cbind()来做数据抽取. 这是因为subset()函数不会改变因子的数量.

[代码示例]

假如有一个数据框stock_demo包含一个Days列, 内容是周内第N天, 类型为因子, 数据如下:

1

3

4

3

2

2

2

1

3

R 复制代码
stock_demo_sub <- subset(stock_demo, Days = '3') #把因子为3的行内容提取出来并形成一个新的数据框 stock_demo_sub
table(stock_demo_sub) # 统计因子的频数. 这时你会发现, stock_demo_sub 仍然会保留所有的因子, 即 1 2 3 4

[结尾]

很多人在做"方差分析"的时候, 为什么结果不准确, 其实就是因子被破坏的问题, 导致了"方差分析"的平衡性倾向于非平衡, 在"非平衡模式"分析下, 不如"平衡模式"分析准确.

相关推荐
SelectDB20 分钟前
5000+ 中大型企业首选的 Doris,在稳定性的提升上究竟花了多大的功夫?
大数据·数据库·apache
最初的↘那颗心35 分钟前
Flink Stream API 源码走读 - window 和 sum
大数据·hadoop·flink·源码·实时计算·窗口函数
烟锁池塘柳02 小时前
【R语言】R 语言中打印含有双引号的字符串时会出现 “\” 的原因解析
r语言
Yusei_05233 小时前
迅速掌握Git通用指令
大数据·git·elasticsearch
一只栖枝9 小时前
华为 HCIE 大数据认证中 Linux 命令行的运用及价值
大数据·linux·运维·华为·华为认证·hcie·it
喂完待续13 小时前
Apache Hudi:数据湖的实时革命
大数据·数据仓库·分布式·架构·apache·数据库架构
青云交13 小时前
Java 大视界 -- 基于 Java 的大数据可视化在城市交通拥堵治理与出行效率提升中的应用(398)
java·大数据·flink·大数据可视化·拥堵预测·城市交通治理·实时热力图
还是大剑师兰特19 小时前
Flink面试题及详细答案100道(1-20)- 基础概念与架构
大数据·flink·大剑师·flink面试题
189228048611 天前
NY243NY253美光固态闪存NY257NY260
大数据·网络·人工智能·缓存
武子康1 天前
大数据-70 Kafka 日志清理:删除、压缩及混合模式最佳实践
大数据·后端·kafka