Day 27

python 复制代码
import pandas as pd
from sklearn.ensemble import RandomForestClassifier
from sklearn.model_selection import train_test_split
from sklearn.metrics import accuracy_score
 
# 1. 加载数据集
train_data = pd.read_csv('/kaggle/input/titanic/train.csv')
test_data = pd.read_csv('/kaggle/input/titanic/test.csv')
 
# 2. 数据预处理
def preprocess(data):
    # 填充缺失值
    data['Age'].fillna(data['Age'].median(), inplace=True)
    data['Embarked'].fillna(data['Embarked'].mode()[0], inplace=True)
    data['Fare'].fillna(data['Fare'].median(), inplace=True)
    # 提取特征
    features = ['Pclass', 'Sex', 'Age', 'SibSp', 'Parch', 'Fare', 'Embarked']
    X = pd.get_dummies(data[features])  # 类别特征独热编码
    return X
 
X_train = preprocess(train_data)
y_train = train_data['Survived']
X_test = preprocess(test_data)
 
# 3. 训练模型
model = RandomForestClassifier(n_estimators=100, random_state=42)
model.fit(X_train, y_train)
 
# 4. 预测并生成提交文件
predictions = model.predict(X_test)
submission = pd.DataFrame({
    'PassengerId': test_data['PassengerId'],
    'Survived': predictions
})
submission.to_csv('submission.csv', index=False)

@浙大疏锦行

相关推荐
whitelbwwww2 分钟前
RKNN静态量化
人工智能·深度学习
Henry-SAP4 分钟前
AI标准落地加速 安全与应用双突破
人工智能·云原生·sap·erp
zzzll11119 分钟前
LangChain4j:Java 生态的 AI 应用开发利器
java·开发语言·人工智能
卷无止境10 分钟前
Coding Agent 里的上下文 Compact,到底在压缩什么
后端·python
卷无止境12 分钟前
社区里最好用的 Deep Research 技能,到底藏在哪几个仓库里
人工智能
飞哥数智坊19 分钟前
2步,TRAE SOLO 帮你画出架构图
人工智能
Patrick在香港22 分钟前
Claude Prompt Caching 实测账单:第一轮贵 25%,从第二轮开始省 86%
python·prompt·claude·成本优化·prompt缓存·anthropic api
新时代牛马25 分钟前
字符设备注册:从cdev_add 到chrdev_open 的 VFS路径
python
hahaha601625 分钟前
HLS高层次综合设计技巧--循环merge和循环split
人工智能·算法·计算机视觉
life16926 分钟前
python requests采集同花顺F10、龙虎榜数据
python·同花顺·龙虎榜