将时间序列转换为分类问题

本文将以股票交易作为示例。我们用 ai 模型预测股票第二天是涨还是跌。在这种背景下，对 xgboost、随机森林和逻辑分类器这三种分类算法进行了比较。文章的另外一个重点是数据准备。我们必须如何转换数据以便模型可以处理它。

☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 免费无限量使用 DeepSeek R1 模型☜☜☜

本文将按照CRISP-DM流程模型的步骤，使用结构化方法来解决业务案例。CRISP-DM是潜在分析中广泛采用的方法，通常被应用于构建数据科学项目中。

另外就是我们将使用 Python 包 openbb。这个包包括了金融部门的一些数据源，使用起来非常方便。

首先就是安装必须的库：

pip install pandas numpy “openbb[all]” swifter scikit-learn

业务理解

首先应该了解我们要解决的问题，在我们的例子中，可以将问题定义如下：

预测股票代码 AAPL 的股价第二天会上涨还是下跌。

然后就是应该考虑手头有什么样的机器学习模型的问题。我们想预测第二天股票是上涨还是下跌。因此，此处涉及的是二元分类问题，其中要预测的是股票第二天上涨（值为1）还是下跌（值为0）。在分类问题中，我们预测一个类别。在我们的例子中，是一个 0 类和 1 类的二元分类。

数据理解和准备

数据理解阶段侧重于识别、收集和分析数据集。第一步，我们下载 Apple 股票数据。以下是如何使用 openbb 执行此操作：

data = openbb.stocks.load(symbol = 'AAPL',start_date = '2025-01-01',end_date = '2025-04-01',monthly = False) data

该代码下载 2025-01-01 和 2025-04-01 之间的数据。下载的数据包含以下信息：

Open：美元每日开盘价
High：当日最高价（美元）
Low：当日最低价（美元）
Close：美元每日收盘价
Adj Close：与股息或股票分割相关的调整后收盘价
Volume：交易的股票数量
Dividends：已付股息
Stock Splits：股票分割执行

我们已经下载了数据，但是数据还不适合建模分类模型。所以仍然需要为建模准备数据。因此需要开发一个函数下载数据，再进行数据转换以便进行建模。以下代码显示了此功能：

def get_training_data(symbol, start_date, end_date, monthly_bool=True, lookback=10): data = openbb.stocks.load( symbol = symbol, start_date = start_date, end_date = end_date, monthly = monthly_bool) data = get_label(data) data_up_down = data['up_down'].to_numpy() training_data = get_sequence_data(data_up_down, lookback) return training_data

这里面包含的第一个函数时get_label()：

def encoding(n): if n > 0: return 1 else: return 0 def get_label(data): data['Delta'] = data['Close'] - data['Open'] data['up_down'] = data['Delta'].swifter.apply(lambda d: encoding(d)) return data

他的主要工作是：计算收盘价和开盘价之间的差值。我们将股价上涨的所有日期标记为 1，而将股价下跌的所有日期标记为 0。另外的up_down列包含股票价格在特定日期是上涨还是下跌。这里使用 swifter.apply() 函数替代 pandas apply()是因为 swifter 提供多核支持。

第二个函数是get_sequence_data()。参数 lookback 指定预测中包含过去多少天。get_sequence_data()代码如下：

def get_sequence_data(data_up_down, lookback): shape = (data_up_down.shape[0] - lookback + 1, lookback) strides = data_up_down.strides + (data_up_down.strides[-1],) return np.lib.stride_tricks.as_strided(data_up_down, shape=shape, strides=strides)

该函数接受两个参数：data_up_down 和 lookback。它返回一个新的 NumPy 数组，该数组表示具有指定窗口大小的 data_up_down 数组的滑动窗口视图，该窗口大小由 lookback 参数确定。为了说明这个函数是如何工作的，我们看一个小例子。

get_sequence_data(np.array([1, 2, 3, 4, 5, 6]), 3)

结果如下:

array([[1, 2, 3],[2, 3, 4],[3, 4, 5],[4, 5, 6]])

在下文中，我们下载 Apple 股票的数据并对其进行转换以进行建模。我们使用 10 天的回溯期。

data = get_training_data(symbol = 'AAPL', start_date = '2025-01-01', end_date = '2025-04-01', monthly_bool = False, lookback=10) pd.DataFrame(data).to_csv("data/data_aapl.csv")

数据已经准备完毕了，我们开始建模和评估模型。

建模

将数据读入数据并生成测试和训练数据。

data = pandas.read_csv("./data/data_aapl.csv") X=data.iloc[:,:-1] Y=data.iloc[:,-1] X_train, X_test, y_train, y_test = train_test_split(X, Y, test_size=0.33, random_state=4284, stratify=Y)

逻辑回归：

该分类器是基于线性的模型，通常用作基线模型。我们使用scikit-learn的实现：

model_lr = LogisticRegression(random_state = 42) model_lr.fit(X_train,y_train) y_pred = model_lr.predict(X_test)

XGBoost：

XGBoost 是为速度和性能而设计的梯度提升决策树的实现。它属于树提升算法，将许多弱树分类器依次连接。

model_xgb = XGBClassifier(random_state = 42) model_xgb.fit(X_train, y_train) y_pred = model_xgb.predict(X_test)

随机森林：

随机森林构建多个决策树。Bagging方法被称为集成学习的一种，因为它利用多个相互连接的学习器来进行学习。首字母缩写词“bagging”代表引导聚合。这里也使用scikit-learn的实现：

model_rf = RandomForestClassifier(random_state = 42) model_rf.fit(X_train, y_train) y_pred = model_rf.predict(X_test)

评估

建模和训练模型后，我们需评估其在测试数据上的表现。Recall、Precision 和 F1-Score 是用于测量指标的。下表显示了结果。

可以看到逻辑分类器（逻辑回归）和随机森林取得了明显优于XGBoost模型的结果，这是什么原因呢？这是因为数据比较简单，只有几个维度的特征，并且数据的长度也很小，我们所有的模型也没有进行调优。

总结

我们这篇文章的主要目的是介绍如何将股票价格的时间序列转换为分类问题，并且演示如何在数据处理时使用窗口函数将时间序列转换为一个序列，至于模型并没有太多的进行调优，所以对于效果评估来说越简单的模型表现得就越好。

# 人工智能 # Python # scikit-learn # numpy # pandas # 算法 # 第二天 # 的是 # 多个 # 多核 # 转换为 # 值为 # 当日 # 是一个 # 几个 # 是因为

相关栏目：【 Google疑问12 】【 Facebook疑问10 】【网络优化91478 】【技术知识72672 】【云计算0 】【 GEO优化84317 】【优选文章0 】【营销推广36048 】【网络运营41350 】【案例网站102563 】【 AI智能45237 】

2023-05-18

2025年中国汽车出口总量达832万辆纯电动占比28% OpenJudge— 阿里云和通义开源的AI应用自动化评测框架云米科技CEO给员工奖励小米YU7：期待能奖励更多台 D4RT— 谷歌推出的动态4D重建与追踪模型 2025中国市场百万超跑销量榜出炉：保时捷911领跑 2025年泰国汽车市场品牌销量榜单揭晓：丰田第一！毕业季/求职季必备！AI生成头像的4种实用场景（证件照风/商务形象/创意简历）情侣头像不求人！用AI生成专属二人世界的5种创意风格（动漫CP/古风画卷/电影海报） AI生成头像能商用吗？版权风险全解析（哪些平台可商用？如何避免侵权？）不用下载！在线AI生成头像的5个网站（手机秒出图，支持微信头像尺寸）朋友圈换头像指南｜3步用AI制作专属头像：输入描述→选模型→一键生成（小白必看）从照片到艺术品：一键生成AI头像的4个步骤详解（上传参考图→优化指令→风格迁移）别只用二次元了！探索AI生成头像的8个小众艺术流派（像素风/水墨画/波普艺术） AI生成头像 vs 专业约稿：哪个性价比更高？深度评测5大平台后我有了答案 2026年AI生成头像免费玩！年度TOP8在线工具盘点（免登录/出图快/风格多）懒人必备！5个“一句话”就能出图的AI头像网站（支持白话文/自动美化/创意无限） AI生成头像的隐私安全吗？7个主流平台隐私政策深度解读（如何保护个人照片）不用PS！在线AI生成头像的6个神级网站（零基础/支持中文指令/即刻出图） 2026年设计师新宠！7款激发灵感的AI头像生成器（概念艺术/角色设计/情绪表达） AI朋友圈文案生成器，一键解决你的社交文案荒

了解您产品搜索量及市场趋势，制定营销计划

同行竞争及网站分析保障您的广告效果

点击免费数据支持

提交您的需求，1小时内享受我们的专业解答。

南京市珐之弘网络技术有限公司

南京市珐之弘网络技术有限公司专注海外推广十年,是谷歌推广.Facebook广告全球合作伙伴,我们精英化的技术团队为企业提供谷歌海外推广+外贸网站建设+网站维护运营+Google SEO优化+社交营销为您提供一站式海外营销服务。

4008794355

87067657

13565296790

87067657@qq.com

服务/方案/案例/支持

产品服务

解决方案

营销案例

营销学院

关于我们

公司简介

报名培训

加入我们

4008794355

将时间序列转换为分类问题

业务理解

数据理解和准备

建模

评估

总结

了解您产品搜索量及市场趋势，制定营销计划

同行竞争及网站分析保障您的广告效果

提交您的需求，1小时内享受我们的专业解答。

南京市珐之弘网络技术有限公司

4008794355

服务/方案/案例/支持

关于我们

Notice