Python在大数据分析中的应用

作者

邱飞

发布于

2026年3月3日

前言

本教程是专门为商学院本科生设计的 Python 数据分析教材。在金融科技和大数据分析日益重要的今天,掌握 Python 已成为商科学生的核心竞争力之一。

本书的特点包括:

  • 实战导向:摒弃单纯的语法讲解,通过真实的中国金融市场数据来演示数据处理流程。
  • 易于理解:针对初学者添加了大量的解释性文字和过渡段落,力求将复杂的技术概念口语化、直观化。

完成全书后,学生应能独立交付一项可复核的中国金融数据研究,并能够:

  • 使用 Python、NumPy 与 Pandas 读取、校验、清洗、连接、聚合和可视化本地金融数据;
  • 根据内存预算、算子类型与物化成本,在 Pandas、Polars、DuckDB 和 Dask 之间作出有条件的工具选择;
  • 构造时点安全的结构化、时间序列与文本特征,并用断言检查数据血缘、口径和无前视边界;
  • 解释内存布局、列式存储、惰性执行、并行调度与跨工具交换可能发生复制的条件;
  • 综合使用本地长三角上市公司财务、日频和分钟行情,在拥有同一授权快照的前提下完成从数据审计到结果解释的可重复案例;若 Tick 目录没有符合地域规则的样本,则只报告可用性审计,不以外地公司替代。

前 10 章建立 Python 与表格分析基础;第 11—14 章讨论规模化计算的资源边界;第 15—17 章进入结构化与文本特征工程;第 18—19 章把数据时点、金融口径和分钟市场制度整合进完整案例。各章的核心练习只考核正文已讲授内容;标为“可选进阶”的单元不纳入基础学习成果评价。现有本地快照缺少完整上游获取日志和许可文本,因此“可重复”只指授权环境内的同快照运行,不等同于公开数据重建。