{T}

开发环境与工具

工欲善其事,必先利其器。本章介绍数据科学开发环境的搭建方法,以及常用扩展库的安装使用。

环境组成

一套高效的数据科学开发环境由三部分构成:

  • Python 运行时:使用 Anaconda 提供,预装 150+ 数据科学常用包,并支持多环境隔离。
  • 代码编辑器:使用 VS Code,配合 Python / Jupyter 插件,获得代码联想、错误提示与 Notebook 编辑能力。
  • Notebook 交互环境:Jupyter Notebook,实现代码与文本混排,是数据分析的主力工作形态。
图表渲染中…

安装 Anaconda

  1. 访问 Anaconda 官网,根据设备类型(Mac / Windows)选择 Graphical Installer
  2. 双击安装包,一路 Next / I Agree,保持默认位置安装即可(约需 2~3 分钟)。
  3. 安装完成后,打开 Anaconda Navigator,即可看到全部工具(Jupyter Notebook、Spyder、Qt Console 等)。

对数据分析而言,Anaconda 预装的科学计算库(NumPy、Pandas、Matplotlib 等)正是首选,无需逐个手动安装。

配置 VS Code

  1. 安装 VS Code:访问 code.visualstudio.com 下载安装,默认配置即可。
  2. 安装中文语言包(可选):插件面板搜索 Chinese,安装后重启生效。
  3. 安装 Python 插件:插件面板搜索 Python,安装列表第一个插件。
  4. 安装 Jupyter 插件:插件面板搜索 Jupyter,安装微软官方出品的插件。

关联 Python 环境

新建 hello.py 文件后,状态栏会显示当前 Python 环境(如 Python 3.8.5 64-bit (conda))。如果不是 Conda 环境,点击状态栏环境名,选择带 Conda 字样的环境即可。

Jupyter Notebook 基本操作

在 VS Code 中按 CTRL+P(Mac 为 CMD+P),输入 > Jupyter,选择 Jupyter: Create New Blank Jupyter Notebook 创建 Notebook。

Notebook 由多个 Cell 组成,分为两种类型:

  • 代码 Cell:编写 Python 代码,可单独执行,结果展示在 Cell 下方。
  • 文本 Cell:编写分析思路与推导逻辑,实现代码与文本混排。

Notebook 界面分为三个区域:

  • 主操作区:运行全部 / 上一个 / 下一个 Cell、重启与中断 Kernel、插入 Cell、清空结果、查看变量、保存、导出。
  • 边栏操作区:不同位置的 + 号代表在不同位置插入 Cell。
  • Cell 操作区:运行当前 Cell(Shift+Enter)、切换代码/文本模式。

常用快捷键

快捷键功能
CTRL+P / CMD+P打开命令面板
Shift+Enter运行当前 Cell
CTRL+Enter运行当前 Cell(新版默认)
Esc退出 Cell 编辑状态

新版 Notebook 界面

新版 VS Code Notebook 提供了更简洁的 UI,功能一致。新版主操作区依次为:执行全部、清空输出、重启内核、查看变量、导出、分栏。当鼠标浮动在 Cell 上时,会出现执行上一个 / 下一个 Cell、拆分、删除等按钮。

常用扩展库

数据科学与数据挖掘相关的库可按用途分类:

类别用途
数值计算NumPy、SciPy多维数组、矩阵运算、科学计算
数据处理pandas基于 NumPy 的表格数据分析
可视化Matplotlib、Seaborn、Plotly静态 / 统计 / 交互图表
机器学习scikit-learn分类、回归、聚类、降维、预处理的统一框架
自然语言NLTK、Gensim文本处理、TF-IDF、word2vec
图像处理OpenCV图像与视频处理
深度学习TensorFlow、PyTorch、PaddlePaddle深度神经网络建模

查看模块内容的两个实用方法:dir(math) 列出模块所有方法,help(math) 查看模块描述与方法说明。

包管理

使用 pip

pip 是 Python 自带的包管理器:

bash
pip --version                  # 查看 pip 版本
pip install tensorflow         # 安装最新版
pip install tensorflow==1.14   # 安装指定版本
pip uninstall tensorflow       # 卸载
pip list                       # 查看已安装包

使用 conda

Anaconda 的 conda 既是包管理器也是环境管理器:

bash
# 创建环境(当前最新稳定版为 3.14)
conda create --name python-my python=3.14
# 激活 / 注销环境
activate python-my            # Linux: source activate python-my
deactivate                    # Linux: source deactivate
# 安装包
conda install matplotlib
# 查看环境
conda info -e
# 导出 / 重建环境
conda env export > environment.yaml
conda env create -f environment.yaml

多环境隔离是 conda 的核心优势:不同项目可构建互不干扰的环境,环境可打包迁移到其他机器一键重建。

配置国内镜像源

pip 默认源可能下载中断,可临时或永久切换为国内镜像:

bash
# 临时切换(单条命令)
pip install tensorflow -i https://pypi.tuna.tsinghua.edu.cn/simple
# 永久修改默认源
pip config set global.index-url https://pypi.tuna.tsinghua.edu.cn/simple

常用镜像源:阿里云 https://mirrors.aliyun.com/pypi/simple/、中科大 https://pypi.mirrors.ustc.edu.cn/simple/、清华 https://pypi.tuna.tsinghua.edu.cn/simple/

验证环境

环境配置完成后,用以下代码验证 NumPy 与 Matplotlib 是否就绪(应输出柱状图):

python
import numpy as np
import matplotlib.pyplot as plt

labels = ['G1', 'G2', 'G3', 'G4', 'G5']
men_means = [20, 35, 30, 35, 27]
women_means = [25, 32, 34, 20, 25]
width = 0.35

fig, ax = plt.subplots()
ax.bar(labels, men_means, width, label='Men')
ax.bar(labels, women_means, width, bottom=men_means, label='Women')
ax.set_ylabel('Scores')
ax.set_title('Scores by group and gender')
ax.legend()
plt.show()

小结

  • 使用 Anaconda + VS Code + Jupyter 插件可搭建具备代码提示、错误提示与 Notebook 混排能力的高效开发环境。
  • 掌握 pip / conda 两种包管理方式,并善用国内镜像源解决下载中断问题。
  • 数据科学库可按数值计算、数据处理、可视化、机器学习、深度学习分类记忆,遇到问题知道去何处寻求方案即可。

延伸阅读

版本差异(数据科学栈 → 当前版本)

本文编写时当前稳定版升级要点
Python3.8-3.123.143.12+ 起性能显著提升;3.14 PEP 649/750
NumPy1.x/2.02.3.xnp.float_ 等别名移除;NEP 50 类型提升
Pandas1.x/2.x3.0.xCopy-on-Write 默认开启;inplace 移除;字符串 dtype 变化
Matplotlib3.x3.x 稳定版API 兼容,样式更新
Seaborn0.12/0.130.13.xAPI 稳定
scikit-learn1.x1.7.xAPI 稳定,新算法持续加入

本文讲解的数据分析流程(读取→清洗→分析→可视化)与核心 API 在最新版本中成立;升级时重点关注 Pandas 3.0 的 Copy-on-Write 与 NumPy 2.x 的类型变化。