跳转到正文

← 返回 深度研究

🐍 Python 深度研究

本目录收录 Python 语言核心机制、高级特性、工程实践及底层原理的深度研究笔记。


🧭 知识图谱 (Knowledge Graph)

01. 基础与工程 (Core & Engineering)

02. 数据获取与爬虫 (Web Scraping)

03. 数据分析与可视化 (Data Analysis)

面向投融资测算、能源与政策数据的实际处理需求,重点不在 API 罗列,而在 什么场景该用哪个工具、以及各自的性能与精度边界

  • NumPy:向量化运算核心 (ndarray 内存布局、广播规则、向量化 vs 循环的量级差异、float64 在财务计算中的精度陷阱)
  • Pandas:数据清洗与高级处理 (索引与视图/副本之辨、groupby 分组聚合、窗口函数、时间序列重采样、合并与连接的语义差异)
  • Polars:新一代高性能数据处理库 (惰性求值与查询优化、与 Pandas 的 API 差异与迁移成本、何时值得换)
  • 可视化:Matplotlib / Seaborn (图表类型选择依据、中文字体配置、导出适合文档嵌入的矢量图)
  • Streamlit:把分析脚本变成可交互页面 (与静态图表的取舍、状态管理、部署方式)

04. 机器学习与 AI 工程 (ML Engineering)

💡 与 AI 知识库 的边界

research/ai/ 收录与语言无关的 AI 知识——模型能力、Agent 架构、提示词方法论、评估体系。 本类只收 用 Python 做机器学习的工程实现:数据管道、训练、调参、部署。

因此 LLM 应用(LangChain / LlamaIndex)与 Prompt Engineering 两条已移出本类, 归入 AI 知识库——那边已有 Prompt Engineering 完全指南AI Agent 完全指南

  • Scikit-learn:传统机器学习 (estimator/transformer 统一接口、Pipeline 防数据泄漏、交叉验证与超参搜索、特征工程)
  • 模型评估:指标选择与陷阱 (准确率在不平衡数据上的失效、精确率召回率取舍、回归指标、过拟合识别)
  • PyTorch:深度学习基础 (张量与自动微分、训练循环骨架、数据加载、GPU 与显存管理)
  • 工程化:从 notebook 到可复现 (实验记录、模型序列化与版本、推理服务化)