🐍 Python 深度研究
本目录收录 Python 语言核心机制、高级特性、工程实践及底层原理的深度研究笔记。
🧭 知识图谱 (Knowledge Graph)
01. 基础与工程 (Core & Engineering)
- 代码规范:简明 Python 代码规范 (AI Rules)
- 变量与类型:变量工程指南 (解包、命名哲学、类型注解)
- 注释与文档:注释与文档指南 (Google Style Docstring)
- 数值计算:数值工程指南 (浮点陷阱、Decimal、魔术数字)
- 字符串处理:字符串工程指南 (F-string、编码、性能优化)
- 容器与集合:容器工程指南 (底层实现、可变性、自定义容器)
- 流程控制:异常处理最佳实践、上下文管理器 (
with)
02. 数据获取与爬虫 (Web Scraping)
- 爬虫原理:基础原理与反爬对抗 (HTTP/2/3, TLS 指纹, 浏览器指纹, Ajax 机制)
- 网络请求:请求库详解 (urllib, requests, httpx, curl_cffi, 异步并发, Playwright)
- 解析技术:解析库详解 (XPath, BeautifulSoup, pyquery, parsel, 智能解析)
- 数据存储:存储方案详解 (文件, MySQL, MongoDB, Redis, Elasticsearch, RabbitMQ)
- 框架应用:Scrapy 与分布式 (Scrapy, Scrapy-Redis, 布隆过滤器, 部署管理)
- 反爬对抗:反爬机制与对抗 (代理池, 账号池, 验证码, 字体/CSS 混淆)
- JS 逆向:JavaScript 逆向技术 (断点定位, Hook, AST, 补环境, WASM)
- App 爬取:App 数据爬取与协议分析 (抓包, SSL Pinning, UI 自动化, 协议逆向)
03. 数据分析与可视化 (Data Analysis)
面向投融资测算、能源与政策数据的实际处理需求,重点不在 API 罗列,而在 什么场景该用哪个工具、以及各自的性能与精度边界。
- NumPy:向量化运算核心 (ndarray 内存布局、广播规则、向量化 vs 循环的量级差异、
float64在财务计算中的精度陷阱) - Pandas:数据清洗与高级处理 (索引与视图/副本之辨、
groupby分组聚合、窗口函数、时间序列重采样、合并与连接的语义差异) - Polars:新一代高性能数据处理库 (惰性求值与查询优化、与 Pandas 的 API 差异与迁移成本、何时值得换)
- 可视化:Matplotlib / Seaborn (图表类型选择依据、中文字体配置、导出适合文档嵌入的矢量图)
- Streamlit:把分析脚本变成可交互页面 (与静态图表的取舍、状态管理、部署方式)
04. 机器学习与 AI 工程 (ML Engineering)
💡 与 AI 知识库 的边界
research/ai/ 收录与语言无关的 AI 知识——模型能力、Agent 架构、提示词方法论、评估体系。 本类只收 用 Python 做机器学习的工程实现:数据管道、训练、调参、部署。
因此 LLM 应用(LangChain / LlamaIndex)与 Prompt Engineering 两条已移出本类, 归入 AI 知识库——那边已有 Prompt Engineering 完全指南 与 AI Agent 完全指南。
- Scikit-learn:传统机器学习 (estimator/transformer 统一接口、Pipeline 防数据泄漏、交叉验证与超参搜索、特征工程)
- 模型评估:指标选择与陷阱 (准确率在不平衡数据上的失效、精确率召回率取舍、回归指标、过拟合识别)
- PyTorch:深度学习基础 (张量与自动微分、训练循环骨架、数据加载、GPU 与显存管理)
- 工程化:从 notebook 到可复现 (实验记录、模型序列化与版本、推理服务化)