type: daily_notetitle: Phase 2.1 Day 5 — 特征缩放 特征工程 多项式回归 逻辑回归动机date: 2026-07-24person: 吴恩达phase: 2.1day: 5topics:[特征缩放,Z-score归一化,均值归一化,学习率选择,检查收敛,特征工程,多项式回归,逻辑回归动机,]---# 2026-07-24 学习笔记## 笔记区### 核心观点- **特征缩放Feature Scaling**特征取值范围差异大时梯度下降 zigzag 收敛慢。把特征缩放到相近范围等高线从椭圆变圆梯度下降走直线- **均值归一化 x (x-μ)/(max-min)**先平移中心化到0再压缩值域范围约[-1,1]。受异常值影响大极值同时拉偏 μ 和 max-min- **Z-score 归一化 x (x-μ)/σ**表示该点离均值几个标准差。3σ 原则大部分值在 [-3,3]。受异常值影响小实际工作默认用这个- **检查收敛**画 J(w,b) vs 迭代次数的学习曲线曲线上升或震荡 → 学习率太大- **学习率选择**从 0.001 开始每次 ×30.001→0.003→0.01→0.03→0.1→0.3→1找到让 J 稳定下降的最大值- **特征工程**从已有特征构造新特征如 frontage×depth area。如循环次数×放电深度 综合老化指标- **多项式回归**数据非线性时用 ŷ w₁x w₂x² w₃x³ b。做多项式回归必须先做特征缩放否则 x, x², x³ 取值范围差几个数量级- **逻辑回归动机**线性回归做分类的缺陷——异常值拉偏决策边界。需要新算法让输出永远在 [0,1] 之间### 关键方法/流程**特征缩放对比**| | 均值归一化 | Z-score 归一化 || ---------- | ------------------------ | -------------- || 公式 | (x-μ)/(max-min) | (x-μ)/σ || 结果范围 | 约 [-1, 1] | 约 [-3, 3] || 异常值影响 | ❌ 大极值均值双重影响 | ✅ 小 || 使用场景 | 罕见 | ✅ 默认选择 |**学习率调试流程**α 0.001 → 跑梯度下降 → 画 J 曲线曲线下降正常→ 可以尝试再大一点×3曲线震荡/上升→ 减小 3 倍重复直到找到最大的让 J 稳定下降的 α**特征缩放的物理意义** 把不等长量纲的特征放到同一把尺子上量让梯度下降在每个方向上的步长差不多。### 实战记录- **Lab03Feature Scaling and Learning Rate**对比特征缩放前后的梯度下降路径——缩放前 zigzag 几十步才收敛缩放后直奔最低点。调 α 观察 J 曲线的变化α 太小时 J 下降慢α 太大时 J 震荡上升- **Lab04FeatEng_PolyReg**用面积²和面积³做多项式回归拟合曲线发现不做特征缩放梯度下降根本跑不动---## 线索区学完后合上材料自问自答**Q: 特征缩放解决了什么问题**A: 特征取值范围差异大时代价函数的等高线被压扁成椭圆梯度下降在陡峭方向来回震荡zigzag收敛极慢。特征缩放把等高线变圆梯度下降走直线。**Q: Z-score 归一化和均值归一化有什么区别工程上怎么选**A: 均值归一化除以极差Z-score 除以标准差。Z-score 受异常值影响小极值和均值都会被异常值拉偏工程上默认用 Z-scoresklearn 的 StandardScaler。**Q: 为什么多项式回归前必须做特征缩放**A: 假设 x50则 x²2500x³125000。三个特征取值范围差几千倍不做缩放梯度下降 zigzag 极其严重根本收敛不了。**Q: 学习率 α 太大和太小分别有什么现象**A: 太大 → J 曲线震荡或上升发散太小 → J 曲线稳定下降但速度很慢。调试方法从 0.001 开始每次 ×3观察 J 曲线。**Q: 为什么线性回归不能直接做分类**A: 线性回归输出是任意实数。一个异常值就能把决策边界拉偏。分类需要输出 0 到 1 之间的概率需要新算法逻辑回归。**Q: Lab03 里的特征缩放前后的收敛对比具体说明了什么**A: 缩放前梯度下降的路径是 zigzag 的需要很多步才收敛缩放后路径几乎是直线指向最低点几步就收敛。同样迭代次数下缩放后的代价下降快得多。---## 总结50字以内特征缩放解决多特征取值差异大导致梯度下降慢的问题。Z-score 默认用。学习率从 0.001 试起。---## 复习卡片| 概念 | 一句话 | 我的场景 || ---------- | -------------------------------------------- | ------------------------------------------ || 特征缩放 | 把不同范围的特征拉到相近尺度梯度下降走直线 | 多特征场景温度×循环次数×电压训练前必做 || Z-score | (x-μ)/σ离均值几个标准差 | 实际工作默认选择 || 均值归一化 | (x-μ)/(max-min)范围约[-1,1] | 异常值少时可用但不如 Z-score || 学习率调试 | 0.001→×3 循环试看 J 曲线 | 梯度下降不收敛时的标准排查法 || 特征工程 | 从旧特征造新特征面积²、交叉特征 | 储能循环次数×放电深度综合老化指标 || 多项式回归 | ŷwx w₂x² w₃x³ b 拟合曲线 | 电池容量衰减不是直线需要多项式拟合 |
准大二学生从0开始学AI——机器学习Day5
type: daily_notetitle: Phase 2.1 Day 5 — 特征缩放 特征工程 多项式回归 逻辑回归动机date: 2026-07-24person: 吴恩达phase: 2.1day: 5topics:[特征缩放,Z-score归一化,均值归一化,学习率选择,检查收敛,特征工程,多项式回归,逻辑回归动机,]---# 2026-07-24 学习笔记## 笔记区### 核心观点- **特征缩放Feature Scaling**特征取值范围差异大时梯度下降 zigzag 收敛慢。把特征缩放到相近范围等高线从椭圆变圆梯度下降走直线- **均值归一化 x (x-μ)/(max-min)**先平移中心化到0再压缩值域范围约[-1,1]。受异常值影响大极值同时拉偏 μ 和 max-min- **Z-score 归一化 x (x-μ)/σ**表示该点离均值几个标准差。3σ 原则大部分值在 [-3,3]。受异常值影响小实际工作默认用这个- **检查收敛**画 J(w,b) vs 迭代次数的学习曲线曲线上升或震荡 → 学习率太大- **学习率选择**从 0.001 开始每次 ×30.001→0.003→0.01→0.03→0.1→0.3→1找到让 J 稳定下降的最大值- **特征工程**从已有特征构造新特征如 frontage×depth area。如循环次数×放电深度 综合老化指标- **多项式回归**数据非线性时用 ŷ w₁x w₂x² w₃x³ b。做多项式回归必须先做特征缩放否则 x, x², x³ 取值范围差几个数量级- **逻辑回归动机**线性回归做分类的缺陷——异常值拉偏决策边界。需要新算法让输出永远在 [0,1] 之间### 关键方法/流程**特征缩放对比**| | 均值归一化 | Z-score 归一化 || ---------- | ------------------------ | -------------- || 公式 | (x-μ)/(max-min) | (x-μ)/σ || 结果范围 | 约 [-1, 1] | 约 [-3, 3] || 异常值影响 | ❌ 大极值均值双重影响 | ✅ 小 || 使用场景 | 罕见 | ✅ 默认选择 |**学习率调试流程**α 0.001 → 跑梯度下降 → 画 J 曲线曲线下降正常→ 可以尝试再大一点×3曲线震荡/上升→ 减小 3 倍重复直到找到最大的让 J 稳定下降的 α**特征缩放的物理意义** 把不等长量纲的特征放到同一把尺子上量让梯度下降在每个方向上的步长差不多。### 实战记录- **Lab03Feature Scaling and Learning Rate**对比特征缩放前后的梯度下降路径——缩放前 zigzag 几十步才收敛缩放后直奔最低点。调 α 观察 J 曲线的变化α 太小时 J 下降慢α 太大时 J 震荡上升- **Lab04FeatEng_PolyReg**用面积²和面积³做多项式回归拟合曲线发现不做特征缩放梯度下降根本跑不动---## 线索区学完后合上材料自问自答**Q: 特征缩放解决了什么问题**A: 特征取值范围差异大时代价函数的等高线被压扁成椭圆梯度下降在陡峭方向来回震荡zigzag收敛极慢。特征缩放把等高线变圆梯度下降走直线。**Q: Z-score 归一化和均值归一化有什么区别工程上怎么选**A: 均值归一化除以极差Z-score 除以标准差。Z-score 受异常值影响小极值和均值都会被异常值拉偏工程上默认用 Z-scoresklearn 的 StandardScaler。**Q: 为什么多项式回归前必须做特征缩放**A: 假设 x50则 x²2500x³125000。三个特征取值范围差几千倍不做缩放梯度下降 zigzag 极其严重根本收敛不了。**Q: 学习率 α 太大和太小分别有什么现象**A: 太大 → J 曲线震荡或上升发散太小 → J 曲线稳定下降但速度很慢。调试方法从 0.001 开始每次 ×3观察 J 曲线。**Q: 为什么线性回归不能直接做分类**A: 线性回归输出是任意实数。一个异常值就能把决策边界拉偏。分类需要输出 0 到 1 之间的概率需要新算法逻辑回归。**Q: Lab03 里的特征缩放前后的收敛对比具体说明了什么**A: 缩放前梯度下降的路径是 zigzag 的需要很多步才收敛缩放后路径几乎是直线指向最低点几步就收敛。同样迭代次数下缩放后的代价下降快得多。---## 总结50字以内特征缩放解决多特征取值差异大导致梯度下降慢的问题。Z-score 默认用。学习率从 0.001 试起。---## 复习卡片| 概念 | 一句话 | 我的场景 || ---------- | -------------------------------------------- | ------------------------------------------ || 特征缩放 | 把不同范围的特征拉到相近尺度梯度下降走直线 | 多特征场景温度×循环次数×电压训练前必做 || Z-score | (x-μ)/σ离均值几个标准差 | 实际工作默认选择 || 均值归一化 | (x-μ)/(max-min)范围约[-1,1] | 异常值少时可用但不如 Z-score || 学习率调试 | 0.001→×3 循环试看 J 曲线 | 梯度下降不收敛时的标准排查法 || 特征工程 | 从旧特征造新特征面积²、交叉特征 | 储能循环次数×放电深度综合老化指标 || 多项式回归 | ŷwx w₂x² w₃x³ b 拟合曲线 | 电池容量衰减不是直线需要多项式拟合 |