神经网络多分类一对多和 Softmax文章目录神经网络多分类一对多和 Softmax1. 选项从两个变成多个2. 一对多每个类确认一次2.1 放到一张网络里3. Softmax在类与类之间分概率4. 汽车例子按重量分三档5. 和多标签区分6. 动手Iris 上对比逻辑回归与 MLP7. 实现时几个容易混的点8. 适用边界与常见误区8.1 适用边界8.2 常见误区9. 关键术语速查10. 延伸阅读11. 小结摘要专栏前半段的分类多是「高效 / 非高效」二选一。车型档位、故障类型、手写数字这类问题选项往往有三个以上而且每个样本只属于其中一类。第 13 篇从通用角度介绍过多分类本篇把它接到神经网络输出层上讲清一对多one-vs-all和Softmax差在哪里、概率要不要加起来等于 1以及什么时候不该用 Softmax。适合读完浅层网络实践的读者。1. 选项从两个变成多个二分类输出一个概率p pp再靠阈值切成 0/1。多分类时标签变成0 , 1 , … , K − 1 0,1,\ldots,K-10,1,…,K−1模型要给出K KK个分数或概率最后通常取最大的那一类。二分类多分类单标签例子是否高效轻 / 中 / 重 三档输出1 个概率K KK个值约束p ∈ ( 0 , 1 ) p\in(0,1)p∈(0,1)Softmax 下各类概率和为 1和第 13 篇一样先分清多分类单选题每辆车只能落在一档多标签多选题一张图可以同时有「猫」和「户外」本篇默认讲单选题。多标签一般是每个标签各接一个 Sigmoid不要用 Softmax 硬凑。第 812 篇的阈值、混淆矩阵、精确率 / 召回率在多分类里仍然用得上只是混淆矩阵从2 × 2 2\times 22×2变成K × K K\times KK×K。第 13 篇已从「不用神经网络」的角度讲过 OvR / Softmax本篇重点是这些头接在 MLP 最后一层时该怎么选。2. 一对多每个类确认一次一对多One-vs-All / One-vs-Rest有K KK个类就准备K KK个二分类问题。对「轻 / 中 / 重」三档是不是轻对比不是轻是不是中是不是重预测时看哪个分类器最「肯定」或比较各自的分数。类数不多时这个想法很直观类数上到成百上千就维护成本高、也慢。2.1 放到一张网络里不必真的训练K KK个完全独立的模型。可以共用前面的隐藏层输出层放K KK个节点每个节点各自接Sigmoid每个输出表示「是不是这一类」的概率彼此独立估计。因此三者加起来不一定等于 1——有可能都偏低或都偏高。水果图的例子里网络可能给出「梨 0.84、葡萄 0.07……」加总超过 1这在一对多设定里并不奇怪它在分别回答「是不是梨」「是不是葡萄」而不是在「四种水果里只能选一个」的约束下分配概率。预测时常见做法是看哪一路 Sigmoid 输出最大就把该类当作预测若业务允许「都不像」也可以要求最大概率超过某阈值否则判为未知。阈值仍建议在验证集上定和第 09 篇同一思路。3. Softmax在类与类之间分概率若业务要求「轻、中、重三者互斥必须落在一档」更常见的是Softmax也常叫一对一 / one-vs-one 语境下的相对概率和第 13 篇用语一致即可。先对每个类算一个未归一化分数z j z_jzjlogits再p j e z j ∑ k 1 K e z k p_j \frac{e^{z_j}}{\sum_{k1}^{K} e^{z_k}}pj∑k1Kezkezj于是p j 0 p_j0pj0且∑ j p j 1 \sum_j p_j 1∑jpj1。可以把它看成逻辑回归里 Sigmoid 往多类的推广Sigmoid 处理「是 / 否」Softmax 处理「在K KK个选项里挑一个」。手算一个小数设三档分数z ( 1.0 , 2.0 , 0.0 ) z(1.0,\ 2.0,\ 0.0)z(1.0,2.0,0.0)则e 1 ≈ 2.72 , e 2 ≈ 7.39 , e 0 1 e^{1}\approx 2.72,\quad e^{2}\approx 7.39,\quad e^{0}1e1≈2.72,e2≈7.39,e01分母≈ 11.11 \approx 11.11≈11.11于是p ≈ ( 0.24 , 0.67 , 0.09 ) p \approx (0.24,\ 0.67,\ 0.09)p≈(0.24,0.67,0.09)「中」档分数最高概率也被抬得最高提高某一档的z zz会挤占其他档的概率——这就是「互相竞争」。一对多 SigmoidSoftmax各类是否互斥建模不强求强求概率互相挤占概率和是否为 1不一定是典型用途类可近似独立判断单标签多分类默认选择类特别多例如上万类时完整 Softmax 算分母会贵工程上会用候选采样等近似入门阶段类数不大用完整 Softmax 即可。数值上算 Softmax 时常先减去max k z k \max_k z_kmaxkzk再取指数避免e z e^{z}ez溢出。手算小例子不必纠结自己用 NumPy 实现时记得这一步。框架里的 Softmax 一般已处理稳定计算。4. 汽车例子按重量分三档把专栏里的重量粗分成三档标签演示用阈值可改档位条件千磅标签轻 3.0 3.03.00中3.0 3.03.04.0 4.04.01重 4.0 4.04.02二分类问「高不高效」这里问「偏轻、适中还是偏重」。特征仍可用重量、排量等输出层改为 3 个节点。若用 Softmax三个概率和为 1取 argmax 得档位。若用三个 Sigmoid更像三个独立「是不是这一档」的问题对互斥档位一般不如 Softmax 合适。损失方面Softmax 多分类常用交叉熵多类版 Log Loss。训练仍是前向算p pp、算损失、反向更新第 25 篇只是输出维数从 1 变成K KK。若训练集里「重」车特别少Softmax 仍可能偷懒少报「重」——第 20 篇的类别不平衡问题在多分类里同样存在需要看每类召回必要时加类别权重或重采样。5. 和多标签区分场景该用什么每张图只有一种主果蔬Softmax 多分类一碗里同时有苹果和橙子多个 Sigmoid / 多个二分类不用Softmax邮件垃圾 / 正常二分类 Sigmoid 即可故障码互斥的 5 种故障SoftmaxSoftmax 的假设是每个样本恰好属于一类。不满足就换输出头别硬套。训练标签也要一致若标注规范里允许「既算中型又算偏重」那是多标签问题应拆成多个是/否而不是强行塞进三个互斥档。和业务对齐标签定义往往比纠结隐藏层宽度更重要。6. 动手Iris 上对比逻辑回归与 MLPfromsklearn.datasetsimportload_irisfromsklearn.model_selectionimporttrain_test_splitfromsklearn.preprocessingimportStandardScalerfromsklearn.pipelineimportPipelinefromsklearn.linear_modelimportLogisticRegressionfromsklearn.neural_networkimportMLPClassifierfromsklearn.metricsimportaccuracy_score,log_loss,classification_report X,yload_iris(return_X_yTrue)X_train,X_test,y_train,y_testtrain_test_split(X,y,test_size0.25,random_state0,stratifyy)defeval_model(name,clf):pipePipeline([(scaler,StandardScaler()),(clf,clf)])pipe.fit(X_train,y_train)probapipe.predict_proba(X_test)predpipe.predict(X_test)print(name,{acc:round(accuracy_score(y_test,pred),3),logloss:round(log_loss(y_test,proba),3),})# Softmax 概率应按行求和为 1print( prob row sums:,proba.sum(axis1).round(3)[:5],...)returnpipe# 逻辑回归多分类默认可用 Softmaxmultinomialeval_model(logreg,LogisticRegression(max_iter1000,multi_classmultinomial),)eval_model(mlp,MLPClassifier(hidden_layer_sizes(8,),activationrelu,learning_rate_init0.01,max_iter2000,random_state0,),)看两件事准确率 / log loss 是否合理proba每一行是否加起来接近 1Softmax 行为。MLPClassifier在多类问题上会走 Softmax 风格的输出若你自己用底层框架搭网络输出层要明确写成 Softmax 交叉熵别和隐藏层的 ReLU 搞混。汽车三档数据可以把y换成按重量分箱的标签特征用weight、displacement等流程相同先标准化再 MLP再用混淆矩阵看哪两档最容易混第 09、13 篇。打印classification_report时重点看每一档的 precision / recall而不是只看总 accuracy。三档样本若几乎均衡准确率还算有参考价值若某一档极少总准确率容易虚高。7. 实现时几个容易混的点输出激活和隐藏激活不是一回事。隐藏层继续用 ReLU第 24、26 篇多分类输出才是 Softmax 或若干 Sigmoid。一对多的 Sigmoid 概率不要当成「已经归一化」。若产品文案写「三类概率加总 100%」就应上 Softmax或事后自己归一化并说明含义变了。类很多时。完整 Softmax 分母要对所有类求和。类数极大时候选采样等技巧会只对部分负类算分那是工程优化入门先把小K KK做对。评估。准确率在类别不平衡时仍可能骗人第 20 篇多分类更要看每类召回、宏平均 / 加权 F1以及K × K K\times KK×K混淆矩阵。和浅层网络实践怎么接。第 26 篇的圆环是二分类。改成三类点例如内、中、外三环后把MLPClassifier的标签换成 0/1/2输出自动变成三维 Softmax 概率调隐藏层宽度和学习率的方法不变。先保证二分类能分弯再加类数排查时更轻松。8. 适用边界与常见误区8.1 适用边界本篇接在神经网络输出层第 13 篇的 OvR / OvO 思想对树模型、SVM 同样适用。Softmax 管「选哪个类」不管特征脏不脏、有没有泄漏——第 1822 篇的检查仍然要做。回归预测 MPG 连续值不是 Softmax 的场景。8.2 常见误区误区更稳妥的理解多分类就是多标签单选 vs 多选输出头不同有K KK个 Sigmoid 输出概率必加总为 1一对多不保证Softmax 才保证隐藏层也要用 SoftmaxSoftmax 一般在输出层类一多就先上很深的网先确认标签是否互斥、数据是否够只报总准确率结合每类指标和混淆矩阵Softmax 概率能直接当校准很好的置信度未校准前别过度解读需要时再做概率校准9. 关键术语速查术语含义多分类每样本恰好一类K ≥ 3 K\ge 3K≥3一对多每类一个「是该类 / 不是」问题Softmax将K KK个分数变成和为 1 的概率logitSoftmax 之前的原始分数z j z_jzj交叉熵多分类常用损失对接 Softmax多标签每样本可同时有多个标签10. 延伸阅读资源适合看什么专栏第 13 篇OvR、OvO、多分类与多标签专栏第 24 篇Sigmoid 与输出激活sklearn LogisticRegressionmulti_classmultinomialsklearn MLPClassifier多类 MLPIris 数据集三类小样本练习11. 小结神经网络做多分类关键在输出层怎么接一对多用K KK个 Sigmoid各类概率可以独立、加总不必为 1标签互斥时用 Softmax让概率在K KK类里互相竞争且加总为 1。隐藏层仍用 ReLU 一类激活和输出头分开选。互斥单标签 → Softmax 交叉熵 可重叠多标签 → 每标签 Sigmoid 二分类 → 一个 Sigmoid 即可汽车从「是否高效」换成「轻 / 中 / 重」后只是K KK从 2 变成 3前面的划分、标准化和过拟合处理并不过时。接输出头之前先确认标签互不互斥互斥用 Softmax可重叠用多个 Sigmoid。头接错了后面网络再深优化的也是错问题。下一篇会对神经网络做一次总结然后过度到后面的 Embedding 等内容。系列导航上一篇【机器学习】26—— 浅层神经网络下一篇预告神经网络小结与embedding如果本篇对你有帮助欢迎点赞、收藏、关注博主机器学习专栏持续更新中下次更新不迷路。
【机器学习】(27)—— 神经网络多分类
神经网络多分类一对多和 Softmax文章目录神经网络多分类一对多和 Softmax1. 选项从两个变成多个2. 一对多每个类确认一次2.1 放到一张网络里3. Softmax在类与类之间分概率4. 汽车例子按重量分三档5. 和多标签区分6. 动手Iris 上对比逻辑回归与 MLP7. 实现时几个容易混的点8. 适用边界与常见误区8.1 适用边界8.2 常见误区9. 关键术语速查10. 延伸阅读11. 小结摘要专栏前半段的分类多是「高效 / 非高效」二选一。车型档位、故障类型、手写数字这类问题选项往往有三个以上而且每个样本只属于其中一类。第 13 篇从通用角度介绍过多分类本篇把它接到神经网络输出层上讲清一对多one-vs-all和Softmax差在哪里、概率要不要加起来等于 1以及什么时候不该用 Softmax。适合读完浅层网络实践的读者。1. 选项从两个变成多个二分类输出一个概率p pp再靠阈值切成 0/1。多分类时标签变成0 , 1 , … , K − 1 0,1,\ldots,K-10,1,…,K−1模型要给出K KK个分数或概率最后通常取最大的那一类。二分类多分类单标签例子是否高效轻 / 中 / 重 三档输出1 个概率K KK个值约束p ∈ ( 0 , 1 ) p\in(0,1)p∈(0,1)Softmax 下各类概率和为 1和第 13 篇一样先分清多分类单选题每辆车只能落在一档多标签多选题一张图可以同时有「猫」和「户外」本篇默认讲单选题。多标签一般是每个标签各接一个 Sigmoid不要用 Softmax 硬凑。第 812 篇的阈值、混淆矩阵、精确率 / 召回率在多分类里仍然用得上只是混淆矩阵从2 × 2 2\times 22×2变成K × K K\times KK×K。第 13 篇已从「不用神经网络」的角度讲过 OvR / Softmax本篇重点是这些头接在 MLP 最后一层时该怎么选。2. 一对多每个类确认一次一对多One-vs-All / One-vs-Rest有K KK个类就准备K KK个二分类问题。对「轻 / 中 / 重」三档是不是轻对比不是轻是不是中是不是重预测时看哪个分类器最「肯定」或比较各自的分数。类数不多时这个想法很直观类数上到成百上千就维护成本高、也慢。2.1 放到一张网络里不必真的训练K KK个完全独立的模型。可以共用前面的隐藏层输出层放K KK个节点每个节点各自接Sigmoid每个输出表示「是不是这一类」的概率彼此独立估计。因此三者加起来不一定等于 1——有可能都偏低或都偏高。水果图的例子里网络可能给出「梨 0.84、葡萄 0.07……」加总超过 1这在一对多设定里并不奇怪它在分别回答「是不是梨」「是不是葡萄」而不是在「四种水果里只能选一个」的约束下分配概率。预测时常见做法是看哪一路 Sigmoid 输出最大就把该类当作预测若业务允许「都不像」也可以要求最大概率超过某阈值否则判为未知。阈值仍建议在验证集上定和第 09 篇同一思路。3. Softmax在类与类之间分概率若业务要求「轻、中、重三者互斥必须落在一档」更常见的是Softmax也常叫一对一 / one-vs-one 语境下的相对概率和第 13 篇用语一致即可。先对每个类算一个未归一化分数z j z_jzjlogits再p j e z j ∑ k 1 K e z k p_j \frac{e^{z_j}}{\sum_{k1}^{K} e^{z_k}}pj∑k1Kezkezj于是p j 0 p_j0pj0且∑ j p j 1 \sum_j p_j 1∑jpj1。可以把它看成逻辑回归里 Sigmoid 往多类的推广Sigmoid 处理「是 / 否」Softmax 处理「在K KK个选项里挑一个」。手算一个小数设三档分数z ( 1.0 , 2.0 , 0.0 ) z(1.0,\ 2.0,\ 0.0)z(1.0,2.0,0.0)则e 1 ≈ 2.72 , e 2 ≈ 7.39 , e 0 1 e^{1}\approx 2.72,\quad e^{2}\approx 7.39,\quad e^{0}1e1≈2.72,e2≈7.39,e01分母≈ 11.11 \approx 11.11≈11.11于是p ≈ ( 0.24 , 0.67 , 0.09 ) p \approx (0.24,\ 0.67,\ 0.09)p≈(0.24,0.67,0.09)「中」档分数最高概率也被抬得最高提高某一档的z zz会挤占其他档的概率——这就是「互相竞争」。一对多 SigmoidSoftmax各类是否互斥建模不强求强求概率互相挤占概率和是否为 1不一定是典型用途类可近似独立判断单标签多分类默认选择类特别多例如上万类时完整 Softmax 算分母会贵工程上会用候选采样等近似入门阶段类数不大用完整 Softmax 即可。数值上算 Softmax 时常先减去max k z k \max_k z_kmaxkzk再取指数避免e z e^{z}ez溢出。手算小例子不必纠结自己用 NumPy 实现时记得这一步。框架里的 Softmax 一般已处理稳定计算。4. 汽车例子按重量分三档把专栏里的重量粗分成三档标签演示用阈值可改档位条件千磅标签轻 3.0 3.03.00中3.0 3.03.04.0 4.04.01重 4.0 4.04.02二分类问「高不高效」这里问「偏轻、适中还是偏重」。特征仍可用重量、排量等输出层改为 3 个节点。若用 Softmax三个概率和为 1取 argmax 得档位。若用三个 Sigmoid更像三个独立「是不是这一档」的问题对互斥档位一般不如 Softmax 合适。损失方面Softmax 多分类常用交叉熵多类版 Log Loss。训练仍是前向算p pp、算损失、反向更新第 25 篇只是输出维数从 1 变成K KK。若训练集里「重」车特别少Softmax 仍可能偷懒少报「重」——第 20 篇的类别不平衡问题在多分类里同样存在需要看每类召回必要时加类别权重或重采样。5. 和多标签区分场景该用什么每张图只有一种主果蔬Softmax 多分类一碗里同时有苹果和橙子多个 Sigmoid / 多个二分类不用Softmax邮件垃圾 / 正常二分类 Sigmoid 即可故障码互斥的 5 种故障SoftmaxSoftmax 的假设是每个样本恰好属于一类。不满足就换输出头别硬套。训练标签也要一致若标注规范里允许「既算中型又算偏重」那是多标签问题应拆成多个是/否而不是强行塞进三个互斥档。和业务对齐标签定义往往比纠结隐藏层宽度更重要。6. 动手Iris 上对比逻辑回归与 MLPfromsklearn.datasetsimportload_irisfromsklearn.model_selectionimporttrain_test_splitfromsklearn.preprocessingimportStandardScalerfromsklearn.pipelineimportPipelinefromsklearn.linear_modelimportLogisticRegressionfromsklearn.neural_networkimportMLPClassifierfromsklearn.metricsimportaccuracy_score,log_loss,classification_report X,yload_iris(return_X_yTrue)X_train,X_test,y_train,y_testtrain_test_split(X,y,test_size0.25,random_state0,stratifyy)defeval_model(name,clf):pipePipeline([(scaler,StandardScaler()),(clf,clf)])pipe.fit(X_train,y_train)probapipe.predict_proba(X_test)predpipe.predict(X_test)print(name,{acc:round(accuracy_score(y_test,pred),3),logloss:round(log_loss(y_test,proba),3),})# Softmax 概率应按行求和为 1print( prob row sums:,proba.sum(axis1).round(3)[:5],...)returnpipe# 逻辑回归多分类默认可用 Softmaxmultinomialeval_model(logreg,LogisticRegression(max_iter1000,multi_classmultinomial),)eval_model(mlp,MLPClassifier(hidden_layer_sizes(8,),activationrelu,learning_rate_init0.01,max_iter2000,random_state0,),)看两件事准确率 / log loss 是否合理proba每一行是否加起来接近 1Softmax 行为。MLPClassifier在多类问题上会走 Softmax 风格的输出若你自己用底层框架搭网络输出层要明确写成 Softmax 交叉熵别和隐藏层的 ReLU 搞混。汽车三档数据可以把y换成按重量分箱的标签特征用weight、displacement等流程相同先标准化再 MLP再用混淆矩阵看哪两档最容易混第 09、13 篇。打印classification_report时重点看每一档的 precision / recall而不是只看总 accuracy。三档样本若几乎均衡准确率还算有参考价值若某一档极少总准确率容易虚高。7. 实现时几个容易混的点输出激活和隐藏激活不是一回事。隐藏层继续用 ReLU第 24、26 篇多分类输出才是 Softmax 或若干 Sigmoid。一对多的 Sigmoid 概率不要当成「已经归一化」。若产品文案写「三类概率加总 100%」就应上 Softmax或事后自己归一化并说明含义变了。类很多时。完整 Softmax 分母要对所有类求和。类数极大时候选采样等技巧会只对部分负类算分那是工程优化入门先把小K KK做对。评估。准确率在类别不平衡时仍可能骗人第 20 篇多分类更要看每类召回、宏平均 / 加权 F1以及K × K K\times KK×K混淆矩阵。和浅层网络实践怎么接。第 26 篇的圆环是二分类。改成三类点例如内、中、外三环后把MLPClassifier的标签换成 0/1/2输出自动变成三维 Softmax 概率调隐藏层宽度和学习率的方法不变。先保证二分类能分弯再加类数排查时更轻松。8. 适用边界与常见误区8.1 适用边界本篇接在神经网络输出层第 13 篇的 OvR / OvO 思想对树模型、SVM 同样适用。Softmax 管「选哪个类」不管特征脏不脏、有没有泄漏——第 1822 篇的检查仍然要做。回归预测 MPG 连续值不是 Softmax 的场景。8.2 常见误区误区更稳妥的理解多分类就是多标签单选 vs 多选输出头不同有K KK个 Sigmoid 输出概率必加总为 1一对多不保证Softmax 才保证隐藏层也要用 SoftmaxSoftmax 一般在输出层类一多就先上很深的网先确认标签是否互斥、数据是否够只报总准确率结合每类指标和混淆矩阵Softmax 概率能直接当校准很好的置信度未校准前别过度解读需要时再做概率校准9. 关键术语速查术语含义多分类每样本恰好一类K ≥ 3 K\ge 3K≥3一对多每类一个「是该类 / 不是」问题Softmax将K KK个分数变成和为 1 的概率logitSoftmax 之前的原始分数z j z_jzj交叉熵多分类常用损失对接 Softmax多标签每样本可同时有多个标签10. 延伸阅读资源适合看什么专栏第 13 篇OvR、OvO、多分类与多标签专栏第 24 篇Sigmoid 与输出激活sklearn LogisticRegressionmulti_classmultinomialsklearn MLPClassifier多类 MLPIris 数据集三类小样本练习11. 小结神经网络做多分类关键在输出层怎么接一对多用K KK个 Sigmoid各类概率可以独立、加总不必为 1标签互斥时用 Softmax让概率在K KK类里互相竞争且加总为 1。隐藏层仍用 ReLU 一类激活和输出头分开选。互斥单标签 → Softmax 交叉熵 可重叠多标签 → 每标签 Sigmoid 二分类 → 一个 Sigmoid 即可汽车从「是否高效」换成「轻 / 中 / 重」后只是K KK从 2 变成 3前面的划分、标准化和过拟合处理并不过时。接输出头之前先确认标签互不互斥互斥用 Softmax可重叠用多个 Sigmoid。头接错了后面网络再深优化的也是错问题。下一篇会对神经网络做一次总结然后过度到后面的 Embedding 等内容。系列导航上一篇【机器学习】26—— 浅层神经网络下一篇预告神经网络小结与embedding如果本篇对你有帮助欢迎点赞、收藏、关注博主机器学习专栏持续更新中下次更新不迷路。