机器学习中的混淆矩阵、ACC、F1等概念

机器学习中的混淆矩阵、ACC、F1等概念 一、混淆矩阵1.这张图怎么看/记忆从“预测”的值出发看“实际”值是什么即——二、准确率1.准确率ACC理解所有样本当中预测其属性正确上图当中的“真的”的比例——准确预测其属性的叫“准确”率三、精确率1.精确率Precision理解在预测为阳性当中确实是阳性的比例。也就是只有下方右侧这幅图所展示的那样2.为什么要搞准确率和精确率两种指标呢这两种看起来不是一个东西吗都是评价机器学习打标签的准确与否吗答如果只是要看这个模型的准不准即能不能把阳性判定为阳性、阴性判定为阴性那可以用准确率 ——从整体的视角但是如果是要看模型评价某一个指标评价的准不准即预测阳性之中实际的阳性有多少那就是要用精确率了——从局部/某个指标如Positve的视角四、召回率敏感度1.召回率Recall理解准确率是把下图右侧图片的红框数过来框住Predicted-Positive而召回率是下图右侧图片的红框是实际为Positive中模型抓出了预测到了Positive的比例。2.召回率和精确率的区别召回率关注“查全”精确率关注“查准”。因此可以根据使用场景也就是你到底要查准还是查全来选择Precision还是Recall。如果是要检查患病的阴性阳性那就是要用召回率了因为要“查全”而不是“查准”——把阴性判定为了阳性FP是可以复查的也就是说就算精确率小了也没有关系因为现在关注的是有没有查全。五、F1分数1.F1分数理解F1分数是精确率和召回率的调和平均数。设置F1的原因是对于查准和查全一般是相互排斥的也就是说精确率上去了大概率是通过减少预测为Positive的数量实现的小心谨慎了但是降低了预测为Positive的数量就会导致很多实际是Positive的样本没有被检测到即没做到“查全”召回率降低了。为了综合评价查准和查全将这两个指标进行调和平均数的计算得到F1分数。六、多分类问题当中的混淆矩阵拓展到多个维度之后同样可以计算这些指标七、自用LLM项目中的混淆矩阵及其指标1.LLM项目中的混淆矩阵及其指标的计算介绍生成式任务信息提取类——对于信息提取类来说混淆矩阵当中的各个维度是提取出来的所有可能情况比如说天气所有样本提取出来只有“晴、雨、阴”三种那么接下来就是将所有预测即“事故信息提取的结果”和所有真实数据。进行比对然后填入这个3x3的混淆矩阵当中。然后按照不同的average形式得到结果此外还有这些多标签、二分类的情况仅作科普用分类任务事故定责——和生成式是一个道理。先按照事故类型形成混淆矩阵的框框然后统计样本...2.为什么选择“averagemicro, zero_division0”...我还没有想清楚想清楚了后续会补充的