Java自学者论坛

 找回密码
 立即注册

手机号码,快捷登录

恭喜Java自学者论坛(https://www.javazxz.com)已经为数万Java学习者服务超过8年了!积累会员资料超过10000G+
成为本站VIP会员,下载本站10000G+会员资源,会员资料板块,购买链接:点击进入购买VIP会员

JAVA高级面试进阶训练营视频教程

Java架构师系统进阶VIP课程

分布式高可用全栈开发微服务教程Go语言视频零基础入门到精通Java架构师3期(课件+源码)
Java开发全终端实战租房项目视频教程SpringBoot2.X入门到高级使用教程大数据培训第六期全套视频教程深度学习(CNN RNN GAN)算法原理Java亿级流量电商系统视频教程
互联网架构师视频教程年薪50万Spark2.0从入门到精通年薪50万!人工智能学习路线教程年薪50万大数据入门到精通学习路线年薪50万机器学习入门到精通教程
仿小米商城类app和小程序视频教程深度学习数据分析基础到实战最新黑马javaEE2.1就业课程从 0到JVM实战高手教程MySQL入门到精通教程
查看: 920|回复: 0

深度学习中数据集分布不平衡问题的解决方法

[复制链接]
  • TA的每日心情
    奋斗
    2024-4-6 11:05
  • 签到天数: 748 天

    [LV.9]以坛为家II

    2034

    主题

    2092

    帖子

    70万

    积分

    管理员

    Rank: 9Rank: 9Rank: 9

    积分
    705612
    发表于 2021-6-2 11:52:47 | 显示全部楼层 |阅读模式

    【Deep Learning】深度学习中数据集分布不平衡问题的解决方法

     

    一、标签分类不平衡

    在学术中,使用的大部分数据集都是平衡的。也就是在supervised learning中,每一类别通常有数目相同的样本。而在我们采集自己的数据集训练时,获得的样本数量是不平衡的,某一类样本多,另一些样本少,甚至没有。比如某一疾病的医学影像,大部分都是健康的,只有小部分患病。

    二、错分成本不平衡

    同样,在学术中,数据集中每一类别的分类错误的成本通常是一样的。但实际中完全不是这样。还是以医学为例,将一个健康的人误诊为患病带来的伤害相对的有限的,但是将一个患病的人误诊为健康将使病人得不到治疗而延误病情,可能为此付出生命的代价。

    不平衡的数据集也会导致错分成本的上升。

    那么怎么解决数据集分布不平衡的问题呢?

    1. 最直观的方法就是搜集更多稀缺类别的数据,使得数据分布趋于平衡。

    2. 如果某几类稀缺的样本不需要区分的太细,可以考虑将这几类样本合并,更改它们的标签为同一类。

    3. 在原始数据集上做文章。

    a. 对样本多的类别进行欠采样,缩减这类样本的数量;

    b. 对样本少的类别进行过采样,增大这类样本的数量;

    c. 先进行训练,找出出样本很容易被误分类的部分。对这部分样本进行有目的的采样,而不是a中的随机采样。

    4. 最后就是在算法本身上进行改进了。让算法更关注稀缺样本的类别,增加稀缺类别样本的损失权重。

    哎...今天够累的,签到来了1...
    回复

    使用道具 举报

    您需要登录后才可以回帖 登录 | 立即注册

    本版积分规则

    QQ|手机版|小黑屋|Java自学者论坛 ( 声明:本站文章及资料整理自互联网,用于Java自学者交流学习使用,对资料版权不负任何法律责任,若有侵权请及时联系客服屏蔽删除 )

    GMT+8, 2024-4-27 08:42 , Processed in 0.062349 second(s), 29 queries .

    Powered by Discuz! X3.4

    Copyright © 2001-2021, Tencent Cloud.

    快速回复 返回顶部 返回列表