知识卡片
支持向量机与硬余量、软余量
内容
把数据分成两组时,能把当前数据分对的分界线有无数条,但对没见过的新数据来说,哪条分界线更靠谱?支持向量机的答案是:选择那条离两侧最近数据点距离都尽量远的分界线(这个思路叫余量最大化)——留出的缓冲区越大,新数据落在分界线附近产生误判的风险就越小;这条分界线在二维是直线、三维是平面,更高维度统称超平面。但现实数据往往带噪声,无法被完美分开,这时需要在”分得干净”和”能不能分”之间妥协:硬余量要求所有数据都被严格正确分类,一旦数据不可分或含噪声就容易导致过拟合;软余量则允许一部分数据被错误分类以换取一个更简单、泛化能力更好的分界线,本质上是接受”局部小错”来换取”整体稳健”,与[[正则化拉索回归与岭回归|正则化]]防止过拟合的思路是同一种权衡的不同实现方式。
参考来源
《图解数据科学》第5章《需要了解的有关人工智能的知识》