知识卡片
保留top-k奇异值实现降噪与降维
内容
对[[SVD是特征分解在非方阵上的推广]]得到的奇异值从大到小排序后,只保留前k个奇异值及对应的奇异向量重构原矩阵,就能在维持整体结构(矩阵仍是m×n维)的同时把有效信息压缩到k维,天然剔除了排在后面、代表噪声的部分。k的取值常用启发式策略——比如让保留的奇异值平方和占全部奇异值平方和的90%——在压缩率和信息保真度之间做取舍。
参考来源
- 位置:《数据科学工程实践》第5章《行为规律的发现与挖掘》"5.1.2 SVD原理及推导"一节(源文件:_epub-src/OEBPS/Text/part0027.xhtml)
- 结论依据:原文明确"在利用SVD做数据信息提取或压缩时,对奇异值从大到小排序,只提取前k个特征向量保留的信息。k值的确定通常依据一些启发式策略,如设定保留信息量的百分比,一般设定为90%",且"分解后矩阵的乘积仍是m×n维,然而用来重构的信息的维数却降低了"。
- 原始内容:前面说到奇异值的大小表示伸缩的比例,也表示了保留信息量,在利用SVD做数据信息提取或压缩时,对奇异值从大到小排序,只提取前k个特征向量保留的信息。k值的确定通常依据一些启发式策略,如设定保留信息量的百分比,一般设定为90%……分解后矩阵的乘积仍是m×n维,然而用来重构的信息的维数却降低了……重构之后矩阵的秩从n降到了k……噪声数据被剔除了,只保留了关键信息。