数据科学中的R和Python: 标签传播算法

星期四, 六月 09, 2016

标签传播算法

因为标注成本比较高，当你的训练数据集只有一部分数据是有标注的情况下，使用监督学习你只能扔掉那些没有标注的X。而实际上，有标注的样本和无标注的样本之间是有关系的，这种关系信息也可以用来帮助学习。这就是半监督学习标签传播（Label Propagation）算法的思路。

它的基本逻辑是借助于近朱者赤的思路，也就是KNN的思路，如果A和B在X空间上很接近，那么A的Y标签就可以传给B。进一步迭代下去，如果C和B也很接近，C的标签也应该和B一样。所以基本计算逻辑就是两步，第一步是计算样本间的距离，构建转移矩阵，第二步是将转移矩阵和Y矩阵相乘，Y里面包括了已标注和未标注的两部分，通过相乘可以将已标注的Y转播给未标注的Y。具体论文可以看这里。在sklearn模块中已经内置了这种算法，文档示例可以看这里。下面是用python的numpy模块实现的一个toy demo。

2 条评论:

Robert McCain2/09/2021 8:11 下午
如果您认为您的配偶在作弊，并且您需要聘请真正的黑客来远程监控/黑客他们的电话，恢复被盗的比特币/任何其他加密货币或在保证隐私的情况下入侵数据库，请联系easybinarysolutions@gmail.com或whatsapp： +1 3478577580，他们高效而机密。
回复删除
回复
selim5/31/2023 9:16 上午
steroid satın al
heets
416LL
回复删除
回复

添加评论

页面

星期四, 六月 09, 2016

标签传播算法

2 条评论: