栏目分类
你的位置:kai云体育app官网版下载官网 > 新闻中心 > 新闻中心
开云kaiyun每一层王人会将前一层的信号放大-kai云体育app官网版下载官网
发布日期:2026-09-05 06:35 点击次数:158

这项由伊利诺伊大学香槟分校的何壮壮、新加坡南洋理工大学的周凯宇、亚利桑那州立大学的白浩月,以及新加坡国立大学的朱丰斌、杨永辉等商讨者组成的海外团队完成的商讨,发表于2025年9月的arXiv预印本平台(论文编号:arXiv:2509.15709v1),为咱们揭开了推选系统中一个持久困扰学界的谜题。
当咱们在网上购物时,系统会凭证咱们的浏览历史推选商品,这背后即是协同过滤期间在阐扬作用。就像一位训戒丰富的伴计,通过不雅察主顾的购买风俗来辩论他们可能心爱的商品。然则,这位"数字伴计"的职责旨趣一直存在一个令东谈主蒙眬的征象:当咱们试图让它变得更"智谋"时,它的进展存时反而会变差。
商讨团队通过对10个不同规模和特征的数据集进行大规模实验,使用了BPR、NeuMF、LightGCN和SGL这四种代表性的协同过滤模子,发现了两种前所未见的征象。第一种被称为"双峰征象",就像爬山一样,系统性能先飞腾,然后下跌,接着又神奇地再次飞腾,终末才最终下跌。第二种被称为"对数征象",性能会捏续空闲地擢升,就像登道路一样,固然每一步的擢升幅度在递减,但弥远在进取。
张开剩余89%这个发现颠覆了学界持久以来的融会。曩昔东谈主们盛大以为,推广镶嵌维度(不错知道为加多系统记念容量)只会带来先升后降的"单峰"成果,就像给一个东谈主塞太多信息反而会让他困惑一样。但这项商讨讲授,执行远比设想复杂得多。
更令东谈主诧异的是,商讨团队发现团结个模子在不同数据集上会进展出不同的征象,而团结个数据集在不同模子上也会产生不同的扫尾。这就像同沿路菜谱,在不同厨师手中会有十足不同的成果,而团结位厨师靠近不同食材时也会有天壤悬隔的进展。
通过深入分析,商讨团队发现这些征象的根柢原因在于数据中的"噪声交互"。就像在嘈杂的餐厅里试图听清一又友的话一样,当推选系统试图从包含大王人无关或造作信息的数据中学习时,就会出现这种复杂的性能变化样式。
一、数据噪声:推选系统的隐形杀手
在日常生计中,咱们频繁会遭遇这么的情况:明明点击了某个商品,但其实并不是确凿感兴味,可能仅仅手滑或者意思。这些"误操作"对东谈主来说微不及谈,但对推选系统而言却是严重的侵犯信号。
商讨团队将这些侵犯信堪称为"噪声交互",它们就像灌音中的噪音一样,会影响系统对用户着实偏好的判断。当系统的"记念容量"(镶嵌维度)较小时,它只可记着最伏击的信息,噪声的影响相对有限。但跟着容量加多,系统运行有足够的空间来"记着"这些噪声,这时问题就出现了。
这个流程不错分为四个阶段来知道。在第一个阶段,系统就像一个吃力的学生,专注于学习最伏击的常识点,性能稳步擢升。插足第二阶段后,系统运行有满盈的"脑容量"来记着一些不伏击以致造作的信息,这时性能运行下跌。到了第三阶段,系统学会了如安在噪声环境中职责,找到了应答计谋,性能又运行回升。终末在第四阶段,过度的记念容量导致系统过分拟合矜重数据,在靠近新情况时进展欠安。
为了考证这个表面,商讨团队斥地了一种肤浅而灵验的"样本筛选计谋"。就像真挚在删改功课时会要点温顺那些彰着全心完成的功课一样,这种计谋让系统在矜重时优先温顺那些"亏本较小"的样本,因为这些样本更可能代表用户的着实偏好。
实验扫尾令东谈主致力。在使用了这种筛选计谋后,正本进展出双峰征象的BPR模子芜俚将镶嵌维度推广到32,768维而不出现性能崩溃,这在之前是不成设想的。这就像给一个容易分神的学生配了一位优秀的导师,匡助他专注于信得过伏击的内容。
二、不同模子的抗噪才能大揭秘
商讨团队深入分析了四种不同推选模子的本性,发现它们在靠近噪声时的进展天壤悬隔,这背后有着深层的数学旨趣。
BPR模子就像一个相当明锐的东谈主,对周围环境的任何变化王人会产生激烈反应。从期间角度来说,BPR使用肤浅的内积计较来瞻望用户偏好,这种线性关系使得模子参数的梯度(不错知道为学习的地点和强度)会跟着镶嵌维度的加多而经常止地增长。当遭遇噪声数据时,这种本性会被放大,导致模子学习地点出现大幅偏差。
商讨团队通过数学分析讲授,BPR模子的暗示质地退化进程与噪声比例的平方成正比,同期与梯度明锐性线性相干。这意味着即使是很小的噪声,在高维空间中也会被显赫放大,导致模子性能急剧下跌。这就解释了为什么BPR频繁进展出双峰征象,相当是在镶嵌维度较大的情况下。
NeuMF模子的情况愈加复杂。固然它通过引入非线性神经集中层来捕捉更复杂的用户-物品交互样式,但这种复杂性也带来了新的问题。商讨团队发现,NeuMF的梯度明锐性会跟着集中深度呈指数级增长。这就像一个放大器链,每一层王人会将前一层的信号放大,包括有用的信号和噪声。当集中较深或正则化不那时,NeuMF以致可能比BPR更容易受到噪声影响。
LightGCN模子展现出了更好的抗噪才能,这要归功于其私有的图卷积结构。在推选系统中,用户和物品之间的交互不错组成一个复杂的集中图,LightGCN通过在这个图上进行信息传播来学惯用户和物品的暗示。
这个流程相当访佛于执行生计中的"世东谈主拾柴火焰高"征象。当系统要为某个用户生成推选时,它不仅接头该用户的平直活动,还会参考与该用户有相似偏好的其他用户的活动。这种信息团员流程自然具有降噪成果,就像多个东谈主的看法平均后往往比单个东谈主的看法更可靠一样。
从数学角度来看,LightGCN的这种团员流程等价于对用户和物品镶嵌进行低通滤波,保留伏击的低频信号(代表主要的用户偏好样式),同期阻难高频噪声。商讨团队通过谱分析讲授,经过多层图卷积后,最终的镶嵌矩阵会当然地呈现低秩本性,这有助于提高模子的泛化才能和抗噪性能。
三、SGL:推选系统中的"抗噪冠军"
在所有测试的模子中,SGL(Self-supervised Graph Learning)进展最为出色,简直在所罕有据集上王人展现出瞎想的对数增长样式。这种优异进展源于其私有的自监督对比学习机制。
SGL的职责旨趣不错用"照镜子"来譬如。系统会为每个用户和物品创建多个"镜像"版块,这些镜像通过当场删除一些连气儿或避讳一些特征来生成。然后,系统条件团结个用户或物品的不同镜像应该尽可能相似,而不同用户或物品的镜像应该尽可能不同。
这种矜重神志的机密之处在于,它迫使模子学习那些在多样侵犯下王人保捏空闲的特征。就像一个东谈主的中枢地格特征会在不同环境下保捏一致一样,用户的着实偏好也应该在多样数据变化下保捏相对空闲。而那些容易变化的特征,往往即是噪声。
商讨团队从信息论的角度分析了这一机制。SGL通过最大化不同视图之间的互信息,骨子上是在寻找那些包含最多有用信息、最少噪声的特征暗示。这个流程不错看作是一种隐式的特征接收,自动过滤掉那些不服定、不成靠的信息。
更进一步,商讨团队讲授了SGL的对比学习方针会隐式地将学习到的镶嵌料理在一个"干净信号子空间"内。这意味着即使矜重数据中存在噪声,最终学到的用户和物品暗示也主要反应着实的偏好样式,噪声身分被大大阻难。
这种双重保护机制——图卷积的低通滤波效应加上对比学习的子空间料理——使得SGL在靠近高维镶嵌时仍能保捏空闲的性能擢升。实验扫尾闪现,即使将镶嵌维度推广到相当高的水平,SGL的性能仍能捏续改善或至少保捏空闲,这在其他模子中是很难完了的。
四、实验考证:表面与实践的完整联接
为了全面考证他们的表面分析,商讨团队策画了一系列尽心策画的实验。他们接收了10个具有不同特征的数据集,涵盖了从小规模的MovieLens-100K到超大规模的AmazonBooks等多样场景。这些数据集在用户数目、物品数目、交互密度等方面王人有显赫各别,为商讨提供了丰富的测试环境。
在实验竖立上,商讨团队将镶嵌维度从最小的4维一直推广到65,536维,卓越了16个数目级。这种大跨度的测试确保了不雅察到的征象不是有时的统计波动,而是具有盛大性的章程。
实验扫尾令东谈主印象深刻。在ML-100K数据集上,BPR模子赫然地展现出双峰样式:性能在512维时达到第一个峰值,然后下跌,在8192维时出现第二个峰值,终末再次下跌。而在Modcloth数据集上,通常的BPR模子却进展出对数增长样式,即使在最高的测试维度下性能仍在擢升。
更风趣的是,商讨团队发目下某些数据集上,肤浅地将镶嵌维度从传统的128维推广到更高维度,就能取得卓越25%的性能擢升。这个发现具有伏击的实践真谛,因为在推选系统畛域,经常以为5-10%的性能擢升就还是相当显赫了。
为了考证噪声假定,商讨团队推论了他们建议的样本筛选计谋。扫尾闪现,在使用了这种计谋后,正本进展出双峰征象的模子变得愈加空闲,芜俚在更高的维度下保捏邃密性能。这为他们的表面分析提供了强有劲的实证赈济。
商讨团队还发现了一个风趣的征象:最好性能往往出目下维度为2的幂次的位置,比如512、1024、2048等。这可能与计较机硬件的本性以及优化算法的料理本性相干,为实践中的超参数接收提供了有价值的指令。
五、对推选系统未来的深刻影响
这项商讨的真谛远远超出了学术畛域,它为通盘推选系统行业指明了新的发展地点。传统上,商讨者们在追求更好的推选成果时,往往专注于策画更复杂的模子架构或更小巧的特征工程,而冷落了数据质地这个基础问题。
商讨扫尾标明,数据质地对推选系统的可推广性具有决定性影响。当数据相对干净时,即使是肤浅的模子也能通过加多镶嵌维度取得显赫的性能擢升。相背,当数据包含大王人噪声时,再复杂的模子也难以灵验推广。这教导咱们,在追求模子复杂性的同期,不应冷落数据预处治和清洗的伏击性。
从模子策画的角度来看,这项商讨揭示了具有内在抗噪才能的模子架构的伏击性。SGL之是以进展出色,不仅因为它选用了图神经集中,更伏击的是它通过自监督学习机制内置了噪声过滤才能。这为未来的模子策画提供了伏击启示:与其在过后处治噪声,不如在模子策画阶段就接头抗噪才能。
商讨团队相当指出,他们的发现为推选系统畛域寻找"Transformer期间"提供了新的想路。在当然讲话处治畛域,Transformer架构的到手很猛进程上归功于其优秀的可推广性。而在推选系统畛域,SGL展现出的优秀推广才能使其有望成为这个畛域的"Transformer"。
这项商讨还对工业界的推选系统部署具有平直的指令真谛。好多公司在部署推选系统时,由于计较资源的为止,往往接收相对较小的镶嵌维度。但这项商讨标明,要是数据质地较高或者选用了合适的抗噪计谋,合适加多镶嵌维度可能带来显赫的性能擢升,而这种擢升的资本效益比可能远高于其他优化表率。
商讨团队坦承,由于计较资源的为止,他们的实验主要辩论在NDCG@20这一评估方针上,未来的商讨不错推广到更多的评估方针和更泛泛的模子架构。此外,他们的表面分析主要针对协同过滤模子,关于包含丰富内容特征的深度推选模子,相干表面还需要进一步发展。
说到底,这项商讨最伏击的孝敬在于篡改了咱们对推选系统可推广性的融会。它告诉咱们,推广镶嵌维度并不老是无效的,要津在于知道和处治数据中的噪声。当咱们芜俚灵验地识别和过滤噪声时,推选系统就能像大讲话模子一样,通过加多参数规模来取得更好的性能。这为推选系统的未来发张开辟了新的可能性,也为从业者提供了实用的优化计谋。关于那些但愿深入了解这一发现的读者,不错通过论文编号arXiv:2509.15709v1查询完整的商讨汇报,其中包含了详备的数学推导和实验细节。
Q&A
Q1:什么是推选系统中的"双峰征象"和"对数征象"?
A:双峰征象是指当加多推选系统的镶嵌维度时,性能进展出先升后降、再升再降的两个峰值样式。对数征象则是性能捏续空闲擢升,固然擢升幅度冉冉递减但弥远进取。这两种征象颠覆了学界以往以为的"单峰"章程,为推选系统优化提供了新的知道角度。
Q2:为什么SGL模子在推广维度时进展最好?
A:SGL模子进展出色主要因为它具有双重抗噪机制:一是图卷积结构的低通滤波效应,芜俚团员多个用户的信息来裁汰噪声影响;二是自监督对比学习机制,通过条件团结用户的不同"镜像"版块保捏相似,迫使模子学习空闲可靠的特征,自动过滤掉不服定的噪声信息。
Q3:这项商讨对骨子的推选系统旁边有什么指令真谛?
A:商讨标明数据质地比模子复杂度更伏击开云kaiyun,企业应该喜爱数据清洗和噪声过滤。在数据相对干净的情况下,合适加多镶嵌维度可能带来卓越25%的性能擢升,资本效益比很高。同期,接收具有内在抗噪才能的模子架构(如SGL)比单纯加多模子复杂度更灵验。
发布于:北京市