English
学术报道
【学术报道】如何利用随机矩阵理论区分高维数据中‘大特征根’的真实来源
供稿: 数科院

6月18日晚20点,新加坡南洋理工大学潘光明教授受邀作线上专题报告,会议通过腾讯会议举行。潘光明教授博士毕业于中国科学技术大学,现为南洋理工大学教授、国际统计学会会员,主要研究领域为高维统计推断与随机矩阵理论,已在统计学与概率论顶级期刊发表多篇论文。

报告围绕“如何利用随机矩阵理论区分高维数据中‘大特征根’的真实来源”这一核心问题展开。在主成分分析(PCA)中,数据协方差矩阵的大特征根常被简单解释为共同因子驱动(如疾病致病机理),但潘教授指出,这种“spike”现象也可能源于样本的混合结构(如患者亚群差异)。若误将混合模型当作单一因子模型处理,将导致错误的降维与临床推断。

针对这一痛点,潘光明教授团队提出了一种基于特征向量的假设检验方法。区别于传统仅关注特征值的做法,该方法创新性地利用右特征向量的分位数“框带差”构造统计量,通过计算观测数据的分布形态与标准正态分布的差异,精准区分“因子模型”与“混合模型”。模拟实验验证,该统计量在不同信号强度下均具备良好的检测功效与控制误差能力。

在乳腺癌数据的实证分析中,该方法展现了极高的实用价值。分析显示,重症与中症组的大特征根符合因子模型假设,支持其由共同病理机制驱动,可安全进行降维分析;而轻症组则被检测出显著的混合结构(P值=0.011),提示现有分类粒度不足,需进一步细分亚型。此外,未分组数据中观测到的4个大特征根与临床预设的3类存在出入,为优化临床分类标准提供了量化依据。

报告最后,潘教授客观分析了当前方法在非独立观测场景下的理论局限,并展望了未来的拓展方向。

报告结束后,与会师生就样本量对检验结果的影响及统计量的构建逻辑进行了深入交流。整场报告逻辑严密,将高维统计理论与实际应用紧密结合,极大拓展了大家的学术视野。


日期: 2026-07-01