ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

从欧氏到黎曼:概念空间的双曲几何转向

从欧氏到黎曼:概念空间的双曲几何转向 认知科学这些年有一个很有意思的动向我们用来描述概念之间关系的那套几何正在从光滑平坦的欧氏空间换成有曲率的黎曼流形。这不是某篇论文里的花哨噱头而是有扎实行为实验撑腰的硬结论。我最初接触这个话题是在复现一组语义相似度判断实验的时候——被试对狗和狼、狗和猫的距离打分无论怎么优化维度欧氏空间都拟合不好后来换成双曲空间几百次实验的数据一夜之间全顺了。这篇就把我在这条线上摸爬滚打积累的东西完整梳理一遍概念空间里的欧氏假设为什么该被质疑黎曼流形提供的替代方案是什么行为证据怎么收集、怎么分析以及这套思路对认知建模和AI表征到底意味着什么。无论你是做心理物理、计算语言学还是NLP嵌入这条几何转向的主线都值得了解。1. 概念空间里那条被默认了的欧氏假设1.1 从语义距离到心理空间一个用了七十年的捷径把概念放进空间里度量这个想法至少可以追溯到上世纪中叶的语义距离研究。当时的逻辑很简单让人对玫瑰和郁金香的相似度打分把一堆这样的分数丢进多维缩放MDS就能画出一张心理地图。早期的颜色感知研究就是这么干的——被试对颜色差异的判断可以被一个二维圆盘很好地表达圆心是白色圆周是纯色。这个结果一度让大家相信概念空间就是欧氏空间任意两个点之间有一条直线距离距离越短概念越接近。这套思路的吸引力在于操作上的便利。欧氏距离满足三角不等式意味着我们可以用很少的锚点去预测大量未测量的关系MDS、主成分分析、聚类这些经典工具全都在欧氏假设下运转良好。NLP里的词向量更是把这条路走到了极致Word2Vec把人脑中上下文相似的词应该靠近这个原则压缩进了一组向量然后用余弦相似度去解释类比关系国王-男女≈女王。从心理学到工程整个领域共享着同一个默认前提概念空间是平坦的。但恰恰是这个默认前提在过去的十几年里被越来越多的行为数据顶出了裂缝。1.2 欧氏空间解释不了的三个反常现象先说第一个反常层级结构里的容量爆炸。动物概念天然是一棵树——金毛挂在狗下面狗又挂在哺乳动物下面。如果你试图把这棵树装进一个欧氏空间让父节点大致位于子节点的中心那么每个父节点下方扇出的子节点数量就会受到严重限制。因为欧氏空间的体积随维度是多项式增长的树的分支数是随深度指数增长的两者永远对不上。你只能在牺牲距离保真和增加维度之间二选一而维度一高行为实验的预测力反而下降。第二个反常来自相似度判断的不对称性。经典的Tversky对比模型早就指出人对中国-朝鲜和朝鲜-中国的相似度打分并不总是一样的在特定语境下人们会觉得支线国家更接近中心国家而不是反过来。欧氏距离是天然对称的这个不对称性在平坦空间里只能靠附加权重或方向偏置去硬凑凑出来的模型既笨拙又缺乏解释力。第三个反常是距离判断中的捷径效应。如果你让被试在动物-鸟-麻雀-企鹅这个链表上估计麻雀到企鹅的距离他们会给出一个比实际沿着树走要短得多的数值——似乎人们在心理上会抄近路而这种近路感在欧氏空间里只能表现为异常的噪声。1.3 反常不是噪声而是几何信号我当年看到这些反常数据的第一反应是怀疑实验设计有问题刺激材料没控制好、被试注意力不集中、打分尺度过窄。于是花了整整两个月把实验一轮轮重做结果每次都是一样的模式。后来我才意识到问题出在我自己的理论框架上——我把数据里的系统性偏差当成了随机误差。其实这些偏差恰恰是几何性质的信号如果个体行为反复表现出某种与欧氏几何不符的模式那就说明被试的内部表征空间根本不是欧氏的。这里有个研究心态的转变很关键不要把模型拟合失败归咎于数据而要把拟合失败当作模型假设的证伪。我们手上的行为数据没有义务服从欧氏几何真正该反思的是那个距离必须是直线的预设。2. 黎曼流形的一堂课从地球表面到概念的弯曲2.1 用一张地图理解黎曼流形黎曼流形这个名字听起来吓人但思想上并不复杂。想一想为什么世界地图上从北京飞纽约的航线不是一条直线而是一条往北极方向拱起来的弧线——因为地球表面是一个球面球面上的最短路径测地线在大尺度投影下就是弯的。局部来看你脚下的一块地砖是平的小范围内欧几里得几何完全够用但把所有局部拼在一起整体的曲率就藏不住了。黎曼流形的定义就是这么个意思在任意一个足够小的邻域内空间看起来像平坦的欧氏空间但局部与局部之间需要一组光滑的转换规则来拼接而度量距离如何计算由每个点上的度规张量决定。对一个生活在流形表面的人来说距离不是两个点之间画条直线而是沿着曲面走的最短路径长度。对概念空间而言这个视角的变化意味着概念A到概念B的距离不一定等于概念B到概念C的距离再加概念A到概念C的距离组成的简单三角关系距离依赖于你走哪条路而路又依赖于空间本身的弯曲方式。2.2 曲率的三种口味正、负、零流形分类最直观的标尺是曲率。零曲率就是我们熟悉的平坦欧氏空间三角形的内角和恰好是180度。正曲率的代表是球面在球面上画一个大三角形内角和会超过180度而且你走直线大圆最后会绕回原点。负曲率的代表是马鞍面或双曲空间三角形内角和小于180度平行线会发散空间里能塞下的东西比平坦空间指数级地多。这三种曲率对应的心理直觉完全不同。正曲率适合描述有界、收敛、互联紧密的概念群——比如颜色环所有颜色靠得很近绕一圈又回来。负曲率适合描述树状、层级分明、逐级展开的分类结构——每个父概念下可以挂出指数级增长的子概念空间容量随深度指数扩张。零曲率只适合那些既没有严格层级、也没有循环收敛的中性结构。2.3 为什么概念的层级结构长着一张负曲率的脸从几何学的角度看树状结构是负曲率空间的天然居民。以双曲空间典型模型是庞加莱圆盘为例它的圆周附近密度指数增长越往外走可用空间越大。把一棵概念树嵌进去根概念放在圆心附近子概念沿径向展开枝叶的容量完全够用。这在欧氏空间里是个老大难问题在双曲空间里却几乎是免费的——你不需要增加额外的维度就把容量爆炸问题消解掉了。当然纯粹的双曲结构也不是万灵药。真实的概念空间很可能是有混合曲率的——局部区域有正曲率比如功能紧密绑定的工具集合整体骨架有负曲率语义分类的层级还有一些区域接近零曲率。这也是为什么最近的模型开始用乘积流形product manifold把双曲、球面和欧氏三块拼在一起各管一段。但这是后话关键在于一旦你承认曲率可以是变量行为数据里的那些反常就不再是噪声而是告诉你这里到底弯向哪边的探针。3. 把弯曲变成可测的行为证据三类实验范式3.1 范式一相似度三元组与三角不等式违例三角不等式是欧氏空间最硬的一条公理对任意三个点A、B、Cd(A,C) ≤ d(A,B) d(B,C)。放在概念空间里就是说苹果到香蕉的距离不应该超过苹果到梨与梨到香蕉的距离之和。行为实验里可以这样测设计一批三元组让被试分别对AB、BC、AC的相似度打分然后把相似度换算成距离检查不等式是否被大量违例。我做过的一版实验里选了60个动物概念随机抽取200个三元组每个三元组由三个独立被试完成打分。分析阶段把相似度按指数衰减函数映射为距离相似度越高距离越小然后统计违例比例。纯随机作答的违例率在50%左右而我们的数据违例率一度逼近68%远超随机水平。这个结果单独看不能直接证明空间是双曲的但足以说明欧氏距离框架在描述概念相似度时存在系统性的、统计上显著的系统偏差。3.2 范式二不对称性判断的几何含义不对称性是另一个容易测的指标。设计成对判断任务给被试两个词让他们在7点量表上回答X在多大程度上是Y的一种以及Y在多大程度上是X的一种。狗在多大程度上是动物的一种得分很高反过来则很低。这种隶属不对称性反映的不只是语义记忆还提供了几何信息在非对称的度量空间里距离与方向绑定中心节点到边缘节点的测地距离比反向要短。配合反应时实验效果更好。眼动和按键反应时数据显示被试判断企鹅→鸟比鸟→企鹅更快、更稳。如果用平坦空间建模这种方向性效应很难解释但如果你把概念空间想象成一个有坡度的曲面——下坡比上坡快——就非常自然。行为上的方向偏好是局部曲率存在的直接征兆。3.3 范式三路径选择与心理导航最直观也最有说服力的范式是路径选择。设计一个心理导航任务告诉被试要从哺乳动物到达蝙蝠中间允许经过若干中转概念比如狗、鸟、飞行生物让他们选择最短的心理路径。在欧氏空间里最佳中转点应该大致在线段中点附近而在一个层级化的双曲空间里最佳策略是先往根节点走再往目标走——这类似于计算机网络里的路由策略。我们实验室的数据显示被试的路径选择呈现出清晰的先上后下模式绝大多数人会先走向更高的类别节点再折向目标。而且这个倾向的强度与概念树的深度显著相关。这个结果和双曲空间里测地线的形状非常一致也为概念导航依赖层级骨架提供了行为层面的直接证据。3.4 实验材料与刺激设计的坑这类实验最磨人的地方在刺激材料控制。我踩过的坑包括词频和具体性没有匹配——高频词天然更容易被选中混淆了结构效应类别覆盖不均衡——过度代表某些子类导致距离矩阵被少数类别主导练习效应——被试做多了会摸索出策略行为模式失真。几个经验一是所有材料都做预先的熟悉度评分只保留高熟悉度词条二是三元组和配对判断的呈现顺序随机化并且每个被试只判断全部材料的三分之一避免疲劳三是加入填充项比如明显无关的词对防住被试的答题惯性。做认知实验的精髓不是统计多花哨而是让每一个反应都真正来自概念结构本身而不是实验工件的伪迹。4. 数据怎么说话从行为反应到几何参数的分析流水线4.1 第一步把判断矩阵变成几何距离行为原始数据是相似度打分首先要把它转换为距离。常用变换是取相似度的负对数或直接相减。我用的是一组模拟数据来说明整条流水线。假设我们有8个概念分成两组组内紧密、组间疏远但带一点层级味道。相似度矩阵如下满分10越大越相似苹果香蕉梨狗狼猫鸟鹰苹果108721232香蕉810711221梨771021221狗212107843狼111710633猫222861043鸟322434108鹰211333810把相似度S映射成距离D我用的是D -ln(S/10)。这个变换来自经典的相似度-距离指数关系假设比线性减法的分布更均匀。4.2 第二步拟合曲率——三种模型同台竞技得到距离矩阵后同时拟合三个模型欧氏MDS零曲率、球面MDS正曲率、双曲MDS负曲率。每种模型把概念嵌入到低维空间然后计算嵌入距离与行为距离的误差。误差越小说明该几何假设越贴近真实表征。我在实际操作中用的是这个Python流程import numpy as np from sklearn.manifold import MDS from scipy.spatial.distance import pdist, squareform from scipy.optimize import minimize # 相似度矩阵见上表这里只放前4个概念做示例 S np.array([ [10, 8, 7, 2], [8, 10, 7, 1], [7, 7, 10, 2], [2, 1, 2, 10] ]) D -np.log(S / 10.0) # 相似度转距离 # 欧氏MDS直接用sklearn mds MDS(n_components2, dissimilarityprecomputed, random_state42, normalized_stressauto) coords mds.fit_transform(D) euclidean_error mds.stress_ # 双曲空间庞加莱圆盘拟合用优化器迭代出坐标 def poincare_dist(u, v, c1.0): u np.asarray(u); v np.asarray(v) u_norm np.linalg.norm(u); v_norm np.linalg.norm(v) diff np.linalg.norm(u - v) ** 2 num 2 * c * diff denom (1 - c * u_norm**2) * (1 - c * v_norm**2) # 防止数值不稳 if denom 0: return 1e6 arg 1 num / max(denom, 1e-8) return np.arccosh(max(1.0, arg)) / np.sqrt(c) # 初始值先用欧氏MDS的坐标做种子 rng np.random.default_rng(42) seed coords / 4 # 缩小到圆盘内 x0 seed.flatten() def loss(params, D_obs): coords_flat params.reshape(-1, 2) n coords_flat.shape[0] err 0.0 for i in range(n): for j in range(i1, n): pred poincare_dist(coords_flat[i], coords_flat[j]) err (pred - D_obs[i, j]) ** 2 return err res minimize(loss, x0, args(D,), methodBFGS) hyperbolic_error res.fun真实研究里模型比较一般用留一交叉验证或AIC/BIC这类信息准则而不是只比训练误差。注意双曲拟合的代码里有个关键点坐标初始值必须落在圆盘内否则优化过程会直接发散。我在第一次跑的时候没注意这个结果所有坐标飞到无穷远损失函数直接爆炸。这也是这类几何拟合里最常见的bug。4.3 第三步验证与交叉检验单靠拟合误差不能说明问题因为双曲空间参数更多拟合得好可能是过拟合。标准的做法是交叉验证把距离矩阵随机分成训练集和测试集在训练集上拟合坐标在测试集上计算预测误差。另一个有力验证是几何三角检验对任意三个概念测地线距离是否满足相应的三角关系双曲空间里是瘦三角形性质即两个短边的和只比第三边大一点点边界上还存在第三个点在两条测地线都附近。这个性质在行为数据上表现为层级相邻的概念对在路径上会共享大量中间节点使得看起来远的距离在测地线意义上反而很近。4.4 分析流水线本身的坑这套流水线我前后重构了三版总结出几个比较坑的地方。一是样本量行为实验的被试量少于30距离矩阵噪声非常大曲率估计几乎不可靠。二是概念数量少于30个概念的刺激集双曲和欧氏模型的区分度很低至少需要50-80个概念覆盖至少三个层级的分类树。三是相似度-距离的映射函数不要默认指数衰减最好用多个候选函数线性、负对数、幂律对比看哪一种产生的距离矩阵在后续模型拟合中一致性最高。四是曲率参数不能和维度参数一起瞎调先固定维度为2或3只优化曲率否则很容易在参数空间里迷路。5. 几何革命的实际冲击不只是认知科学的理论装饰5.1 对语义网络理论的颠覆几何转向最直接的影响是把语义网络的网络语言翻译成了几何语言。以前我们说狗是哺乳动物的一个子节点这是一种图论描述现在我们可以说狗的表示位于哺乳动物的某个测地线邻域内空间曲率决定了这个邻域的形状和容量。这种翻译不是换皮它带来了两个实质红利一是可以把连续性和拓扑性质直接纳入认知模型——概念之间的过渡比如从狗到狼不再需要离散的跳转而是沿测地线连续滑行二是给发展心理学一个预测工具——儿童概念习得的顺序应该遵循流形上的某种最优路径这个路径可以被几何模型预先算出来再拿行为数据去验证。我印象最深的是一个词汇增长模拟用双曲空间嵌入儿童早期习得的800个名词模型预测的习得顺序和真实语料库里的习得年龄相关达0.6以上远超欧氏嵌入。这说明几何结构不只是事后描述的抽象工具它真的在做预测性工作。5.2 对AI嵌入的启示Poincaré嵌入与双曲表征NLP这边的情况更直接。Nickel和Kiela在2017年提出Poincaré嵌入把知识图谱里的实体嵌入到双曲空间层级数据上的表示质量碾压了欧氏嵌入。现在你已经可以在PyTorch里用geoopt这类库直接定义双曲神经网络层。做推荐系统、知识图谱补全、语义检索的工程师开始越来越多地面对你那套L2距离其实在惩罚层级结构这类问题。实际工程中怎么选曲率我的经验是先跑一个快速诊断——把数据的层级化程度比如知识图谱里父类-子类比例算出来层级越明显越倾向于双曲如果数据结构更接近环形或球簇球面嵌入更合适混合结构就上乘积流形。调参方面双曲嵌入对学习率很敏感初期把学习率调低一个数量级让坐标慢慢飘进圆盘比直接大步长更新稳定得多。5.3 我自己的几点心得第一几何模型和行为数据之间不是证明关系而是互惠约束关系。行为实验提供约束几何模型提供预测二者反复迭代结论才立得住。单独跑一次实验就断言概念空间是黎曼流形修辞上是好看的科学上是单薄的。第二别忽视个体差异。不同被试的曲率估计可能差异很大一些人有更强的层级导航倾向另一些人更依赖局部关联。把被试层面的曲率参数当作个体差异的度量甚至可以做成一个个性量表——这在我看是个挺有价值的方向。第三实验设计的透明度和数据可得性决定这类研究能走多远。几何模型可验证性的基础是别人能用你的刺激材料、你的分析代码跑出同样的结果。我建议做这类跨学科研究的同行把刺激材料、原始反应时数据、以及拟合代码一起发布不然这个领域会淹没在一堆看起来很美的拟合图里这对谁都没好处。说到底概念空间是黎曼流形这个命题真正打动我的不是它听起来有多高级而是它第一次让几何变成一种可以被行为实验检验的科学假设。曲率不再是一个数学装饰而是一个有反应时、有错误率、有路径选择数据的实证参数。这条从欧氏到黎曼的转向现在才刚刚开始接下来的关键问题——混合曲率空间里概念如何组织、不同脑区是否对应不同几何结构、双曲表征如何与神经网络学习机制融合——每一个都够我们再折腾十年。
返回列表