团建做了 MBTI,一位同事测出 INFJ,发朋友圈配文"终于有人懂我了"。三个月后公司换了个测评系统,她再测:ISTP。她拿着两份报告来找我,第一句话是"哪个是真的我"。
我的回答是:两个都是"真的"——真的问卷、真的算法、真的结果。变的不是她,是两份问卷里那些恰好骑在中间的题。这个故事几乎浓缩了 MBTI 全部争议的核心:它把连续的心理特质,切成了非此即彼的字母。这篇文章拆开 MBTI 的计分机制,讲清楚它测的到底是什么、为什么一半人换时间测会变,以及心理学界为什么更认大五人格。
四个字母从哪来:先说血统,再说算法
MBTI 的祖师爷是荣格 1921 年的《心理类型》,提出内倾/外倾两种态度。上世纪 40 年代,非心理学家的迈尔斯母女(Katharine Briggs 和 Isabel Myers)把荣格体系扩充成四个维度的问卷——E/I(能量方向)、S/N(信息获取)、T/F(决策方式)、J/P(生活方式),目标是给二战后大量进入职场的女性找一个"适合自己的工作类型"参考。
问卷的每道题都在给某个维度投票。题目形态通常是两种:
二选一(forced choice):"聚会结束后你感觉 A. 精力充沛 / B. 想独处恢复",只能选一个;
李克特量表(Likert):"我喜欢参加大型聚会",从"非常不同意"到"非常同意"五档或七档打分。
计分规则出奇地简单:每个维度把属于它的题目得分加总,算出你落在哪一侧、离中线多远:
比如 E/I 维度共 20 题,你的回答累计指向 E 侧的有 11 题——E 占 55%,超过 50% 中线,这个字母就是 E。四个维度各算各的,四个字母拼出 16 种类型之一。
很多报告里还有"偏好清晰度"(preference clarity)的说法,就是那个百分比离 50% 的距离:50-56% 叫轻微(slight),57-71% 中等(moderate),72-84% 明确(clear),85% 以上非常明确(very clear)。这个指标恰恰暴露了 MBTI 的软肋——它自己都在告诉你:字母背后是程度,不是类别。
一半人换时间测会变,问题出在切分
MBTI 重测一致性的研究结论广为流传的一版是:同一批人几周后重测,约一半的人至少有一个字母变了。这不是问卷出得敷衍——同样的题目拿去测重测信度,量表情愿做对的题都做对了。问题出在二分这个动作本身。
人格特质在人群中的分布接近正态:绝大多数人聚在中间,真正的极端 E 或极端 I 是少数。用 50% 这条线去切,刚好骑在线上的人最多,而他们被切向哪一侧几乎是随机的——今天心情、题目措辞、最近一次聚会的体验,都足以让 51%:49% 变成 49%:51%。而 51% 和 95% 拿到的是同一个字母 E,49% 和 5% 拿到的是同一个字母 I:类型系统把"程度"信息全部丢掉了,偏偏人群里"程度"才是分布的主体。
这不是 MBTI 独有的毛病,是一切"连续量强制分类"的共同代价。医学界把血压 130/80 定成高血压分界线,130 和 129 的健康差别其实微乎其微,但标签完全不同——区别在于医学界清楚这条线是管理方便的产物,而 MBTI 的 16 型在大众语境里常被当成本质类别:"我是 INTJ"听起来像血型,不像"我外向性得分 68"。
顺带说清它科学化路上的另一个坎:MBTI 的理论基础是荣格的类型学,不是数据驱动的因子分析。四个维度是否独立、是否覆盖了人格的主要变异,从来没有在心理测量学意义上站住脚——它是先有理论框架、再编题目去填,这和大五的路子正好相反。
大五人格:反过来的路
大五(Big Five / OCEAN)的路数是:不预设任何类型,海量收集描述人的形容词,让数据自己聚类,最终稳定收敛出五个维度——开放性(Openness)、尽责性(Conscientiousness)、外向性(Extraversion)、宜人性(Agreeableness)、神经质(Neuroticism)。
它和 MBTI 的关键差别有三点:
连续计分。每个维度 0-100,你的结果是五个数字,不是五个字母。尽责性 68 和 65 的差别被保留下来,而不是被切成"高尽责/低尽责"两种人。
跨文化可复现。五个因子在几十种语言、几十个国家的人群里反复被验证(即使具体数目在不同语料下略有出入——有研究提出六个因子的 HEXACO 模型,增加"诚实-谦逊"维度),是当代人格心理学的工作标准。
不做"类型解读"。大五报告会告诉你"你的尽责性位于人群第 70 百分位,与工作绩效的相关系数约 0.2-0.3"——它给你的是位置和关系强度,不是"尽责型人格适合当会计"这种故事。
代价是传播性:五个维度没有 16 型那种身份叙事,"我神经质 72 分"发朋友圈显然不如"我是 INFP"有画面感。MBTI 赢在语言系统好记好用,这是它流行七十年不衰的真正原因——它卖的不是测量精度,是一套自我认知的词汇表。
巴纳姆效应:为什么每份报告都觉得"说的是我"
1949 年心理学家弗瑞尔(Bertram Forer)做了个著名实验:给学生做"人格测验",然后每人发了一份相同的分析报告(从占星读物上拼凑的),让学生按 0-5 打分评价"准不准"。平均分 4.26。报告里有这样的句子:
你渴望被人喜欢和欣赏,但对自己通常很苛刻……你为自己能独立思考而自豪,不接受他人没有充分证据的陈述……
放之四海皆准的模糊描述,配合"这份报告是为你单独生成的"预期,几乎人人对号入座——这就是巴纳姆效应(Barnum effect)。判别方法很简单:把报告里的具体结论换到反义词再读一遍,"你外向"和"你内向"如果读着都像在说你,那这份描述的信息量为零。MBTI 官方报告比星座报告严谨得多(它有具体得分和明确前提),但16 型人格描述本身的普适措辞,依然在巴纳姆效应的射程内。
还有一点必须写在纸上:这类测评的正确用途是自我觉察和沟通语言,不是筛选决策。MBTI 结果不能预测工作绩效(元分析显示类型与绩效几乎无关),用 MBTI 筛简历、分团队、定晋升,既没有效度支持,在一些国家还有法律风险。人格测量预测绩效的正路是尽责性等连续维度,且只作为众多信号之一。
自己动手测的实用建议
如果你准备用 MBTI 十六型人格测试 做一次自我探索,几个提高信度的做法:
一次答完,凭第一直觉。纠结超过十秒的题,选那个"更常发生"而不是"更理想"的选项。社会期许偏差(把自己往好的方向答)是自陈量表最大的噪声源。
关注百分比而不是字母。结果里 E 占 52% 和 E 占 90% 是完全不同的信息,前者请对"我是外向的人"这个叙事保持怀疑。
隔一个月再测一次。两次结果对比,稳定的维度才是你的核心特征,跳变的那一两个维度说明你本来就在中间地带——这本身就是最有价值的发现。
顺手做一次大五。用 大五人格测试 拿到五个连续分数,再回头看 MBTI 的四个字母,你会对"测量"和"分类"的区别有一手体感。两个都测完,还可以用 EQ 情商测试 看看情绪维度——它与 IQ 一样是连续量,同样别信"高 EQ/低 EQ"的二分标签。
最后回到开头那位同事。她后来用百分比视角重新看了两份报告:I/E 维度两次分别是 52% 和 48%——她本来就骑在中线上,所谓"变了",只是中线附近的一次随机摆动。而 T/F 维度两次都在 60% 上下,稳定。她真正可靠的特征是"思维偏好明显、内外向模糊",两个字母组合给她的身份故事,远不如这个结论诚实。
心理测量的正确姿势,和A/B 测试看 p 值是一个道理:别只看标签和结论,去看数据本身的量和稳定性。工具没有错,错的是把温度计读数当成了体温的全部。
评论