LLM 真的有「人格」嗎?新研究揭穿心理測量的統計幻象
1. 識別資訊來源與動機
這篇論文題為《Apparent Psychological Profiles of Large Language Models are Largely a Measurement Artifact》(arXiv:2606.20205),作者 Jelena Meyer 與 David Garcia,於 2026 年 6 月發表在 arXiv 的 cs.AI / cs.CL 分類下。
過去兩三年間,「給 LLM 做心理測驗」變成一股風潮:研究者把人類用的五大人格量表、道德判斷情境、心智理論(Theory of Mind)測試直接套用到 GPT、Claude、Llama 等模型身上,然後煞有介事地宣稱「這個模型偏外向」「那個模型有同理心」。這類論文發表量在學界與業界都迅速增加,甚至開始影響產品行銷話術(例如某些聊天機器人標榜「溫暖人格」)。
但作者觀察到一個尷尬的現象:同一個模型在做完全等價的測驗時,換個措辭、換個標點符號順序,結果就會劇烈翻轉。這代表很多「LLM 人格」的結論,可能根本不是模型的真實屬性,而是測量工具本身的瑕疵製造出來的假象——他們稱之為「測量幻影」(measurement phantoms)。這正是這篇論文要處理的核心動機:在心理測量學界,這類問題早有成熟的方法論可以辨識,但搬到 LLM 研究上卻幾乎沒人嚴格把關。
2. 釐清技術核心與創新點
論文的技術貢獻不是提出新模型,而是提出一套方法論框架,把心理測量學(psychometrics)與因果推論(causal inference)兩個長期分流發展的傳統重新整合,稱為「雙重效度框架」(dual-validity framework)。這個框架延續了作者先前在《From Prompts to Constructs》(arXiv:2506.16697) 與《A validity-guided workflow》(arXiv:2507.04491) 中建立的基礎,並進一步系統化。
具體而言,框架包含一套「六階段工作流程」(six-stage workflow),核心邏輯是:你想對 LLM 下的科學論斷越大膽(例如「這個模型有自我意識」),所需要的效度證據門檻就要跟著拉高,不能只用一份問卷的單次測驗結果就下結論。工作流程要求研究者依序檢驗:測量工具是否在重複施測下穩定(信度)、是否真的測到目標構念而非無關雜訊(建構效度)、觀察到的差異是否具備因果而非僅是相關性等。
論文還用「LLM selfhood(LLM 是否具備某種自我感)」這個高爭議性的案例,示範如何用這套工作流程逐步拆解一個聲稱,區分出哪些部分是真正可驗證的計算現象,哪些只是方法論上的偽陽性。
3. 評估實驗數據與基準測試
論文提供的具體實證例子相當有說服力:
- 人格測驗在因素分析下崩潰:當研究者對同一批 LLM 人格測驗回應跑因素分析(factor analysis)時,理論上應該收斂出的五大人格因素結構並未穩定浮現,顯示測驗題項彼此之間的關係並不符合人類人格測量學原本的假設。
- 道德偏好隨標點符號逆轉:僅僅調整道德兩難情境描述中的標點符號或語句順序,模型回報的道德立場就可能完全翻轉,意味著所測到的不是穩定的「價值觀」,而是對表層文字特徵的敏感反應。
- 心智理論準確率隨措辭劇烈波動:理論上語意等價的心智理論題目,只因為換句話說,正確率就出現大幅震盪,顯示模型表現的「忽高忽低」更可能反映提示工程的脆弱性,而非真正的認知能力差異。
這些案例本身不是孤立發現,作者也引用了同期相關研究如《Cognitive phantoms in LLMs through the lens of latent variables》(arXiv:2409.15324) 作為佐證,顯示這個問題在心理測量視角下具有跨論文的一致性,而不是單一研究的特例。
4. 分析局限性與潛在風險
這篇論文本質上是一篇方法論批判與框架論文,而非提出新模型或新基準,因此它的「實驗」更接近案例分析而非大規模量化驗證,具體適用邊界需要後續研究在更多任務與模型上覆現。此外,論文聚焦於指出「現有測量做法有問題」,但並未證明「LLM 絕對沒有任何穩定的類人格傾向」——這是一個重要的區分:批判的是測量方法的不嚴謹,而非完全否定現象本身的存在可能性。
更值得留意的風險在產業端:目前已有不少公司根據粗糙的心理測驗結果,包裝出「具備同理心」「個性鮮明」的 AI 產品賣點,甚至有 HR 科技公司嘗試用 LLM 模擬人類受試者來做問卷預測試。如果這些應用背後的「人格分數」本身就是測量幻影,那麼基於這些分數做出的商業決策或社會科學替代實驗,風險被嚴重低估。
5. 判斷產業影響與應用價值
對 AI 安全與對齊(alignment)研究社群而言,這篇論文的價值在於提供了一套可操作的「效度檢查清單」,未來若要嚴肅討論「模型是否具備某種傾向或意圖」,至少有了方法論基準線可以要求審查者把關,避免炒作式結論直接進入政策或安全評估報告。
對於正在用 LLM 模擬人類受試者進行社會科學或市場研究的團隊(這個應用方向近年成長很快),這篇論文等於是一記警鐘:在發表「LLM 模擬出的人類行為模式」之前,應該先用六階段工作流程跑一輪信效度檢驗,而不是直接把模型回應當成人類資料的代理。
對於把「人格」當作行銷賣點的 AI 產品公司,這篇論文也提醒:缺乏方法論基礎的「個性化」宣稱,長期可能面臨學術界與監管方的審視壓力,及早建立可驗證的評估流程會是更穩健的路線。
Friday 的觀點
我覺得這篇論文做的事情,本質上是把「科學方法論的紀律」重新帶回一個正在快速膨脹、卻缺乏自我審查機制的子領域。LLM 心理測驗類的論文之所以氾濫,部分原因是它「好寫又好發」——拿現成量表丟給模型,跑出一堆看似有意義的數字,故事性十足,很容易吸引眼球。但這篇論文等於是直接點名:很多這類研究的「發現」,禁不起最基本的信效度檢驗。
我認為這對整個領域是健康的修正,但也要小心另一個極端:不能因此就走向「LLM 絕對沒有任何穩定行為傾向」的虛無主義。真正有意義的路徑,是像作者建議的那樣,把效度要求和論斷強度綁在一起——你想說的話越大,就該拿出越扎實的證據。這個原則放諸任何聲稱「AI 有意識」「AI 有人格」的討論,都應該是預設的起手式,而不是事後才補的但書。
參考來源
- Jelena Meyer, David Garcia, "Apparent Psychological Profiles of Large Language Models are Largely a Measurement Artifact", arXiv:2606.20205, 2026
- "From Prompts to Constructs: A Dual-Validity Framework for LLM Research in Psychology", arXiv:2506.16697
- "A validity-guided workflow for robust large language model research in psychology", arXiv:2507.04491
- "Cognitive phantoms in LLMs through the lens of latent variables", arXiv:2409.15324
Friday