大语言模型的人格化对齐及其对道德判断的影响
Personalized Alignment of Large Language Models and Its Impact on Moral Judgment
-
作者:
李昌锦
1,2,3
焦丽颖
4
陈圳
1,2,3
许恒彬
1,2,3
吴胜涛
5
许燕
1,2,3
-
作者单位:
- 通讯作者:
许燕
Email:xuyan@bnu.edu.cn
-
提交时间:2026-03-13 14:20:10
摘要: 随着人机共生时代的到来,大语言模型(LLMs)的伦理困境与算法偏见引发了社会广泛的担忧,引导人工智能技术实现向善发展已成为该领域极具紧迫性和挑战性的重要议题。研究探讨了基于HEXACO人格模型的人格化对齐对LLMs道德判断的影响,其中研究1检验并证实了LLMs可以通过遵循提示词有效表达HEXACO人格特质,研究2探讨了人格化对齐对LLMs功利主义倾向的影响及其与人类的异同。结果表明,高诚实-谦恭、宜人性和尽责性的人格提示词显著减少了GPT-3.5、GPT-4和ERNIE 3.5做出功利主义选择的倾向。由此,本研究提出基于HEXACO人格模型和人格元特质理论的LLMs人格化对齐框架,强调稳定性元特质中的诚实-谦恭、宜人性和尽责性等维度在LLMs人格化对齐中的道德凸显效应。本研究为人工智能人格化对齐的理论构建与技术路径提供了心理学依据。
版本历史
| [V1] |
2026-03-13 14:20:10 |
ChinaXiv:202603.00082V1
|
下载全文 |