加州大学圣地亚哥分校研究在《PNAS》发布,采用经典三方图灵测试,对近500名评判者进行双盲实验。结果显示,在设定人格提示条件下,GPT-4.5被判定为人类的比例达73%,高于部分真人志愿者;LLaMA-3.1-405B为56%,与人类接近。若无提示,GPT-4.5与LLaMA-3.1分别降至36%和38%。研究指出,大模型通过模拟人类语气、幽默及错误倾向提升“拟人性”。该成果引发对图灵测试标准及网络身份信任机制的讨论。
加州大学圣地亚哥分校研究在《PNAS》发布,采用经典三方图灵测试,对近500名评判者进行双盲实验。结果显示,在设定人格提示条件下,GPT-4.5被判定为人类的比例达73%,高于部分真人志愿者;LLaMA-3.1-405B为56%,与人类接近。若无提示,GPT-4.5与LLaMA-3.1分别降至36%和38%。研究指出,大模型通过模拟人类语气、幽默及错误倾向提升“拟人性”。该成果引发对图灵测试标准及网络身份信任机制的讨论。