《電子技術應用》
您所在的位置:首頁 > 人工智能 > 业界动态 > 现代AI系统通过图灵测试首获证实

现代AI系统通过图灵测试首获证实

2026-05-22
來源:科技日报

美國加州大學圣迭戈分校科學家開展了一項實證研究,首次證明現代人工智能(AI)系統通過了圖靈測試。相關論文發表于新一期《美國國家科學院院刊》。

這是首個嚴格采用圖靈測試來評估大語言模型的研究。圖靈測試由英國數學家、“計算機科學之父”阿蘭·圖靈于1950年提出,是檢驗機器能否逼真模仿人類對話、使人們無法將其與真人區分開來的重要科學基準。

為獲得更具代表性的結果,團隊研究了兩組人群:一組是美國加州大學圣迭戈分校本科生;另一組是通過Prolific平臺招募的更廣泛的在線樣本。整個實驗共有近500人參與。

在隨機對照試驗中,參與者同時與另外兩方聊天,一方是人類,另一方是大語言模型。實驗涉及4種模型,包括目前最先進的GPT-4.5和LLaMa-3.1-405B,以及較舊的基線模型GPT-4o和ELIZA,后者是20世紀60年代基于規則的經典聊天機器人。

結果顯示,GPT-4.5在73%的情況下被判定為人類,這意味著參與者將其選為“人類”的頻率,明顯高于他們選擇真實人類參與者的頻率。在同樣提示下,LLaMa-3.1-405B在56%的情況下被判定為“人類”,在統計學上與其所比較的真實人類沒有顯著區別。基線系統的表現則遜色得多:ELIZA和GPT-4o總體上分別只有23%和21%的情況被選為“人類”。

若給予恰當的提示,先進大語言模型能表現出與人類無異的語氣、直率、幽默,乃至易犯的錯誤。科學家此前已知道,大語言模型幾乎可以輕松生成與任何主題相關的知識,但這項測試表明,它還能令人信服地展現社會行為特征,這對人們如何看待AI具有重大意義。

團隊表示,每個大語言模型都有“性格”,會采用特定的人物設定和溝通風格。大語言模型并非依靠展示知識的能力取勝,而是因其像人類一樣會犯錯而勝出。這些特征,與他們認為圖靈所設想的那種數學與邏輯解題能力并不相同。

不過,團隊也發現,若無明確指示,這些模型被誤認為人類的概率便會大打折扣:GPT-4.5的獲選率降至36%,LLaMa-3.1降至38%,基線系統ELIZA和GPT-4o被選為人類的概率則更低。

2.jpg

本站內容除特別聲明的原創文章之外,轉載內容只為傳遞更多信息,并不代表本網站贊同其觀點。轉載的所有的文章、圖片、音/視頻文件等資料的版權歸版權所有權人所有。本站采用的非本站原創文章及圖片等內容無法一一聯系確認版權者。如涉及作品內容、版權和其它問題,請及時通過電子郵件或電話通知我們,以便迅速采取適當措施,避免給雙方造成不必要的經濟損失。聯系電話:010-82306118;郵箱:aet@chinaaet.com。
主站蜘蛛池模板: 岛国一区二区三区高清视频| 久久99影院| 国产在线拍偷自揄拍精品| 亚洲欧洲精品一区二区| 精品中文字幕在线观看| 日韩av免费一区| 国产精品美女主播| 久久免费视频观看| 欧洲精品视频在线| 九九久久国产精品| 久久精品亚洲精品| 国产精品精品国产| 国产精品视频免费观看www| 久久久久99精品久久久久| 日韩欧美精品在线观看视频| 97久久精品在线| 高清视频一区二区三区| 激情六月丁香婷婷| 久久久久久91| 日韩在线播放一区| 国产中文字幕在线免费观看| 日本一区二区三区免费看| 久久久久久香蕉| 欧美日韩在线不卡视频 | 中文字幕一区综合| 久久中文字幕在线视频V| 国产精品免费在线免费| 国产成人精品在线| 欧美日韩一区二区三区在线视频| 97精品在线观看| 日韩中文字幕网站| 国产三区在线视频| 久久精品国产2020观看福利| 欧美高清性xxxxhd| 99久久99久久精品国产片| 亚洲午夜精品福利| 国产成人精品久久亚洲高清不卡| 国产美女被下药99| 亚洲精品电影在线一区| 激情婷婷综合网| 精品国产免费人成电影在线观...|