一個(gè)模型被問:“會(huì)織網(wǎng)的動(dòng)物有幾條腿?”它回答8。問題里沒有出現(xiàn)“蜘蛛”,但模型內(nèi)部其實(shí)已經(jīng)判斷這個(gè)動(dòng)物是蜘蛛。研究者沒有改動(dòng)問題,只把模型內(nèi)部“蜘蛛”的表示換成“螞蟻”,答案就變成了6。也就是說,在AI說出答案之前,它內(nèi)部可能已經(jīng)完成了我們看不到的判斷和推理。但大模型究竟如何一步步得到答案,至今仍沒有清楚的答案。
本期視頻,我們與AI可解釋性研究者Aryaman Arora聊聊,研究者如何“打開”AI黑箱:思維鏈?zhǔn)钦嬲乃伎歼^程嗎?模型內(nèi)部會(huì)形成對(duì)世界的理解嗎?我們能否通過觀察和干預(yù)模型,找到它做出判斷的原因?即使開始看懂模型,也不意味著我們已經(jīng)有能力修改它。有時(shí),AI為什么做對(duì)一件事,反而比它為什么犯錯(cuò)更容易解釋。
我們也聊到了AI正在呈現(xiàn)的新變化:模型會(huì)根據(jù)對(duì)用戶的判斷調(diào)整回答,也逐漸表現(xiàn)出不同的“性格”。可解釋性的意義,不只是“看懂”AI,更是理解它為何這樣判斷、是否值得信任,以及我們應(yīng)該在多大程度上把重要決策交給它。隨著模型能力增強(qiáng),理解AI也正變得越來越重要。