FB 建議貼文

選取貼文複製成功(包含文章連結)!

AI 溝通大突破!研究揭露「亂碼」才是最強語言:效率提升 3 倍且語意無損

AI 溝通大突破!研究揭露「亂碼」才是最強語言:效率提升 3 倍且語意無損

在人工智慧的發展進程中,我們一直習慣用「人類的語言」來與 AI 溝通。有時候,你對AI提出問題後,你會看到他的思考模式閃現出一長串的文字,顯示了他在思考以及推理的過程。

甚至,有時候這過程會跑相當久,讓你覺得AI的思考也太愚蠢了吧?

但是,你有想過,AI 之間真的需要說人類語言、用人類語法思考嗎?

近期,來自上海交通大學、雪梨大學、合肥工業大學、西安交通大學以及南京大學的研究團隊,在預印本平台 arXiv 上發表了一項顛覆性的研究。

這篇名為《大型語言模型並不總是需要可讀語言》(Large Language Models Do Not Always Need Readable Language)的論文,直接點出了一個盲點:在 AI 的提示詞(Prompt)中,為了讓人類看懂而存在的自然語言,其實包含了大量浪費 Token 的冗餘資訊。

BabelTele:捨棄可讀性換取極致效率

為了突破這個瓶頸,研究團隊提出了一種名為「BabelTele」的全新文本壓縮方法。

BabelTele 的核心邏輯非常大膽:它完全不考慮人類的閱讀體驗。

這是一種專為「模型」而非「人類」設計的文本表示方法。BabelTele 透過融合多種語言的詞彙、數學符號、邏輯運算符,甚至是表情符號(Emoji),將原本冗長的自然語言,強制壓縮成一種高度密集的「模型語言」。

人類看了可能只覺得是一堆亂碼。

但大型語言模型(LLM)卻能精準解碼,毫不費力地理解其中的深層涵義。

AI 溝通大突破!研究揭露「亂碼」才是最強語言:效率提升 3 倍且語意無損

壓縮率驚人:省下 70% 空間,語意卻幾乎無損

論文中展示了 BabelTele 驚人的壓縮能力。

在實驗測試中,BabelTele 能將文本大幅壓縮至原來的 27.9%。更令人震撼的是,在如此極端的壓縮比例下,它依然能保持高達 99.5% 的語意準確性。這意味著在將文本體積縮減近四分之三的同時,幾乎沒有遺失任何對模型而言有價值的資訊。

為了解決「AI 是不是真的懂」的疑慮,研究團隊利用 QuALITY 長文本問答資料集進行了對照實驗。

他們讓人類讀者與 AI 模型(Gemini 3.1 Pro)分別閱讀「原始文本」與「BabelTele 壓縮文本」,然後進行問答測驗。

結果不出所料:人類在閱讀 BabelTele 文本後,問答準確率呈現斷崖式下跌;然而,Gemini 3.1 Pro 的準確率卻依然穩如泰山。

這項結果強烈證明了,BabelTele 在捨棄人類可讀性的同時,完美保留了模型所需的關鍵語意特徵。在同等壓縮率下,無論是處理長篇會議紀錄(MeetingBank)或是長文件問答(QuALITY),BabelTele 的表現都遠勝於傳統的自然語言摘要技術,甚至超越了專門的提示詞壓縮工具(如 LLMLingua-2)。

「零樣本」跨模型溝通:AI 專屬溝通時代來臨?

更讓人興奮的是 BabelTele 在跨模型溝通上的潛力。

研究證實,BabelTele 可以在不同的大型語言模型之間進行「零樣本」(Zero-shot)傳遞。也就是說,由 A 模型生成的壓縮文本,B 模型完全不需要經過額外訓練,就能直接「聽懂」。

這簡直就是 AI 之間的通用語言。

在多智能體(Multi-Agent)通訊測試中,BabelTele 成功減少了約 40% 的通訊 Token 消耗,同時還能維持超過 96% 的任務達成率。在智能體記憶任務(LoCoMo 基準測試)中,其記憶保留的效果也比一般摘要方法更為優異。

這項研究無疑為 AI 領域打開了一扇通往「模型原生語言」的大門。未來,若是 AI 的底層邏輯能夠進一步適應這類原生元語言,我們或許能見證 AI 溝通成本的大幅下降。

儘管目前的 BabelTele 仍屬於概念驗證階段,且跨模型傳輸效果仍會受到壓縮模型與閱讀模型配對的影響。但在未來 AI Agent 頻繁協作、長文本處理需求暴增的場景中,專為模型設計的「AI 語言」,絕對是突破算力與 Token 限制的關鍵解方。

 

 

IFENG
作者

鳳凰網(科技),集綜合資訊、視訊分發、原創內容製作、網路廣播、網路直播、媒體電商等多領域於一身,並於2011年在紐交所上市(紐交所代碼:FENG),成為全球首個從傳統媒體分拆上市的新媒體公司。

發表回應
謹慎發言,尊重彼此。按此展開留言規則