面對全球教育界對生成式 AI(Generative AI)究竟該「全面開放」還是「嚴格禁止」的激烈爭論,OpenAI 與義大利頂尖學府博科尼大學(Bocconi University)攜手展開一項大規模隨機對照試驗(RCT)。
研究團隊針對超過 1,000 名大學一年級新生進行實驗,深入探討提供大型語言模型(LLMs)工具與進行批判性思維訓練,對學生產出商業提案的實質影響。研究結果顯示,使用 ChatGPT(GPT-4o)能顯著提升論述邏輯與架構嚴謹度,使學生的回答水準逼近專家;然而,唯有結合「因果推論(Causal Reasoning)」的深度思維訓練,才能真正激發出具備高度突破性與獨創性的商業解方。

千人隨機對照實驗拆解:GPT-4o 助攻邏輯架構,專家模範解答相似度大幅躍升
本次發表於最新論文《Training novices to think, or giving them LLMs? Evidence from an RCT》的實驗中,研究團隊以博科尼大學逾千名大一新生為對象,要求他們為校園紀念品商店設計整套行銷企劃方案。
實驗將學生班級隨機分配為四組:僅獲得 ChatGPT(GPT-4o)使用權限組、僅接受不依賴 AI 的「因果推論與批判性思維訓練」組、兼具 AI 與思維訓練組,以及兩者皆無的基準對照組。其中,因果推論組透過互動遊戲與即時回饋,學習精準剖析行動與結果之間的因果鏈,探討特定方案為何有效或在何種情境下可能失效。
在結合專家 5 分制評分與演算法自動化文本分析的綜合評估下,僅使用 ChatGPT 的學生組別展現出驚人的表現,其評分成績比基準對照組高出近一個等級(接近滿分 1 分的差距)。數據顯示,AI 輔助組別不僅產出更多數量的行銷策略,在文字邏輯清晰度、論證條理性以及與 3 位領域專家模範解答的語意相似度上均拔得頭籌。研究特別強調,學生並非單純「將作業全盤甩鍋給 AI」,而是由學生主動設定提示詞(Prompt)、反覆審查篩選 AI 回覆,並自行決定最終企劃的內容組合,扮演了關鍵的編輯與決策者角色。

因果思維孕育獨創點子,AI 時代需重構教育評量標準
相較於 ChatGPT 組在制式量表上的耀眼分數,僅接受因果推論訓練的學生組別則在「深層機制解釋」上表現卓越,能清晰說明策略成功的內在邏輯與潛在風險邊界。
然而,由於傳統 5 分制評量指標過度偏重於「論述結構完整與文筆流暢度」,未能充分獎勵深層邏輯推演,導致該組的制式分數未如預期拔尖。但透過自動化文本分析進一步挖掘發現,因果推論組在「點子獨創性(Originality)」與跳脫框架的新穎思維上,取得了所有組別中的最高水準,成功產出無人預料的創新見解。

最引人注目的是兼具「ChatGPT 輔助」與「因果推論訓練」的複合組別,該組在 5 分制評分和點子數量上達到與 AI 組相同的頂尖水準,同時在獨創性指標上與因果推論組並駕齊驅,展現出人機協同的極致綜效。
OpenAI 指出,當生成式 AI 能輕易協助新手產出「媲美專家水準」的標準化成品時,傳統以格式與邏輯為導向的評分標準將難以檢驗學生是否真正理解核心知識。這項研究清楚打破了「教導學生自主思考」與「教導學生使用 AI」的二元對立,證明高等教育未來應轉向鼓勵推論深度、跨域思維與獨創性的全新評量體系。
- 延伸閱讀:柬埔寨詐騙園區也導入AI了!OpenAI封殺多個ChatGPT帳號,揭露最新自動化詐騙流程
- 延伸閱讀:免費版也能用!ChatGPT 排程任務升級「事件驅動」機制,連動 Gmail、Slack 自動化處理瑣事教學
- 延伸閱讀:ChatGPT 免費試用完忘記取消訂閱?4 步驟即可向 OpenAI 申請退費
請注意!留言要自負法律責任,相關案例層出不窮,請慎重發文!