Home
Explore Uedu
Student Console
Register as Member/Login
(2) In future presentations of the research findings, in addition to the course project website and public presentations, your real name and personal information will not appear in this research report. If you are interested in the research results, we can provide you with an executive summary after the study is completed.
Survey Center
Teacher Console
Course Setup
Support & Messages
Uptime Data

UeduGPTs

--

Jupyters

2

Local AI

--

CISOSE26 本地 AI UG26
Taipei AQI 45 · Taichung AQI 32 · Tainan AQI 35 · Kaohsiung AQI 34

AI Reply Desktop Notifications

Show a desktop notification when the AI TA finishes replying

Chat Message Notifications

Notify me when classmates post messages in the forum

Sound notification

Play an alert sound whenever there is a new notification

AI 助教

為學習而設計的蘇格拉底式 AI 助教:跨班重現的成效、使用者感受,與「費力訊號」

Designing and evaluating a Socratic-scaffolded conversational AI assistant for educational tasks: Cross-cohort effectiveness, user perception, and the effort signature

期刊論文 K.-H. Li* and C.-K. Chang* (* 通訊作者) International Journal of Human–Computer Interaction

這篇研究在探討什麼

我們把課堂的 AI 助教設計成「先反問,再回答」,然後連續三個學期問學生:這樣好用嗎? 答案很有意思——學生明白地表示這種模式比較累, 但當我們請他們拿它跟「有問必答的 AI」直接比較時, 他們反而在「哪一種讓我真的搞懂」這一題上,給了最高的分數。

我們把這個「覺得比較費力、卻認為比較值得」的成對現象命名為 費力訊號(effort signature),並主張它不是設計的缺點,而是設計正在生效的證據。 本論文由李奎皓老師(第一作者)與張家凱助理教授發表於 《International Journal of Human–Computer Interaction》(IJHCI,Taylor & Francis), 這是一本專門刊登人機互動設計研究的國際期刊—— 也就是說,這篇的讀者不只是教育界,還包括所有在設計 AI 對話介面的人。

為什麼要「故意」讓 AI 不直接給答案?

2025 年一份發表於《PNAS》的大型隨機對照研究(Bastani 等人,近千名中學生)帶來一個令人不安的發現: 讓學生使用有問必答的 AI,當下的解題表現大幅提升(48–127%), 但等到把 AI 收走、讓他們自己作答時,成績反而比沒用過 AI 的同學低了 17%

換句話說,最順手、最令人滿意的 AI 使用方式,可能正在悄悄掏空使用者本來要培養的能力。 這個現象不限於教室——任何「使用者的目標是學會,而不只是做完」的場合都會遇到, 例如新進分析師靠 AI 熟悉產業知識、寫作者在 AI 協助下發展自己的文風、 醫師必須有能力獨立判斷 AI 給的診斷建議。

同一份研究也指出了解方:如果 AI 被設定成不直接給解答、而是要求使用者先說出自己的想法, 這個長期傷害就不會出現。本研究做的,就是把這個「解方」實際做成一套可以長期運作的系統, 並且誠實面對一個現實問題——這樣的 AI,學生會不會因為太麻煩而乾脆不用?

三層設計:讓 AI 幫忙,但不代替思考

論文提出的設計由三層組成,每一層各自擋掉一種「過度依賴」的失敗方式:

  • 第一層/限定教材範圍:AI 只根據授課教師上傳的講義、作業與參考資料回答, 不從整個網路或模型的通用知識裡找答案。 這一層擋的是「答案技術上正確,卻跳過了課程刻意安排的難度階梯」—— 例如學生還在學迴圈,AI 卻直接丟出一行進階寫法把題目解掉。
  • 第二層/預設先反問:學生問「我的程式哪裡錯了?」, AI 會先反問「你原本預期第三圈跑出什麼?實際跑出什麼?」, 等學生說出自己的判斷之後,才給明確的指引。
  • 第三層/看得見的思考層次:系統會自動標記每一則學生提問屬於哪一種認知層次 (記憶、理解、應用、分析、評鑑、創造), 讓教師與研究者能夠觀察「這場對話到底把學生帶到多深」,而不只是看聊了幾句。

需要說明的是,第三層在這篇論文裡只是觀測儀器,不是被檢驗的成效指標—— 它產出的認知層次資料,是另一篇論文的主題,本文沒有拿它當作結論的依據。

一個關鍵的設計決定:是「拖慢」,不是「拒絕」

如果學生說「不要問了,直接告訴我第 4 題答案」,這套 AI 會怎麼做? 答案是:它會先請學生回答一個小問題(例如「如果輸入是空的清單,這個函式應該回傳什麼?」), 學生回應之後,就會給出明確的指引

這是刻意的取捨。硬性拒絕回答,只會讓學生轉頭去用外面沒有任何限制的 AI, 結果是設計完全失效。所以我們選擇把直接回答「延後」而不是「取消」—— 保留學生自願使用的意願,同時在每一次互動中都插入一個必須自己思考的環節。

三個學期、三份調查,得到什麼?

研究在一所大學的 Python 程式設計入門課(修課學生多為非資訊本科系)進行,橫跨三個連續學期, 分成三項互補的調查:

  • 學習表現:兩個班級各自重現(合計 82 人)。 學生在學期初與學期末以同一份 37 題測驗作答, 2023 秋季班平均進步 18.91 分、2024 秋季班進步 17.28 分, 兩班的效果量分別為 1.25 與 1.13(合併 1.20,屬於統計上的「大」效果), 82 人中有 71 人(86.6%)分數上升。 兩個獨立班級的進步幅度只差 1.6 分, 這代表結果不是某一屆學生剛好比較強所造成的偶然。
  • 使用者評價:三個學期都沒有退燒(203 份回應)。 學習價值、任務幫助、介面易用性、繼續使用意願、整體滿意度五個面向, 分數落在 75–79%(其中介面易用性 75.8%,對照國際通用的可用性標準屬於「良好」區間)。 更值得注意的是,四次調查橫跨三個學期,每個面向的變動幅度都不到 4 個百分點
  • 費力訊號:直接請學生比較兩種模式(90 份回應)。 這份問卷專門針對「先反問」這個互動模式提問,結果見下一段。

最有意思的一組數字

在針對蘇格拉底式對話的五個面向中,分數呈現一個乍看矛盾、細想卻很合理的排列:

  • 最低分是「減輕焦慮」(60.7%)。這完全說得通—— 當你卡住、鼓起勇氣發問,AI 卻回你一個問題, 那段「還是不知道答案」的時間被拉長了,對正在掙扎的初學者來說當然不輕鬆。
  • 最高分是「跟有問必答的 AI 相比,哪個讓我理解更深」(69.4%)。 這一組共九道題,請學生就理解深度、思考的條理、面對難題的能力三方面做直接比較。
  • 中間是幫助理解(68.5%)、學習動機(65.4%)、願意推薦(63.1%)。

把這兩端放在一起讀,學生實際上是在說: 「這個模式讓我比較不舒服,但它值得。」 這正是我們定義的費力訊號。 有趣的是,這個現象在人機互動領域早有前例—— Buçinca 等人(2021)就發現,最能減少人們盲目依賴 AI 的設計,往往拿到最低的主觀評價。 這也意味著:如果只用「使用者滿意度」當作優化目標,會系統性地淘汰掉那些真正保護使用者能力的設計。

對設計者而言,費力訊號可以當成一組檢查工具: 如果一套設計兩個成分都沒有(既不費力、也沒有比較後的認可),代表它其實沒有真的改變互動; 只有費力、沒有認可,代表使用者會逐漸放棄它; 只有認可、沒有費力,代表它可能根本沒有擋下過度依賴。

「不退燒」為什麼值得一提

教育科技有一個很常見的現象叫做新鮮感衰退:新工具剛上線時大家都覺得很棒, 一兩個學期後熱度消退、評價下滑。許多論文的評估剛好只做在系統上線的那個時間點, 因此報告出來的接受度往往被新鮮感灌了水。

本研究涵蓋四次調查、三個學期,期中與期末都測, 中途甚至把問卷從 5 點量表改成 7 點量表(這種改動通常會讓分數產生偏移), 結果分數依然穩定。 對一個「刻意讓使用者比較費力」的設計來說,這一點特別重要—— 它顯示把直接回答延後而非拒絕的柔性做法,確實守住了學生繼續使用的意願

一個出乎意料的空結果

我們原本預期「學習動機比較強的學生,最後表現也會比較好」。 但在 2024 秋季班(39 人)的分析中,把學期初測得的內在動機加進預測模型後, 對期末成績的解釋力只增加了 0.4 個百分點,動機與進步幅度的相關幾乎是零。

這個結果要小心解讀,論文本身也把它列為限制:樣本只有 39 人, 而且這群學生的動機分數普遍偏高(7 點量表平均 5.84), 也就是「動機低」的那一端根本沒有出現在樣本裡,統計上不容易驗出差異。 我們如實把它報告為空結果,而不是宣稱「動機不重要」。 它真正的用處是提醒 AI 助教的設計者: 在一群本來就願意學的使用者裡,個別動機差異可能不是值得花力氣去追蹤與介入的變項。

解讀界線(這篇不主張什麼)

與 Uedu 一貫的研究紀律相同,這篇論文對自己的宣稱設有明確界線,這些界線在正式論文中都白紙黑字寫著:

  • 成績進步「伴隨」這套設計,不等於「由」這套設計造成。 研究沒有設置同期的對照組(也就是沒有另一班用「有問必答」版本的 AI), 因此學生的進步同時包含了課程本身、正常學習歷程與 AI 助教的貢獻,無法把功勞單獨歸給設計。 這是論文自列的第一號限制,也是團隊下一個研究要優先處理的問題。
  • 沒有辦法回答「用得越多、進步越多嗎」。 因為同意書架構要求資料在分析前去識別化,個別學生的使用量無法與個別成績對應, 本研究只能在班級層次談關聯。
  • 單一學校、單一課程。三個學期的重現屬於同一所學校內的縱向重現, 不等於跨校、跨學科的普適性。
  • 問卷是研究團隊自行編製的,內部一致性良好(Cronbach's α = .78–.91), 但尚未經過正式的因素結構驗證。
  • 文化脈絡有其特殊性。研究在臺灣的高等教育現場進行, 學生對 AI 應該扮演什麼角色的期待,可能與其他文化不同, 因此論文明確表示不主張文化上的可移轉性

對教師與設計者的啟示

  • 把「不舒服」跟「不好用」分開看。 學生說某個模式比較累,不代表這個設計失敗; 要判斷它是否有效,該問的是「跟直接給答案的版本比,哪個讓你真的學會」這類比較性問題, 而不是只問滿意度。
  • 焦慮那一塊要另外補。 本研究中減輕焦慮是最低分的面向,這是設計上真實的代價。 論文的建議不是放棄反問,而是搭配情感面的鷹架—— 明確肯定學生已經做對的部分、把犯錯正常化、 並且讓學生知道「AI 現在反問你,是為了什麼」。看不見理由的提問,只會讓人覺得被刁難。
  • 這個模式不只屬於教室。 任何「使用者的長期能力比這一次的產出更重要」的場合, 都可以套用同一個三層樣板:限定資料來源、要求使用者先表述判斷、 並且建立可觀察互動深度的量測機制。

在 Uedu 上的實踐:ClassroomGPT 蘇格拉底式對話

這篇論文評估的就是 Uedu 平台上的 ClassroomGPT: 教師可以上傳自己的教材讓 AI 助教只根據課程內容回答, 並透過 system prompt 設定「先反問、再回答」的互動風格; 學生的每一則提問也會自動標記認知層次,讓教師看見思考的深度而不只是使用次數。 需要提醒的是,蘇格拉底式對話是可由教師選擇開啟的教學設計, 平台一般 AI 助教的預設風格仍是盡力清楚回答。

前往使用

引用資訊

K.-H. Li and C.-K. Chang, "Designing and evaluating a Socratic-scaffolded conversational AI assistant for educational tasks: Cross-cohort effectiveness, user perception, and the effort signature," International Journal of Human–Computer Interaction, 2026, accepted (in press).
更多研究
AI 助教 雙角色 Agentic AI 作為 AI 講師與教學助理:對大學英語(EFL)學習者自主性、自我調節學習與內在動機的影響 學習分析 對話即學習:學生與 AI 對話中的學科相關認知投入型態 AI 助教 為學習而設計的蘇格拉底式 AI 助教:跨班重現的成效、使用者感受,與「費力訊號」 AI 評量 以生成式 AI 測驗平台提升學習成效 AI 評量 AI 自動化貼文評分系統促進跨領域知識分享 AI 助教 生成式 AI 圖形化學習輔助工具於智財權課程之分析 AI 助教 生成式 AI Python 學習輔助系統:評估其對儀器自動化技能之影響 AI 助教 Python 課程中對話焦點與學習體驗之相關分析 AI 評量 以提示工程方法透過 LLM 評估教育中的認知表現 學習分析 運用知識圖譜與大型語言模型追蹤分析學習軌跡 數據基礎建設 Educational Omics 教育資料湖:多模態科技輔助學習基礎建設 生理感測 從穿戴裝置到課堂:考量個體差異的 HRV 生理監測學習分析可行性研究 學習分析 多模態 VLM 課堂協調:預測學生分心的精確時刻 學習分析 透過嵌入幾何驗證基於自然語言的教育數位孿生於 Python 課程 生理感測 多模態學習分析中的時序延遲效應:生理—行為特徵化 AI 助教 大規模 AI 助教:跨學科採用模式與數百門大學課程的認知投入分析 生理感測 PALM:透過消費級穿戴裝置與大型語言模型實現可擴展的生理感知 AI 輔導 生理感測 基於本地 LLM 的邊緣部署 EEG 睡眠分期協作推理框架 生理感測 C-GRASP:基於臨床推理的情感訊號處理框架 數據基礎建設 異質文本資料可擴展處理之分散式語意分析系統設計
想做類似研究?

我們提供研究設計諮詢、IRB 支援與資料匯出,讓您的教學實踐也能成為學術研究。

預約討論