方法學與指標辭典 Methods & Indicator Dictionary

北醫醫學人文課程地圖三層儀表板(Macro/Meso/Micro)之操作型定義、文獻依據、編碼判準與信度證據。儀表板上的每個 ⓘ 連到本頁對應條目。
編碼準則 TMAC12-v2.0-20260715(凍結) 頁面 v1 · 2026-07-20

① 指標辭典——儀表板上每個數字怎麼算

操作型定義的判準:任何人依同一規則對同一資料應算出同一數字。每個定義配一個「從真實資料現算」的算例(由生成腳本自資料庫即時計算,非手填)。

設計強度(intended)

定義:每門課每「教學單元」(週次/目標/作業)為分析單位。單元層級值=該單元 KSAP 四層評定(各 0–3)之最大值;矩陣格「課程 × 議題」=該課所有含此議題單元之層級值加總
算例(A38(1142 A班) × T2 同理):本班含 T2 之單元共 6 個——
週次單元KSAP 評定 → 單元層級值
W1課程介紹K2 S1 A1 P1 → 取最大 2
W2病人行為與全人照護-K1 S0 A1 P0 → 取最大 1
W6醫病關係-K2 S1 A1 P1 → 取最大 2
W7SDM-K3 S2 A2 P1 → 取最大 3
W11重症-長期使用呼吸器病人要不要接受「氣管造口術」K2 S1 A2 P1 → 取最大 2
W121150325靈性關懷的價值-學生版K2 S1 A2 P1 → 取最大 2
加總=12,即 Macro 設計矩陣該格數字。

展現件數(attained)

定義:一份作業經編碼得 0–4 個碼;每碼=議題 × 原文佐證句(≤30 字)× 單一主層次。矩陣格「課程 × 議題」=該課作業中含此議題之作業數(同一作業多碼只計一次)。
算例(A80 × T2 同理):含 T2 之作業共 461 件、覆蓋 291 位學生。其中一筆佐證句:「理解和支持病人的情感需求,是醫療工作者應具備的能力」(去識別,confidence=high)。

議題覆蓋

定義:13 議題(12+T13)中「至少一個單元(設計面)/至少一件作業(成效面)」出現該議題者之個數。
算例(全學程現值):設計面 13/13、成效面 13/13

KSAP 佔比

定義:成效面每碼標單一主層次(K 知識/S 技能/A 態度/P 實踐);佔比=該層碼數 ÷ 總碼數。
算例(v2 全庫):總碼數 20,681——K 823(4%)· S 643(3%)· A 19,109(92%)· P 106(1%)。

編碼信心

定義:每筆記錄帶編碼信心(high/medium/low,取該筆各碼眾數);儀表板聚合預設全計,分佈公開如下。
算例(v2 全庫 5,723 筆):high 4,901 · medium 562 · low 252(low 多為空碼記錄——判定無人文連結者)。

暴露人次(臨床實習・參與型)

定義:實習醫學生於臨床實習期間「完成」之人文相關面授/線上課程,每筆完成記錄計 1 人次;課程之人文相關性與 TMAC 議題由課程標題經凍結判準判定(無大綱,信心一律標 title-only);科技倫理邊緣課程列觀察名單不計入。矩陣格「議題 × 年度」=該年度完成該議題相關課程之人次總和。屬參與型暴露,不構成成效展現,與作業編碼之「展現件數」分軌呈現。
算例(現值):完成記錄共 20,660 筆(2021–2026.03),其中人文相關 5,164 人次/252 課;觀察名單 50 課未計入。

對齊 ρ(設計 vs 展現)

定義:同一門課,12 議題之「設計強度向量」與「展現件數向量」之 Spearman 等級相關(同名次取平均秩)。跨課可比的單一指標。
算例(A36)
議題設計強度展現件數
T194225
T269531
T3104640
T440530
T520274
T610155
T7078
T866259
T9046
T10014
T11128389
T12064
兩向量取秩後相關 ρ=0.83

② TMAC 議題給碼判準(12+T13,v2.1 凍結)

給碼當且僅當文本符合判準且能引原文佐證句;判準與排除規則凍結於編碼 prompt(TMAC12-v2.0-20260715,temperature=0)。條文依據:TMAC 醫學人文評鑑條文(2.3.0 專業素養總綱、2.3.13–2.3.17 專項條文、2.2.2.3 敘述性評估)。
ID議題條文依據給碼判準排除規則
專業素養群(TMAC 2.3.0)
T1利他2.3.0「利他」以病人/他人福祉優先於自身利益之價值表述或行動意向(服務、奉獻、回饋)僅描述課程要求而無個人價值表述→不給
T2同理2.3.0「同理」對病人/他者處境之換位理解或情感共鳴,含疾病經驗之體察僅同情語彙而無視角轉換→降信心
T3反思2.3.0「自我反思」對自身學習、情緒、價值或行為之後設覺察與批判性回顧純心得流水帳→不給;身份層次反思優先 T4(可並列)
T4專業素養與認同2.3.0 傘狀總綱專業身份之思索與形成(我想成為怎樣的醫師)、職業行為規範之內化(誠信、當責、界線)一般自我反思→T3;利他價值→T1 優先
專項議題
T5溝通2.3.0+2.3.13與病人、家屬、同事或醫事人員之溝通技巧、告知、傾聽、共享決策純簡報技巧僅當連結醫病情境才給
T6文化2.3.15+2.3.16(文化偏見)族群、跨文化、文化敏感度,或文化偏見之辨識與處理性別相關一律給 T12;宗教信仰→T7
T7宗教/靈性2.3.15「信仰」宗教、信仰、靈性需求、生死觀對健康照護之影響純文化習俗無信仰內涵→T6
T8倫理2.3.0+2.3.17倫理原則、道德判斷、知情同意、自主、利益衝突、研究倫理之辨析或應用純法條引用無倫理辨析→T9
T9法律2.3.17 法制面+2.3.14 通報義務(錨定較弱,見誠實聲明)醫療法規、醫糾、法律責任、通報義務之知識或應用倫理原則辨析→T8
T10暴力與虐待2.3.14 全文暴力、虐待(家暴、兒虐、性侵等)之辨識、預防、通報或處置性別歧視無暴力情節→T12
T11社會2.3.0「社會責任」社會責任、健康不平等、健康社會決定因素、弱勢照護、社區與公衛視角個人利他行為→T1;須制度性/群體視角
T12性別2.3.16「辨識與處理性別…偏見」性別意識、性別偏見之辨識與處理、性別與健康照護(含性少數醫療處境)文化族群偏見→T6;性暴力→T10
2026 年版新增(115 年度兩版並行)
T13AI 應用與倫理2026年版 2.2.14 及註釋(v2.1 新增)AI/生成式 AI/演算法於醫療或學習之合理使用、倫理與法律責任、資料隱私、數據偏見、應用界限、對 AI 產出之批判評估、人機協作中專業判斷之保持純技術操作無倫理素養內涵→不給;AI 法律責任純法條→T9 並列
v1→v2 變更:新增 T4 專業素養與認同、T12 性別(2.3.16);原「文化」議題移除性別內涵;12 議題重排——專業素養群(T1–T4)前置。既有 v1 編碼經對照表映射銜接,全量以 v2 判準重編。

③ 方法學文獻依據(逐字查證)

方法要素操作型定義文獻(經逐字查證)支持什麼
演繹式(導向式)內容分析以三架構為先驗類目,逐單元/作業依給碼判準判定,每碼附原文佐證句;無佐證不給碼Hsieh & Shannon 2005 Qual Health Res doi:10.1177/1049732305276687;Elo & Kyngäs 2008 J Adv Nursdirected/deductive 取徑之經典方法依據
關鍵字典僅作語料初篩關鍵字命中只決定文本是否進入編碼池;最終給碼由語意判定,儀表板數字=編碼命中數,非關鍵字次數同上(directed approach:理論衍生初始碼起步,語意歸類定案)回應「關鍵字分析信效度」質疑
課程地圖(設計面)以「教學單元×成果」矩陣呈現 intended curriculum;設計強度=Σ 單元 KSAP 最大層級值(0–3)Harden 2001 AMEE Guide No.21 Med Teach doi:10.1080/01421590120036547課程地圖之經典方法
KSAP 四層次K 認知/S 技能/A 情意/P 實踐;設計面各層 0–3、成效面每碼單一主層次Bloom, Engelhart, Furst, Hill & Krathwohl 1956(五位共同作者);Krathwohl et al. 1964;Miller 1990 Acad Med認知/情意分類+Miller 金字塔層級化
反思文本之成效編碼依判準給碼+佐證句;以「議題有無展現」為單位,不做深度計分Wald et al. 2012 REFLECT Acad Med(2020 複製研究 ICC 較低——支持我方採保守二元判定)反思可系統性評量+其信度爭議
敘述性/計畫性評量成效面以多源敘述文本編碼為證據,非單點考試van der Vleuten et al. 2012 Med Teach;TMAC 條文 2.2.2.3計畫性評量+條文直接授權
編碼者間信度分層 10%(n=417)由獨立第二模型盲編,主碼一致率 94%O'Connor & Joffe 2020 Int J Qual Methods一致性檢核之實務準則
LLM 輔助內容編碼地端固定版本模型+版控 prompt+固定參數+全量溯源鏈Huang et al. 2026 BMC Med Educ 26(1):674(LLM 分析 1,761 份學生反思);Castellanos et al. 2025 JMIR AI;Jeong et al. 2025 JAMIA OpenLLM 質性分析可行性(誠實標註:醫教頂尖期刊精準命中現階段 1 篇)
報告標準自我對照方法依 SRQR 21 項自我檢核O'Brien et al. 2014 Acad Med醫教質性研究報告標準

④ 信度與再現性

雙模型稽核(編碼者間信度)

分層抽樣 10%(n=417),由架構完全不同之獨立第二模型(雲端 Claude)盲編,僅給產物與判準、不給原編碼:主碼一致率 94%(至少一 TMAC 碼相符)。雲端模型作為一次性第二意見(非生產編碼器)。

×3 重跑再現性實驗

自 5,386 件重編語料等距抽樣 200 件(確定性抽樣、無隨機),以同一凍結 prompt、temperature=0 重跑兩輪,與生產輪兩兩比對:
比對主議題一致議題有無重疊碼集合完全一致Jaccard 平均KSAP 主層次一致
run1-run287%98%52%0.8193%
run1-run388%99%48%0.8194%
run2-run393%99%56%0.8496%
解讀:temperature=0 降低但不消除伺服端推論之非確定性——主議題判定穩定(87–93%)、KSAP 穩定(93–97%),浮動集中於「次要碼要給幾個」的邊界。因此儀表板一律以「議題有無展現」聚合、不做深度計分;單件作業之次要碼應容忍浮動。

全量溯源鏈

每筆編碼記錄帶 prompt_versionmodelcoded_at 欄位;判準全文凍結於版控檔案;v1 全量編碼歸檔保存(未刪除),v1→v2 議題對照表公開於架構定義檔。設計面重編另保留每單元 v1 原碼(framework_c_v1)供稽核。

版本歷程

版本期間內容
v12026-06 ~ 07TMAC 10 議題;成效面 5,723 筆普查完成;10% 雙模型稽核 94%
v2.12026-07-21新增 T13 AI 應用與倫理(2026 年版認證準則 2.2.14;115 年度兩版並行)。純增量:T1–T12 判準逐字不動;AI 關鍵詞候選子集補編(成效面 194 件中 136 件命中 T13、設計面 15 單元),凍結庫 tomato_lib_v2_1.py(TMAC13-v2.1-20260721,T=0)
v2.02026-07-15 凍結
07-20 全量重編
12 議題(+T4 專業素養與認同、+T12 性別)+判準/排除規則凍結+T=0+溯源欄位;成效面 5,723 筆、設計面 1,074 單元全量重編。其中 158 筆無文本之參與型記錄沿用 v1 碼經映射(記錄內明確標記)

⑤ 誠實聲明

  1. LLM 輔助編碼是新興方法:醫學教育頂尖期刊的直接文獻現階段有限(情境精準命中 1 篇),我方以「地端固定版本模型+prompt 版控+雙模型稽核+全量溯源」之工程手段補足方法學不確定性。
  2. 反思評量信度存在已知爭議(REFLECT 複製研究 ICC 較原研究低),故本系統以「議題展現之有無」為單位,不做深度計分與排名。
  3. T9 法律之條文錨定較弱:TMAC 2.3.17 無「法律」字樣,法律內涵散見通報義務(2.3.14)與倫理之法制面;如實標註。
  4. 伺服端非確定性:×3 實驗顯示 T=0 下碼集合完全一致率僅約五成,主議題一致 87–93%——所有治理數字建立在穩定的聚合層(有無展現、主碼),不建立在單件作業的完整碼集合上。
  5. 158 筆特例:無文本之參與型記錄(如出席/參與式活動)沿用 v1 碼經 v1→v2 映射,無法反映新議題 T4/T12;佔全庫 2.8%,記錄內以 note 明確標記。
  6. 年級比較為跨屆橫斷面(不同入學世代在不同年級的表現),非同一世代之縱貫追蹤;同世代縱貫累積中。
  7. 雲端 vs 地端:商用雲端模型會無預警改版,長期再現性弱於地端固定版本模型;本系統選地端正是為治理級資料之可再現性。雲端模型適合一次性第二意見(我方已用於 10% 稽核),不適合作為可再現之生產編碼器。
  8. 臨床實習暴露層為標題層編碼:實習數位課程僅有課程標題與行政類別、無大綱,人文判定與議題對應以標題為據(title-only),採嚴格判準。SPC 討論會依 2026-07-21 核定以「記錄層級之院方類別」判定——標示全人醫療者計入(T2;北醫21 MK1 跨界整合;AAMC PC1),其餘排除。科技類另設「能力對應軌」(精準醫療→PC1;AI/數位→MK3+MK5),以 45 項能力語言計暴露、不入 TMAC 熱圖;其餘邊緣課程仍列觀察名單不計入。此層計「暴露」不計「展現」,不與作業編碼混算。