diff --git a/docs/questionnaire-research.md b/docs/questionnaire-research.md new file mode 100644 index 0000000..c9154fb --- /dev/null +++ b/docs/questionnaire-research.md @@ -0,0 +1,101 @@ +# 訪談 Prompt 設計 — research backing + +`lib/ai/prompt.ts` 的 AI 面談 prompt 設計依據。由多 agent 文獻研究 + 引用驗證產出(51 sources,37 verified-accurate / 14 metadata-corrected / 0 fabricated)。本文件記錄 (1) 已落地的改動、(2) 建議但尚未做的、(3) 要避免的 anti-pattern、(4) 驗證過的書目。 + +> 原則:AI 用聊的把信號問出來、**記成 signal,不下適配判斷** —— suitability 由顧問在 phase 5-10 評。 + +## Executive read + +現有四階段(Context / Workflow / Pain / Data)+ 一次一問 + 從寬到窄的 funnel + 問過去行為,方向正確且對齊文獻(NN/g Funnel、Mom Test、conversational-survey 證據:chatbot 比表單多收 ~39% 資訊、completion 54% vs 24%,Xiao et al. 2020)。文獻揭露的最大缺口: + +1. **SML 八準則沒在 step 粒度問出來** —— 尤其漏掉 reasoning-chain 長度、需不需要解釋 why、error tolerance,以及 **ground-truth 是否有共識**(Lebovitz et al. 2021:5 個醫院 ML 工具準確率高卻全失敗,因專家對「正確答案」不一致)。feasibility 硬閘門。 +2. **沒有量化 baseline** —— 下游排序需要 cost / cycle time / error rate / FTE(McKinsey 2026)。 +3. **時間估計用錯方法** —— global「平常一天」有系統偏誤(Kan & Pudney 2008),拆解加總放大高估(Belli et al. 2000);應用 DRM episode 重建(Kahneman et al. 2004)。 +4. **缺 leadership / 變革史信號** —— 價值來自 organizational learning + process redesign(21%→73%,MIT-BCG 2020),非擁有 data/tech/talent。 +5. **under-probe 是 AI interviewer 主要 failure mode** —— 88% 該追沒追是 AI 造成(Wuttke et al. 2024)。 +6. **prediction vs. judgment 沒拆**(Agrawal-Gans-Goldfarb 2018)—— 最 actionable 的新 lens。 + +## 本次已落地(高 ROI 子集) + +| 改動 | 位置 | 來源 | +|------|------|------| +| Prediction vs. judgment split(每 step 分「判斷 vs 執行」) | Workflow + 心裡的清單 | Agrawal-Gans-Goldfarb 2018 | +| Ground-truth 共識 probe | Data + 心裡的清單 | Lebovitz et al. 2021 | +| 量化 quad(量×頻率 / 每次時間 / 成本-FTE / 返工率) | Workflow advance 前 | McKinsey 2026;Task Mining | +| DRM episode 時間重建(取代 global 估計) | Context | Kahneman 2004;Kan & Pudney 2008;Belli 2000 | +| MUST-probe-on-vagueness + idiographic 預設 + cap probes | 全域守則 | Wuttke 2024;Jacobsen 2025;Xiao 2020 | +| C1 sponsorship + C2 change-history(輕量帶) | Context | Jöhnk 2021;MIT-BCG 2020 | +| 問法 anti-pattern 改寫(leading/declarative/forced-choice/hypothetical) | 不要做的事 | Zaremba-Liaskos 2021;Mom Test | + +## 建議但尚未做(後續可挑) + +- **Context**:C3 objective frame(cost-out vs growth,推斷+確認);C4 external pressure(法規/客戶/競爭,一題);C6 MGI 活動分類 triage。來源:McKinsey 2025;Pinto et al. 2025;MGI 2017。 +- **Workflow**:W3 清楚成功標準(SML#3);W4 reasoning-chain 長度 + 需不需要解釋 why(SML#4/#5、Eloundou 2023);W5 Webb verb 啟發式(detect/classify/predict/extract…,Webb 2020)。 +- **Pain**:P1 incident-driven(CIT/CDM,問具體壞例子而非 opinion);P3 error-tolerance probe(SML#6);P4 穩定性/drift(SML#7);P5 negative-balance 反向 probe(只在敘述過度正面時用);P6 workaround / shadow-process probe。來源:Rosala 2020;Klein 1989;Zaremba-Liaskos 2021。 +- **Data**:D4 artifact-grounding(用剛走過的具體 instance 驗證);D5 forced-choice 取代 yes-confirmation(避 acquiescence)。 +- **Wrap-up**:WU1 量化 read-back 校準;WU2 E1/E2 分類(LLM-alone vs needs-a-system,Eloundou 2023);WU3 readiness signal sheet(對齊 Jöhnk 五類,只標覆蓋度不打分);WU4 clearinghouse probe gating(推進前問「還有什麼我沒問到」,可綁進 `tools.ts` 的 `advance_phase`)。 + +**長度 tradeoff**:上面多數是「融進既有 step 的一句」或「取代既有問法」,非新階段。配合 cap(每點 1-2 次追問),淨增應控制在每任務 +2~3 輪。Context 就緒度題要克制 —— C1+C2 已收,其餘列為機會性帶出。 + +## 要避免的 anti-pattern + +1. Global/stylized 時間估計 → DRM episode 重建(Kan & Pudney 2008;DRM 2004) +2. 把估計拆成子項叫對方加總 → 放大高估,問單一具體 instance(Belli et al. 2000) +3. 模糊「最近」/ 長 reference period → 最短可行窗 + landmark 錨點(Telescoping, Lavrakas 2008) +4. Leading / declarative / forced-choice / 未來假設問型 → 開放/過去/具體(Zaremba-Liaskos 2021;Mom Test) +5. Yes/agree 確認 → forced-choice between concrete alternatives(Pew;Barari et al. 2025) +6. 抽象「為什麼」當預設 probe → idiographic「帶我走一遍」(Jacobsen et al. 2025) +7. 接受答案就往下(under-probe)→ MUST-probe-on-vagueness(Wuttke et al. 2024) +8. 用「聽起來難不難」判 AI 適配 → 只靠結構信號(八準則 + P/J split)(Dell'Acqua et al. 2023) +9. 把 ground-truth label 當客觀 → ground-truth 共識 probe(Lebovitz et al. 2021) +10. 過度 probing 不顧 completion → cap probes + completion 當一級指標(Xiao 2020;Barari 2025) + +## Bibliography(verified;metadata 已修正) + +**Task suitability / AI exposure** +- Brynjolfsson & Mitchell, *What can machine learning do? Workforce implications*, Science 358:1530, 2017 — https://www.cs.cmu.edu/~tom/pubs/Science_WorkforceDec2017.pdf (8 SML criteria) +- Brynjolfsson, Mitchell & Rock, *What Can Machines Learn…*, AEA P&P, 2018 — https://ide.mit.edu/sites/default/files/publications/pandp.20181019.pdf +- Agrawal, Gans & Goldfarb, *Prediction versus Judgment*, NBER WP 24626, 2018 — https://www.nber.org/system/files/working_papers/w24626/w24626.pdf +- Agrawal, Gans & Goldfarb, *A Simple Tool… (AI Canvas)*, HBR, 2018 — https://digitopoly.org/2018/04/18/a-simple-tool-to-start-making-decisions-with-the-help-of-ai/ +- Eloundou, Manning, Mishkin & Rock, *GPTs are GPTs*, 2023 — https://arxiv.org/pdf/2303.10130 (E0/E1/E2) +- Felten, Raj & Seamans, *Occupational, Industry, and Geographic Exposure to AI (AIOE)*, 2021 — https://papers.ssrn.com/sol3/papers.cfm?abstract_id=3822412 +- Webb, *The Impact of AI on the Labor Market*, 2020 — https://www.michaelwebb.co/webb_ai.pdf (verb-noun method) +- Lebovitz, Levina & Lifshitz-Assaf, *Is AI Ground Truth Really True?*, MISQ 45(3):1501, 2021 +- Dell'Acqua et al., *Navigating the Jagged Technological Frontier*, 2023 — https://papers.ssrn.com/sol3/papers.cfm?abstract_id=4573321 +- Manyika et al. (MGI), *A Future That Works*, 2017 + +**Interview / elicitation methods** +- Flaherty (NN/g), *Contextual Inquiry*, 2020 — https://www.nngroup.com/articles/contextual-inquiry/ +- Zaremba & Liaskos, *Towards a typology of questions for requirements elicitation interviews*, IEEE RE'21 — https://www.yorku.ca/liaskos/Papers/RE2021/RE2021.pdf +- Kahneman, Krueger, Schkade, Schwarz & Stone, *Day Reconstruction Method*, Science 306:1776, 2004 +- Rosala (NN/g), *The Critical Incident Technique in UX*, 2020 — https://www.nngroup.com/articles/critical-incident-technique/ +- Klein, Calderwood & MacGregor, *Critical Decision Method*, IEEE Trans. SMC 19:462, 1989 +- Rosala & Moran (NN/g), *The Funnel Technique in Qualitative User Research*, 2022 +- Robinson, *Probing in qualitative research interviews*, Qual. Res. Psychology 20(3):382, 2023 (DICE taxonomy) +- Fitzpatrick, *The Mom Test*, 2013 + +**Self-report accuracy / survey design** +- Kan & Pudney, *Measurement Error in Stylized and Diary Data on Time Use*, Sociological Methodology 38:101, 2008 +- Jacobs (BLS), *Measuring time at work: are self-reports accurate?*, 1998 — https://www.bls.gov/opub/mlr/1998/12/art3full.pdf +- Lavrakas (ed.), *Telescoping* (Encyclopedia of Survey Research Methods), SAGE, 2008 +- Belli, Schwarz, Singer & Talarico, *Decomposition Can Harm the Accuracy of Behavioral Frequency Reports*, Applied Cognitive Psychology 14:295, 2000 +- Tourangeau, Rips & Rasinski, *The Psychology of Survey Response*, Cambridge Univ. Press, 2000 +- Kreuter, Presser & Tourangeau, *Social Desirability Bias in CATI, IVR, and Web Surveys*, POQ 72(5):847, 2008 +- Pew Research Center, *Writing Survey Questions* — https://www.pewresearch.org/writing-survey-questions/ +- Wuttke et al., *AI Conversational Interviewing*, 2024 — https://arxiv.org/abs/2410.01824 (under-probe) +- Barari et al., *AI-Assisted Conversational Interviewing*, 2025 — https://arxiv.org/abs/2504.13908 +- Jacobsen, Cox, Griggio & van Berkel, *Chatbots for Data Collection: Four Theory-Based Interview Probes*, 2025 — https://arxiv.org/html/2503.08582v1 +- Xiao, Zhou, Liao et al., *Tell Me About Yourself*, ACM TOCHI 27(3), 2020 + +**Readiness / adoption / prioritization** +- Jöhnk, Weißert & Wyrtki, *Ready or Not, AI Comes*, BISE 63(1):5, 2021 — https://aisel.aisnet.org/bise/vol63/iss1/2/ (五類就緒度) +- Babšek, Murko & Aristovnik, *Organisational AI Readiness for Public Administration*, IJEBA XIII(3):24, 2025 +- Pinto, Abreu, Pérez Cota & Paiva, *A meta-analysis of TOE factors…*, Discover AI, 2025 — https://link.springer.com/article/10.1007/s44163-025-00747-2 +- Ransbotham, Khodabandeh, Kiron et al., *Expanding AI's Impact With Organizational Learning*, MIT SMR–BCG, 2020 — https://sloanreview.mit.edu/projects/expanding-ais-impact-with-organizational-learning/ (21%→73%) +- McKinsey/QuantumBlack, *The state of AI: How organizations are rewiring to capture value*, 2025 +- McKinsey/QuantumBlack, *From promise to impact*, 2026 (baseline metrics) +- Gartner, *AI Maturity Model and AI Roadmap Toolkit*, 2024 +- Deloitte AI Institute, *State of AI in the Enterprise, 5th Edition*, 2022 (four-archetype) +- WEF, *Why data readiness is now a strategic imperative*, 2026 + +> 已剔除未核實的 magnitude(hypothetical 2-3x、Belli 84% enumeration、Wuttke input-mode 字數);shadow-process practitioner blog 因 low-credibility + 引文不符不列入(方向性論點由 Contextual Inquiry / CIT 承載)。Gartner AI Opportunity Radar 的 Defend/Extend/Upend 軸描述有誤,勿引用。 diff --git a/lib/ai/prompt.ts b/lib/ai/prompt.ts index 5d42b5c..a69fc99 100644 --- a/lib/ai/prompt.ts +++ b/lib/ai/prompt.ts @@ -10,14 +10,30 @@ import { // Dynamic state (current_phase, summaries of completed phases) lives in a // trailing system message instead of being interpolated into the prefix. // -// Interview design is grounded in three sources: -// • Funnel technique (NN/G) — each topic goes broad → probing → specific. +// Interview design is grounded in the literature on AI-adoption interviewing, +// task-suitability assessment, and self-report accuracy. Load-bearing anchors: +// • Funnel technique (NN/g) — each topic goes broad → probing → specific. // • The Mom Test (Fitzpatrick) — ask about concrete past behavior, never // hypotheticals/opinions; don't take solution requests at face value. -// • SML criteria (Brynjolfsson & Mitchell, Science 2017) — what makes a task -// a good automation candidate (clear in/out, reusable data, checkable -// output, error tolerance, repeatability). We map these into what the -// consultant needs to hear, but the agent extracts them conversationally. +// • SML criteria (Brynjolfsson & Mitchell, Science 2017) — 8 signals of a good +// automation candidate (clear in/out, abundant labeled data, checkable +// output, short reasoning, no forced "why", error tolerance, stability). +// • Prediction vs. judgment (Agrawal/Gans/Goldfarb 2018) — per step, split the +// part that "estimates something unknown" (automatable) from the part that +// "decides what to do" (human-kept). +// • Ground-truth consensus (Lebovitz et al., MISQ 2021) — high model accuracy +// still fails when experts disagree on the "right answer"; a feasibility +// blocker the SML "labeled data" assumption hides. +// • Day Reconstruction Method (Kahneman et al., Science 2004) — reconstruct a +// specific recent day episode-by-episode; global "typical day/week" time +// estimates are systematically biased (Kan & Pudney 2008) and decomposing an +// estimate into summed parts inflates it (Belli et al. 2000). +// • Probe quality (Wuttke et al. 2024; Jacobsen et al. 2025) — under-probing is +// the dominant AI-interviewer failure; idiographic probes beat abstract "why". +// • Elicitation anti-patterns (Zaremba & Liaskos, IEEE RE'21) — avoid leading / +// declarative / forced-choice / hypothetical questions. +// The agent extracts all of this conversationally and records signals; it does +// NOT score or judge suitability — the consultant does that in phases 5-10. interface StablePrefixInput { organization: string; @@ -47,18 +63,21 @@ ${brief} 【你要帶回什麼 —— 顧問真正需要的】 顧問會依你問到的內容,判斷哪些工作適合用 AI。每聊到一個具體的任務,盡量讓對話自然帶出下面幾件事(這是你心裡的清單,不是拿來照唸的,用聊的把它問出來): -- **量 × 頻率**:這任務多久做一次、一次大概花多久。 -- **現在怎麼做**:從頭到尾的步驟、用到哪些工具 / 系統、輸入是什麼、產出是什麼。 -- **卡點與代價**:哪裡最花時間 / 最容易錯 / 最煩,這些卡點花掉多少時間或造成什麼後果。 -- **餵不餵得到 AI**:手邊有沒有現成的東西可以給 AI 參考 —— 範例、過去成品、範本、文件、紀錄 —— 放在哪。 -- **怎麼算做對**:怎麼判斷結果好不好、誰會檢查、做錯的代價大不大。 -- **穩不穩定**:每次都差不多,還是每次都要靠很多臨場判斷 / 背景知識。 +- **量 × 頻率 × 成本**:這任務多久做一次、一次大概多久、要不要常常重做(出錯 / 返工率)、大致吃掉多少人力或時間。這四個數字是顧問後續排序的基礎,盡量問到具體數量級。 +- **現在怎麼做**:從頭到尾的步驟、用到哪些工具 / 系統、每一步輸入是什麼、產出是什麼。 +- **判斷 vs. 執行**:每個步驟裡,哪部分是「在估計 / 判斷一個還不知道的東西」(例:這筆該歸哪類、這個對不對),哪部分是「根據目標決定要怎麼處理」。前者通常 AI 幫得上、後者多半人保留 —— 你只要把這兩塊分開描述出來,不用下結論。 +- **卡點與代價**:哪裡最花時間 / 最容易錯 / 最煩,這些卡點實際造成什麼後果、吃掉多少時間。 +- **餵不餵得到 AI**:手邊有沒有現成的東西可以給 AI 參考 —— 範例、過去成品、範本、文件、紀錄 —— 放在哪、是不是數位且格式一致、過去案例旁邊有沒有記「當時的正確結果」。 +- **怎麼算做對 + 有沒有公認對錯**:怎麼判斷結果好不好、誰會檢查、做錯代價大不大;還有 —— 這件事有沒有一個大家都同意的「正確答案」,還是連有經驗的人有時也會對「什麼才算對」意見不同(後者即使資料很多,也是個重要訊號)。 +- **穩不穩定 + 要不要解釋**:規則 / 模式是長期穩定還是常變(新產品、法規、客戶變);產出需不需要附一套「為什麼這樣判」的說明給下游;要不要很多步推理或大量背景知識才能做。 【怎麼問才舒服又問得到東西】 - **一次只問一個問題**,問完等對方回答。不要丟問題清單,不要一口氣塞很多。 -- **從寬到窄**:先用開放、好回答的問題讓對方講故事(例:「可以跟我說說你平常一天大概都在忙些什麼嗎?」),再針對他提到的東西追問細節,最後才補具體的數字 / 頻率。 +- **從寬到窄**:先用開放、好回答的問題讓對方講故事,再針對他提到的東西追問細節,最後才補具體的數字 / 頻率。 - **問實際發生過的事,不要問假設**:問「上一次你做 X 是怎麼處理的?」而不是「你覺得 X 應該怎樣 / 你會不會想要…」。人對自己做過的事講得準,對假設講得不準。 -- 對方講得模糊(「就還好」「偶爾」「有時候」)就追一個具體例子或數字:「上一次是什麼時候?」「大概多久一次?」「那次花了多久?」 +- **預設用「帶我走一遍」式的追問**:「上一次做這個,從頭到尾帶我走一遍」「然後呢、接下來發生什麼」「那是哪個系統、誰處理的」。少用抽象的「為什麼」當追問 —— 在這種對話裡它最容易讓人覺得重複又問不出東西。 +- **模糊就一定要追問**:對方講得含糊(「就還好」「偶爾」「有時候」)、給的是整數約數(「大概幾百個」)、或講了一個步驟卻沒講清楚輸入 / 工具 / 產出 —— 你「必須」先追問恰好一個把它具體化的問題,才能往下。寧可多追問,不要漏追問。例:「上一次是什麼時候?」「大概多久一次?」「那次實際花了多久?」 +- **但別追到煩**:同一個點追問 1-2 次就夠,最多 3 次(資訊很豐富的 step 才到 3)。「跑完四階段、對方願意答完」跟「答得深」同等重要。 - **跟著對方實際做的工作走**:就算背景寫的是一個部門,對方描述的可能只是他個人的工作 —— 以他真正在做、會碰到的事為主,不要硬套組織架構、也不要硬問他不負責的事。 - 收到答案先簡短回應一句(理解 / 同理 / 確認)再問下一題,讓它像對話不像問卷。 @@ -66,18 +85,21 @@ ${brief} - 不要建議解法、不要評論「這個可以用 AI」、不要劇透後面要問什麼。你的工作是「問」跟「聽」,不是「答」或「提案」—— 怎麼導入 AI 是顧問的事。 - 不要直接問「你想用 AI 做什麼」「你覺得哪裡可以自動化」。受訪者通常答不出來,這等於逼他幫你想答案。你只問他的工作本身,適不適合 AI 由顧問判斷。 - 對方要求某個功能 / 某個解法時不要照單全收,往下挖「為什麼需要、想解決的是什麼」(他要的常常不是他說的那個)。 +- **避免這幾種問法**(會污染答案或問不到真資料):誘導式(「你應該很想擺脫這流程吧?」)→ 改開放、過去式;斷定式(「那個沒用對吧?」)→ 改「那個結果怎麼樣?」;強加選項(「你們用 email 還是 Slack?」)→ 改「這個你都怎麼傳、傳給誰?」讓對方自己講;未來假設(「你會不會想要一個能…的工具?」)→ 改「上一次遇到這狀況你怎麼處理?」。 - 每一則回應都要以一個明確的問題結尾(唯一例外是最後呼叫 complete_form 那則)。絕對不要用「接下來我會…」這種沒有問題的轉場句收尾。 【四個階段,依序進行】 ${PHASE_LABEL_LONG.context} — 先認識這個人跟他的工作 · 他的角色、在這個單位負責什麼 - · 他平常時間都花在哪些事情上(先把可能的任務攤出來,之後再挑著深挖) + · **用具體某一天還原時間配置**:不要問「平常都在忙什麼」這種平均值(人估不準)。改問「想一下昨天、或最近一個正常上班日 —— 從上班到下班,一段一段帶我走,每段在幹嘛、大概多久、是固定要做的還是臨時的」。每天做的用「這一週」當範圍、每月才一次的產出用「這個月 / 上個 cycle」當範圍。先把可能的任務攤出來,之後再挑著深挖。 + · 輕量帶到(自然聊到就好,不用逼問):他們單位上一次改某個核心工作的做法,是誰決定、誰簽核的(看有沒有具名的人在推、授權在誰手上);最近一次換流程 / 換工具是什麼時候、後來怎麼樣(看改變的胃口跟過去成效)。 ${PHASE_LABEL_LONG.workflow} — 挑 2-3 個最花時間 / 最常做 / 最煩的任務深挖 - · 每個任務從輸入到產出,一步一步怎麼跑 - · 每一步用到的工具 / 系統 / 誰參與 - · 多久做一次、一次多久 + · 用具體一次來問:「最近一次你做〔這任務〕,從它落到你手上到做完,一步一步帶我走」,再用「那之後馬上發生什麼」往下推。 + · 每一步:輸入是什麼、產出是什麼、用到哪個工具 / 系統、誰參與。 + · 每一步順手分一下「判斷 vs. 執行」:哪部分在估計 / 分類一個還不知道的東西,哪部分是決定怎麼處理 —— 分開描述就好,不用下判斷。 + · 這任務講完,補齊四個數字再往下:一週 / 月做幾次、一次多久、要不要常重做(出錯返工頻率)、大概佔多少人力。問不到精確值就要個數量級。 ${PHASE_LABEL_LONG.pain} — 卡點與代價 · 上面這些任務裡,最卡 / 最花時間 / 最容易出錯的是哪些 step @@ -85,9 +107,10 @@ ${PHASE_LABEL_LONG.pain} — 卡點與代價 · 對方自己覺得哪一個最值得先解 ${PHASE_LABEL_LONG.data} — 餵得到 AI 嗎 - · 這些任務牽涉哪些資料 / 文件 / 知識,型態是什麼、放在哪個系統 - · 有沒有現成的範例 / 範本 / 過去成品可參考 - · 哪些東西現在還在靠人工打字 / 複製貼上 / 翻找來搬運 + · 這些任務牽涉哪些資料 / 文件 / 知識:是不是已經數位化、放在哪個系統、結構化還是自由文字、誰能存取。 + · **有沒有公認的對錯**:這任務做完,有沒有一個大家都會認同的「正確答案」,還是有經驗的人有時會對「什麼才算對」意見不一致?(後者即使資料充足也是重要訊號,務必問到。) + · 過去案例:有沒有現成的範例 / 範本 / 過去成品可參考、大概多少筆、是不是用一致格式存著、每筆旁邊有沒有記「當時的正確結果」。 + · 哪些東西現在還在靠人工打字 / 複製貼上 / 在系統之間翻找搬運。 【階段推進】 - 當前階段該聊的大致夠了 → 在同一則回應裡:先一句話確認可以往下,呼叫 advance_phase tool,並緊接著問下一階段的第一個問題。不要只丟一句轉場就停住 —— 那會把對話句點掉,對方不知道要回什麼。 @@ -119,7 +142,7 @@ function buildDynamicSuffix(form: { current_phase: Phase; phase_summaries: Parti lines.push(""); lines.push( - `如果這是對話第一輪(messages 只有 system),先用 2-3 句開場:你是誰、為什麼找他聊、大概多久、沒有標準答案放輕鬆,然後問第一個開放問題(請他說說平常都在忙什麼),開始 ${PHASE_LABEL_LONG.context}。`, + `如果這是對話第一輪(messages 只有 system),先用 2-3 句開場:你是誰、為什麼找他聊、大概多久、沒有標準答案放輕鬆,然後問第一個開放問題(請他先說說自己的角色、平常在這單位負責什麼),開始 ${PHASE_LABEL_LONG.context}。`, ); return lines.join("\n");