第一層
ChatGPT、Claude 背後那顆腦
其實在玩文字接龍
你給它幾個字,它就猜下一個最可能的字,接上去,再猜下一個。如此而已。
接上去、再猜下一個 ── 一個字一個字,就這樣吐出一整句。
它不是魔法,是個會接龍的工具。看懂這件事,你就不會神化它,也不會怕它。
AGENT SKILL 一日工作坊 · 先備知識
AI 拆開來其實很單純:一顆會想的腦、一雙能動手的手腳、再插上可拆換的技能。最後那塊 Skill,就是你今天要親手做的。
腦是 LLM,手腳是 Tool/MCP,插上的模組是 Skill
第一層
你給它幾個字,它就猜下一個最可能的字,接上去,再猜下一個。如此而已。
接上去、再猜下一個 ── 一個字一個字,就這樣吐出一整句。
它不是魔法,是個會接龍的工具。看懂這件事,你就不會神化它,也不會怕它。
接龍拆解
第二層
它把你的文字切塊、轉成數字餵給 AI,AI 吐出數字後再轉回文字。那一塊一塊的單位,就叫 Token。
一句話被切開的樣子
翻譯官的工作
AI 看到的不是文字,是一串數字 ID。注意看:6 個字卻切成 7 塊,「帥」一個字就拆成 2 塊。所以 token 不一定等於字。
重要陷阱
火山矽肺症(世上最長的英文單字之一) 45 個字母 → 15 個 Token
每一個色塊就是一個 Token。45 個字母,只被切成 15 塊。
平均換算:1 個 Token ≈ 0.75 個英文字 ≈ 1.5~2 個中文字。API 按 Token 收費,叫 AI 讀一整份大手冊很貴。
第三層
大家以為跟它聊過、它就記住了。其實模型是無狀態(stateless):每一次請求都重置回同一個空白,把整段對話從頭重讀一次。
它像記得前文,是因為程式每次都把對話歷史重新餵進去。沒餵的,它一個字都不知道。
這整包每次重新攤開給它看的東西,就叫 Context(上下文)。像一張桌子,沒攤上去的,它看不到。
Context Window
桌子的大小上限叫 Context Window。主流模型現在約 100 萬 Token,差不多就是一整套哈利波特全集的份量。
桌子不是越滿越聰明。攤太多東西,AI 的注意力會被稀釋,開始跳步、忘記前面交代的規則。
Context 容量比例示意
記住這張桌子。等一下動手做 skill 的時候,你會看到一個聰明的設計,專門省這張桌子。
第四層
沒那麼玄。你在對話框裡打的那一句話,就是一個 Prompt。
一句問題或指令。例:「幫我寫一封感謝信,對象是客戶小明,語氣專業。」
把你的 Prompt 加上 Context 裡的所有資訊,一個字一個字猜出來。
一封感謝信。你的 Prompt 講得多清楚,輸出就多到位。
Prompt 是你唯一能控制的輸入。講得清楚,AI 就能做出你要的東西。
兩種 Prompt
你只打了一句「台北天氣如何?」。但 AI 真正收到的,前面還黏著一層你看不到的 System Prompt,那層才是規矩。同一句話,配不同的 System Prompt,回答天差地遠。
Prompt Engineering
「幫我寫文章」
「針對 30~40 歲媽媽族群,寫一篇 300 字的 IG 文案,推廣暑假親子課程,語氣溫暖帶行動呼籲。」
把這 5 件事先想清楚,AI 就不用猜 ↓
模型越來越聰明,你說得模糊它也能猜。但想清楚你要什麼,永遠比背技巧更重要。
等一下做 Skill,description 寫得好不好,就是這門功夫的應用。
先講痛點
問它「今天台北天氣怎樣」,它只會說「抱歉我查不到即時資訊」。它沒有手、沒有眼睛。
這不是 AI 不夠聰明,是它天生的設計限制。打破這道牆,才是下一頁要講的事。
Tool 的本質
給它工具,它也不自己動手。它只「說」我要用這個工具,真正去敲的是背後的平台。
Tool 就是 AI 伸出去的手。今天階梯 6 用 serper 查 Google、階梯 8 用瀏覽器抓競品,那些都是 Tool。
別怕這個詞
你不用進廚房,照菜單說「我要一號餐」,窗口就把餐遞出來。這就是 API。
敲窗口的背後
HTTP 是電腦之間的「對話規則」。你的程式跟網站要交換資料,就靠它一來一回 ── 像一個幫你跑腿的快遞員。
你打開瀏覽器輸入 google.com,背後就是瀏覽器發了一個 HTTP 請求、Google 回一個回應 ── 你每天都在做,只是沒看到。
你想做什麼
每個請求都要指定一個「方法」,告訴對方你要對資料做什麼。天天會碰到的就這四個。
小測驗:想查最新天氣,該用哪個? ── GET,因為你只是要「取得」資料。
一個請求長怎樣
把一個 HTTP 請求想成包裹上的快遞單,拆開就這三部分。
要寄去哪、附帶什麼條件。
? 後面就是參數,直接寫在網址上。
包裹上的備註標籤:
要傳過去的詳細資料。
簡單查詢,網址+參數就夠;要傳大量或機密資料,放進 Body。差別下一頁細說。
放網址上,還是放裡面
Google 搜「貓」→ …/search?q=貓
註冊新帳號,就是 POST 一包 Body
一句話分:查詢、簡單 → 用參數;大量、機密 → 用 Body。
對方怎麼回你
三位數字,一眼看出成功還是失敗、為什麼失敗。
查天氣網址拼錯 → 拿到 404。記個大方向:4 開頭通常是你寫錯,5 開頭是對方伺服器的問題。
API 無所不在
你沒寫一行程式,但每天已經在「用」一堆 API ── 只是沒看到那面窗口。
位置、付款、登入、驗證碼、推薦商品… 幾乎每一步,都是在跟別人的系統「叫 API」。
親手敲一個真 API
不用寫程式。在網址列貼這個,你就發出了一個真的 HTTP 請求。
你剛剛做的,就是 AI 在做的事:發一個請求、拿回一包 JSON、再用裡面的資料。差別只是它一秒能做幾百次。
連到今天
API Key 就是「點餐資格卡」。申請到卡,窗口才理你。這就是我們課堂上會帶你申請的原因。
你的 Skill 就是那台開進得來速的車。它知道對哪個窗口說什麼,把資料拿回來給大模型用。
看一個真的
這段「寫請求去敲窗口」的小腳本,AI 自己會寫 ── 階梯 1 你就會親手玩到,不用先會寫程式。
痛點
工具要能被 AI 使用,得先「接入」平台。問題來了:每個平台各有一套規範。
天氣查詢
Notion、Slack…
M 個 AI app 要接 N 個服務,就得寫 M × N 種接法。每加一個就乘上去。
3 × 3 = 9 條線,全要各寫一遍
同一個工具,接 ChatGPT 一套、接 Claude 又一套、接 Gemini 再一套。工程師寫到崩潰。這就是 MCP 出現之前的接入規範地獄。
MCP 是什麼
同一工具要寫三套規範。每增加一個 AI 平台,就多寫一遍。
只寫一次。所有支援 MCP 的 AI 平台,全部能用。
MCP 全名 Model Context Protocol(模型上下文協定)。名字很學術,你把它記成「工具接入的統一規範」就好。一條線取代三條線。
換個角度看 MCP
同樣是讓 AI 用工具,差別在「誰要先懂規格」。
想用它,你得先讀文件,把每個欄位照規格拼對:
少一個欄位、格式錯一點就失敗。AI 還得先「知道有它」才叫得動。你去配合工具。
MCP 主動把整盤工具端出來,每個都自帶用法:
AI 一連上就看到整份菜單,直接挑來用。工具主動報名。
差別就在誰要先懂規格:API 是你去配合它,MCP 是工具自己告訴 AI「我有哪些、怎麼用」。這就是大家覺得 MCP 方便的地方。
一個比喻
MCP 是一套插孔規範(protocol)。任何 AI client 用同一種講法,對接任何工具 server。
每邊只接 MCP 一次,不必兩兩相乘
MCP = 廚房,給你存取權,解決「連得上什麼」;Skill = 食譜,解決「連上之後怎麼把事做對」。
記成「工具接入的 Type-C」就好。能連到廚房不等於做得出好菜,菜好不好靠食譜。所以今天重點在教你寫 Skill。
第八層
把前面學的全裝在一起,再加上一句:自己規劃下一步。你只下一個目標,其餘它自己跑。
把前面學過的零件裝在一起,再加上「自己規劃下一步」,就是 Agent:
Agent = 把前面學的 LLM + Tool + Context 裝在一起,再加上「自己規劃下一步」。你今天用的 Claude Code,就是這種 Agent。
Agent 怎麼跑
不是一次做完。是規劃、執行、看結果、不夠好就修正再來一輪,直到達成。
關鍵在那個「看結果 → 修正」的迴圈。它做錯不會卡住,會自己發現、自己調整、再跑一輪 ── 這是 Agent 跟一次性回答最大的差別。
兩種用法對照
同一顆 LLM,差別在「誰負責規劃跟動手」。看左右就懂。
你問一句,它答一句
你給目標,它把成果帶回來
今天用的 Claude Code、codex 就是這種 Agent ── 你只下意圖,它自己規劃、執行、修正,把事跑完帶回來給你。
主角登場
Agent 很強,但它不知道你的私人規則。每次重打很煩。Skill 解這個問題。
每次都要重打規則:輸出格式、語氣、流程、限制條件。打完還要確認它有沒有漏讀。
規則提前寫進 Skill,以後只說一句「出門助手」,它就自動照你的規矩辦,不用每次重講。
超能力光碟。 平常收著不佔位置,要用才插上去。一份 Markdown 檔,就是你給 Agent 的完整說明書。
接下來做什麼
接下來十個階梯,你會把最煩的 SEO 工序,一個一個變成一句話就跑完的 Skill。
↑ 你今天學的九個概念,全疊在這座塔上 ── Skill 就站在最頂端。
把最煩的 SEO 工序一個一個變成 Skill,最後做出一個用你自己風格寫作的 Skill。我們開始。
九層收斂
你不用懂怎麼造腦造手。你只要學會寫最頂層那份說明書。 我們開始。