AI token 是什麼?計費原理、中文貴多少、成本怎麼估一次搞懂
發佈 2026-09-07 · 更新 2026-09-08 · 閱讀約 6 分鐘 · AI 工作術(法芮可有限公司)
AI token 是什麼?一篇講清楚 token 計費原理:輸入、輸出、快取三種價格差在哪、同樣一句話中文為什麼比英文多花 20%~50% 的 token、以及三步估算 API 月成本的公式與範例,附上我們營運 AI 工具站實際省 token 的做法。
Token 是 AI 模型處理文字的最小單位,也是你付錢的單位。它不是「一個字」也不是「一個詞」,而是模型把文字切成的小片段:英文常常一個單字就是一個 token,長一點的字會被切成兩三段;中文則多半一個字就要吃掉一到兩個 token。不管你用 ChatGPT、Claude 還是 Gemini,你送進去的每一段文字、模型吐出來的每一段回答,全部先換算成 token 再計價。
對訂閱制的使用者(每月付固定費用用網頁版)來說,token 影響的是「一次能塞多少內容」和「用量額度多快用完」;對用 API 串進自己產品的開發者或創業者來說,token 就是直接的帳單。同一段意思,用中文寫通常比英文多花 20%~50% 的 token,舊一代模型甚至會到 2 倍以上,這是台灣團隊做 AI 產品時很容易忽略的成本。
這篇文章我們用自己營運 AI 工具站和 AI 剪片引擎的實際經驗,講清楚三件事:token 怎麼算、中文為什麼比較貴、以及怎麼在動手之前就把每個月的成本估出來。
Token 到底是什麼?不是字,也不是詞
語言模型看不懂文字,它只認數字。所以每家模型在訓練前都會先建一套「斷詞表」(tokenizer),把常見的字串編號。模型收到你的訊息時,第一步就是照這張表把文字切成一串編號,這一個個編號就是 token。
切法有幾個你會直接感受到的特性:
- 常見英文單字通常是 1 個 token,例如 the、apple、marketing。少見或很長的字會被拆成好幾段,像 unbelievable 可能切成 un + believ + able。
- 空格和標點也算。英文單字前面的空格通常會跟單字黏成同一個 token,但換行、括號、表情符號都要另外算。
- 數字很吃 token。一串 10 位數字可能被切成 3~4 個 token,所以丟一大張 Excel 數據進去會比你想的貴。
- 程式碼比自然語言貴,因為縮排、符號、變數名稱都被切得很碎。
一個好記的粗略換算:英文 1,000 個 token 大約等於 750 個單字,或 3~4 頁 A4 的內容;中文 1,000 個 token 大約只能裝 500~800 個字,視模型而定。想知道精確數字,各家官方都有免費的 tokenizer 試算頁面或 API 可以直接算,不用自己猜。
Token 怎麼計費?輸入、輸出、快取三種價格

API 的價目表幾乎都寫成「每百萬 token 多少美元」,而且會分成兩個到三個價格。看懂這三個數字,你就看懂了 90% 的 AI 成本結構。
| 類型 | 指的是什麼 | 價格特性 |
|---|---|---|
| 輸入 token(input) | 你送進去的所有內容:系統提示、對話歷史、附加文件、使用者問題 | 基準價,量通常最大 |
| 輸出 token(output) | 模型回答的內容 | 通常是輸入價的 3~5 倍,越強的模型倍數越高 |
| 快取輸入(cached input) | 重複送進去、被模型端記住的前綴內容 | 多數平台比一般輸入便宜 50%~90%,以官方價格頁為準 |
三個常被踩到的地雷:
- 對話歷史每一輪都重算。模型沒有記憶,你每送一句新訊息,程式其實是把前面整段對話重新丟進去。聊到第 20 輪時,一句「好,謝謝」可能要付前面 19 輪累積的幾千個輸入 token。
- 系統提示每次都算。你寫了 2,000 字的角色設定和規則,那每一次呼叫都在付這 2,000 字的錢。這就是為什麼「提示快取」對產品端這麼重要。
- 思考模式的 token 也要付。啟用推理或延伸思考功能時,模型在給答案前產生的思考過程通常會以輸出價計費,帳單可能是你預期的 2~10 倍。
訂閱制的網頁版(ChatGPT Plus、Claude Pro 之類)不會直接跟你收 token 費,但 token 決定了兩件事:一是上下文視窗上限,也就是一次對話最多能裝多少內容;二是用量額度,通常以「幾小時內能送幾則訊息」呈現,訊息越長、附件越多,額度消耗越快。想了解各家方案的差異,可以看我們的 ChatGPT vs Claude vs Gemini 比較。
中文比英文貴多少?原因與實際差距

斷詞表是用訓練資料統計出來的,英文資料佔比最大,所以英文常用字幾乎都有自己的專屬 token。中文每個字都是獨立的 Unicode 字元,在舊一代 tokenizer 裡一個中文字常被切成 2~3 個 token,近兩年主流模型改良後,大多落在 1~1.5 個 token 一個字。
但「每個字幾個 token」還不是全部。真正的比較要看表達同樣意思要用幾個 token。中文本來就比英文精簡,同一句話中文字數大約只有英文字母數的三分之一,兩邊抵銷之後,依我們實際測試各家模型的經驗,大致是這樣:
| 比較項目 | 英文 | 繁體中文 |
|---|---|---|
| 一段約 300 字的產品說明 | 約 400~450 token | 約 450~650 token |
| 同一意思的 token 差距(新一代模型) | 基準 | 多 10%~50% |
| 同一意思的 token 差距(舊一代模型) | 基準 | 多 50%~150% |
| 繁體 vs 簡體 | 繁體通常再貴一點,因為訓練資料中簡體較多,部分繁體字被切得較碎 | |
實際數字因模型而異,請以各家 tokenizer 工具算出來的結果為準,但方向很一致:中文內容做 AI 產品,預算要比看英文教學抓的數字多加兩到三成。我們自己做 AI 自動剪片 時就有很直接的體會:一支 10 分鐘的繁中口播影片,逐字稿大約 2,500~3,000 字,送進模型判斷段落和精華片段時,光輸入就要 4,000~6,000 token,再加上系統提示和輸出的時間軸標記,單支影片就是上萬 token 的量,乘上每天幾百支就必須認真省。
三步估算你的 AI 成本(附公式與範例)

不要等帳單來了才嚇到。在寫第一行程式之前,用這三步就能估出每個月大概要花多少。
- 算出單次呼叫的 token 量。把你的系統提示、一次典型的使用者輸入、預期回答的長度,分別丟進官方 tokenizer 試算。中文內容記得用真實的中文範例去算,不要用英文估。
- 乘上每月呼叫次數。每個使用者平均一天用幾次、有多少活躍使用者、對話平均幾輪。多輪對話要記得歷史會累加,粗略可用「平均輪數的一半 × 單輪輸入」來估累積的歷史量。
- 套價目表。公式:
月成本 = (輸入 token 總量 × 輸入單價 + 輸出 token 總量 × 輸出單價) ÷ 1,000,000,價格用該模型官方頁上的美元數字。
用一個常見情境示範,假設你要做一個繁中客服機器人:
| 項目 | 假設值 |
|---|---|
| 系統提示 + 知識片段(輸入) | 1,200 token / 次 |
| 使用者問題 + 歷史(輸入) | 300 token / 次 |
| 模型回答(輸出) | 300 token / 次 |
| 每月呼叫次數 | 10,000 次 |
| 每月輸入總量 | 1,500 × 10,000 = 1,500 萬 token |
| 每月輸出總量 | 300 × 10,000 = 300 萬 token |
接著代入價格。若選中階模型,輸入每百萬 token 約 1~3 美元、輸出約 5~15 美元(實際以官方價格頁為準),月成本大概落在 30~90 美元;換成旗艦模型可能是這個數字的 3~5 倍;換成入門小模型則可能不到 10 美元。先用這個框架跑一次,你會發現「選哪個等級的模型」和「系統提示多長」對帳單的影響,遠大於使用者問了什麼。另外要注意,多數平台是預付或月結美金,匯率和國際交易手續費也要算進去。
我們自己省 token 的 6 個做法
以下是我們營運工具站和剪片引擎後,真的有把帳單壓下來的做法,依效果排序:
- 開啟提示快取。把系統提示、範例、固定的知識內容放在訊息最前面且保持完全一致,平台就能命中快取。對系統提示很長的產品,這一招常常直接省掉一半以上的輸入費用。
- 依任務難度分模型。分類、抽關鍵字、判斷語氣這種簡單任務用小模型,真正需要推理或寫長文的才用旗艦模型。我們的剪片引擎裡,「這段是不是廣告」用小模型,「幫這支影片選出 3 個最有梗的片段」才用大模型。
- 系統提示用英文寫,只要求輸出繁中。同樣的規則英文寫起來 token 少 20%~40%,模型理解力也沒有差。使用者看到的仍然是繁體中文回答。
- 限制輸出長度。設定 max_tokens 上限,並在提示裡明確要求「3 句以內」「只回傳 JSON」。輸出是最貴的 token,不要讓模型自由發揮。
- 對話歷史做摘要或截斷。超過一定輪數就把前面內容濃縮成一段摘要,或只保留最近幾輪。這能把長對話的成本從線性膨脹壓回接近固定值。
- 不要丟整份文件。先用搜尋或向量比對找出相關段落,只把那幾段送進模型,而不是整份 PDF 全塞。這也順便提高回答準確度。
如果你目前還只是網頁版使用者,這些觀念一樣有用:一則訊息塞太多不相關內容,不只吃額度,也會讓回答品質變差。可以先從 Claude 教學 或 ChatGPT 教學 裡的提示寫法開始練,把每一次對話寫得精準,就是最基本的省 token。
常見問題
Q:一個中文字等於幾個 token?
沒有固定答案,要看模型的斷詞表。近兩年的主流模型大多是一個中文字 1~1.5 個 token,舊一代模型則常見 2~3 個。最準確的做法是把你的實際內容丟進該模型官方提供的 tokenizer 工具算一次。
Q:我只用 ChatGPT 或 Claude 網頁版,需要在意 token 嗎?
不會直接跟你收費,但 token 決定一次對話能裝多少內容,以及用量額度消耗的速度。訊息越長、附件越多、對話越久,額度用得越快,回答品質也容易下降。學會精簡提示對訂閱使用者一樣划算。
Q:為什麼輸出 token 比輸入貴這麼多?
因為輸入可以一次平行處理,輸出卻要一個 token 一個 token 依序生成,每生成一個都要把整段上下文再算一遍,消耗的運算資源高很多。所以控制回答長度是最直接的省錢方式。
Q:提示快取真的能省很多嗎?
對系統提示長、呼叫頻繁的產品效果非常明顯,多數平台快取命中的輸入價格比一般輸入便宜 50%~90%。但前提是快取的內容必須放在訊息最前面且每次完全相同,只要改一個字就會失效。細節請以各平台官方文件為準。
Q:估算成本時最容易漏掉什麼?
三個最常漏的:多輪對話會把歷史重複計入輸入、思考模式產生的推理 token 以輸出價計費、以及用英文範例估中文產品導致低估兩到三成。建議用真實的中文範例先跑一次 tokenizer,再乘上實際的呼叫量。