AI token 是什麼?計費原理、中文貴多少、成本怎麼估一次搞懂

發佈 2026-09-07 · 更新 2026-09-08 · 閱讀約 6 分鐘 · AI 工作術(法芮可有限公司)

AI token 是什麼?一篇講清楚 token 計費原理:輸入、輸出、快取三種價格差在哪、同樣一句話中文為什麼比英文多花 20%~50% 的 token、以及三步估算 API 月成本的公式與範例,附上我們營運 AI 工具站實際省 token 的做法。

Token 是 AI 模型處理文字的最小單位,也是你付錢的單位。它不是「一個字」也不是「一個詞」,而是模型把文字切成的小片段:英文常常一個單字就是一個 token,長一點的字會被切成兩三段;中文則多半一個字就要吃掉一到兩個 token。不管你用 ChatGPT、Claude 還是 Gemini,你送進去的每一段文字、模型吐出來的每一段回答,全部先換算成 token 再計價。

對訂閱制的使用者(每月付固定費用用網頁版)來說,token 影響的是「一次能塞多少內容」和「用量額度多快用完」;對用 API 串進自己產品的開發者或創業者來說,token 就是直接的帳單。同一段意思,用中文寫通常比英文多花 20%~50% 的 token,舊一代模型甚至會到 2 倍以上,這是台灣團隊做 AI 產品時很容易忽略的成本。

這篇文章我們用自己營運 AI 工具站和 AI 剪片引擎的實際經驗,講清楚三件事:token 怎麼算、中文為什麼比較貴、以及怎麼在動手之前就把每個月的成本估出來。

Token 到底是什麼?不是字,也不是詞

語言模型看不懂文字,它只認數字。所以每家模型在訓練前都會先建一套「斷詞表」(tokenizer),把常見的字串編號。模型收到你的訊息時,第一步就是照這張表把文字切成一串編號,這一個個編號就是 token。

切法有幾個你會直接感受到的特性:

  • 常見英文單字通常是 1 個 token,例如 the、apple、marketing。少見或很長的字會被拆成好幾段,像 unbelievable 可能切成 un + believ + able。
  • 空格和標點也算。英文單字前面的空格通常會跟單字黏成同一個 token,但換行、括號、表情符號都要另外算。
  • 數字很吃 token。一串 10 位數字可能被切成 3~4 個 token,所以丟一大張 Excel 數據進去會比你想的貴。
  • 程式碼比自然語言貴,因為縮排、符號、變數名稱都被切得很碎。

一個好記的粗略換算:英文 1,000 個 token 大約等於 750 個單字,或 3~4 頁 A4 的內容;中文 1,000 個 token 大約只能裝 500~800 個字,視模型而定。想知道精確數字,各家官方都有免費的 tokenizer 試算頁面或 API 可以直接算,不用自己猜。

Token 怎麼計費?輸入、輸出、快取三種價格

Token 三種價格一次看懂:輸入 token:系統提示與對話歷史每次都重算、輸出 token:通常是輸入價的 3~5 倍、快取輸入:命中時可省 50%~90%、思考模式的推理過程也以輸出價計費
Token 三種價格一次看懂

API 的價目表幾乎都寫成「每百萬 token 多少美元」,而且會分成兩個到三個價格。看懂這三個數字,你就看懂了 90% 的 AI 成本結構。

類型指的是什麼價格特性
輸入 token(input)你送進去的所有內容:系統提示、對話歷史、附加文件、使用者問題基準價,量通常最大
輸出 token(output)模型回答的內容通常是輸入價的 3~5 倍,越強的模型倍數越高
快取輸入(cached input)重複送進去、被模型端記住的前綴內容多數平台比一般輸入便宜 50%~90%,以官方價格頁為準

三個常被踩到的地雷:

  1. 對話歷史每一輪都重算。模型沒有記憶,你每送一句新訊息,程式其實是把前面整段對話重新丟進去。聊到第 20 輪時,一句「好,謝謝」可能要付前面 19 輪累積的幾千個輸入 token。
  2. 系統提示每次都算。你寫了 2,000 字的角色設定和規則,那每一次呼叫都在付這 2,000 字的錢。這就是為什麼「提示快取」對產品端這麼重要。
  3. 思考模式的 token 也要付。啟用推理或延伸思考功能時,模型在給答案前產生的思考過程通常會以輸出價計費,帳單可能是你預期的 2~10 倍。

訂閱制的網頁版(ChatGPT Plus、Claude Pro 之類)不會直接跟你收 token 費,但 token 決定了兩件事:一是上下文視窗上限,也就是一次對話最多能裝多少內容;二是用量額度,通常以「幾小時內能送幾則訊息」呈現,訊息越長、附件越多,額度消耗越快。想了解各家方案的差異,可以看我們的 ChatGPT vs Claude vs Gemini 比較

中文比英文貴多少?原因與實際差距

中文比英文貴多少?:新一代模型:同樣意思多花 10%~50% token、舊一代模型:差距可到 50%~150%、繁體通常比簡體再貴一點、中文 AI 產品預算建議多抓兩到三成
中文比英文貴多少?

斷詞表是用訓練資料統計出來的,英文資料佔比最大,所以英文常用字幾乎都有自己的專屬 token。中文每個字都是獨立的 Unicode 字元,在舊一代 tokenizer 裡一個中文字常被切成 2~3 個 token,近兩年主流模型改良後,大多落在 1~1.5 個 token 一個字。

但「每個字幾個 token」還不是全部。真正的比較要看表達同樣意思要用幾個 token。中文本來就比英文精簡,同一句話中文字數大約只有英文字母數的三分之一,兩邊抵銷之後,依我們實際測試各家模型的經驗,大致是這樣:

比較項目英文繁體中文
一段約 300 字的產品說明約 400~450 token約 450~650 token
同一意思的 token 差距(新一代模型)基準多 10%~50%
同一意思的 token 差距(舊一代模型)基準多 50%~150%
繁體 vs 簡體繁體通常再貴一點,因為訓練資料中簡體較多,部分繁體字被切得較碎

實際數字因模型而異,請以各家 tokenizer 工具算出來的結果為準,但方向很一致:中文內容做 AI 產品,預算要比看英文教學抓的數字多加兩到三成。我們自己做 AI 自動剪片 時就有很直接的體會:一支 10 分鐘的繁中口播影片,逐字稿大約 2,500~3,000 字,送進模型判斷段落和精華片段時,光輸入就要 4,000~6,000 token,再加上系統提示和輸出的時間軸標記,單支影片就是上萬 token 的量,乘上每天幾百支就必須認真省。

三步估算你的 AI 成本(附公式與範例)

三步估算 AI 月成本:用真實中文範例算出單次輸入與輸出 token、乘上每月呼叫次數,多輪對話記得算歷史、月成本 =(輸入量×輸入價+輸出量×輸出價)÷ 100 萬、模型等級與系統提示長度影響最大
三步估算 AI 月成本

不要等帳單來了才嚇到。在寫第一行程式之前,用這三步就能估出每個月大概要花多少。

  1. 算出單次呼叫的 token 量。把你的系統提示、一次典型的使用者輸入、預期回答的長度,分別丟進官方 tokenizer 試算。中文內容記得用真實的中文範例去算,不要用英文估。
  2. 乘上每月呼叫次數。每個使用者平均一天用幾次、有多少活躍使用者、對話平均幾輪。多輪對話要記得歷史會累加,粗略可用「平均輪數的一半 × 單輪輸入」來估累積的歷史量。
  3. 套價目表。公式:
    月成本 = (輸入 token 總量 × 輸入單價 + 輸出 token 總量 × 輸出單價) ÷ 1,000,000,價格用該模型官方頁上的美元數字。

用一個常見情境示範,假設你要做一個繁中客服機器人:

項目假設值
系統提示 + 知識片段(輸入)1,200 token / 次
使用者問題 + 歷史(輸入)300 token / 次
模型回答(輸出)300 token / 次
每月呼叫次數10,000 次
每月輸入總量1,500 × 10,000 = 1,500 萬 token
每月輸出總量300 × 10,000 = 300 萬 token

接著代入價格。若選中階模型,輸入每百萬 token 約 1~3 美元、輸出約 5~15 美元(實際以官方價格頁為準),月成本大概落在 30~90 美元;換成旗艦模型可能是這個數字的 3~5 倍;換成入門小模型則可能不到 10 美元。先用這個框架跑一次,你會發現「選哪個等級的模型」和「系統提示多長」對帳單的影響,遠大於使用者問了什麼。另外要注意,多數平台是預付或月結美金,匯率和國際交易手續費也要算進去。

我們自己省 token 的 6 個做法

以下是我們營運工具站和剪片引擎後,真的有把帳單壓下來的做法,依效果排序:

  1. 開啟提示快取。把系統提示、範例、固定的知識內容放在訊息最前面且保持完全一致,平台就能命中快取。對系統提示很長的產品,這一招常常直接省掉一半以上的輸入費用。
  2. 依任務難度分模型。分類、抽關鍵字、判斷語氣這種簡單任務用小模型,真正需要推理或寫長文的才用旗艦模型。我們的剪片引擎裡,「這段是不是廣告」用小模型,「幫這支影片選出 3 個最有梗的片段」才用大模型。
  3. 系統提示用英文寫,只要求輸出繁中。同樣的規則英文寫起來 token 少 20%~40%,模型理解力也沒有差。使用者看到的仍然是繁體中文回答。
  4. 限制輸出長度。設定 max_tokens 上限,並在提示裡明確要求「3 句以內」「只回傳 JSON」。輸出是最貴的 token,不要讓模型自由發揮。
  5. 對話歷史做摘要或截斷。超過一定輪數就把前面內容濃縮成一段摘要,或只保留最近幾輪。這能把長對話的成本從線性膨脹壓回接近固定值。
  6. 不要丟整份文件。先用搜尋或向量比對找出相關段落,只把那幾段送進模型,而不是整份 PDF 全塞。這也順便提高回答準確度。

如果你目前還只是網頁版使用者,這些觀念一樣有用:一則訊息塞太多不相關內容,不只吃額度,也會讓回答品質變差。可以先從 Claude 教學ChatGPT 教學 裡的提示寫法開始練,把每一次對話寫得精準,就是最基本的省 token。

常見問題

Q:一個中文字等於幾個 token?
沒有固定答案,要看模型的斷詞表。近兩年的主流模型大多是一個中文字 1~1.5 個 token,舊一代模型則常見 2~3 個。最準確的做法是把你的實際內容丟進該模型官方提供的 tokenizer 工具算一次。

Q:我只用 ChatGPT 或 Claude 網頁版,需要在意 token 嗎?
不會直接跟你收費,但 token 決定一次對話能裝多少內容,以及用量額度消耗的速度。訊息越長、附件越多、對話越久,額度用得越快,回答品質也容易下降。學會精簡提示對訂閱使用者一樣划算。

Q:為什麼輸出 token 比輸入貴這麼多?
因為輸入可以一次平行處理,輸出卻要一個 token 一個 token 依序生成,每生成一個都要把整段上下文再算一遍,消耗的運算資源高很多。所以控制回答長度是最直接的省錢方式。

Q:提示快取真的能省很多嗎?
對系統提示長、呼叫頻繁的產品效果非常明顯,多數平台快取命中的輸入價格比一般輸入便宜 50%~90%。但前提是快取的內容必須放在訊息最前面且每次完全相同,只要改一個字就會失效。細節請以各平台官方文件為準。

Q:估算成本時最容易漏掉什麼?
三個最常漏的:多輪對話會把歷史重複計入輸入、思考模式產生的推理 token 以輸出價計費、以及用英文範例估中文產品導致低估兩到三成。建議用真實的中文範例先跑一次 tokenizer,再乘上實際的呼叫量。

← AI 知識庫 · AI 工具庫