
之前在做 AI 應用調研時我注意到一個很有意思的現象明明英偉達擁有全球最核心的 GPU 產能幾乎壟斷了高端 AI 芯片市場但普通開發者使用大模型時都是向 OpenAI、Anthropic、智譜、DeepSeek 這些模型廠商付費按 token 計費。英偉達為什么不親自下場賣 token如果它既賣算力芯片又直接面向開發者售賣模型 token理論上不是可以賺到更多利潤嗎這個問題看似簡單背后卻牽扯到商業模式邊界、產業鏈分工、生態位保護等關鍵邏輯。這篇文章我會從 token 計費模型、英偉達的商業定位、GPU 與模型服務的成本結構幾個角度把這件事講清楚。同時也會站在開發者視角聊聊我們日常接觸 token 時需要注意的技術細節和常見坑點。1. token 到底是什么為什么 AI 廠商愛按 token 收費1.1 從“漢字拆字”理解 token在深入討論英偉達之前先把 token 這個概念聊透。大模型本身并不直接理解文字、單詞或句子它處理的是數值。為了讓模型能理解文本我們需要把文本切分成一個個小的單元再映射成數字向量。這個小的單元就是 token。舉個例子你好世界如果按常見的大模型分詞方式這句話可能被切成若干個 token比如“你好”“” “世界”“”或者更細粒度的字節級片段。不同模型使用的 tokenizer分詞器不一樣切分方式也不同。有的模型一個漢字可能對應 1 個 token有的可能對應 2 個 token。英文單詞通常 1 個單詞可能是 1 或 2 個 token也可能被拆成多個子詞。那為什么 AI 廠商喜歡按 token 收費根本原因在于token 數量直接決定了模型的計算量。輸入 prompt 越長模型需要處理的前綴計算越多。輸出內容越長模型需要自回歸生成一步、一步地推出更多 token。上下文越長KV Cache 占用的顯存也越多。所以 token 數量是最貼近真實資源消耗的計費維度。按 token 計費本質上是一種“資源用量計費模式”類似云計算的按量付費。1.2 一套典型的 token 計費結構大多數大模型 API 的計費包含兩部分輸入 token 和輸出 token。通常輸出的單價會高于輸入單價因為生成階段是逐步推理的計算成本更高。{ model: example-chat-model, prompt_tokens: 120, completion_tokens: 80, total_tokens: 200 }這就是一個常見的 API 響應片段。調用大模型接口時服務商通常會在響應里返回 usage 信息里面包含 prompt_tokens、completion_tokens、total_tokens方便開發者統計每次調用的消耗。1.3 開發者如何預估 token 消耗實際開發中我們經常需要估算一段文本大概占多少 token。這里有兩種常用方式。第一種是使用模型廠商官方的 tokenizer 工具比如 OpenAI 開源了 tiktoken可以直接在 Python 中計算 token 數量import tiktoken encoding tiktoken.get_encoding(cl100k_base) text Hello, world! 你好世界 tokens encoding.encode(text) print(token 數量, len(tokens)) print(token 列表, tokens)運行這段代碼會打印出文本切分后的 token 列表和數量。對開發者來說在構造 prompt 之前先估算 token能有效控制成本避免出現請求量過大導致賬單飆升的情況。第二種是使用模型服務商控制臺自帶的 Tokenizer 工具。大多數平臺都提供了可視化調試頁面你可以直接輸入文本系統會展示 token 切分效果。很多開發者誤以為“1 個漢字 1 個 token”這個說法在部分中文大模型中成立但換成英文模型或不同分詞策略時結論就變了。在做成本預估時最好用官方 tokenizer 跑一遍不要憑經驗猜測。2. 英偉達的業務圖譜芯片之外它到底靠什么賺錢2.1 英偉達的主營業務構成一說起英偉達很多人第一反應是“賣顯卡的”。這沒錯但它的業務早就不是單純賣 GPU 這么簡單。從業務板塊來看英偉達的收入主要來自以下幾塊業務板塊核心產品目標客戶數據中心計算A100、H100、H200、B200 等 GPU以及 DGX 服務器云廠商、大型互聯網公司、科研機構專業視覺與工作站RTX 專業顯卡、Omniverse 平臺設計、影視、仿真行業汽車業務NVIDIA DRIVE 平臺整車廠、自動駕駛公司消費級游戲顯卡GeForce RTX 系列玩家、創作者而 AI 時代最受關注的是數據中心計算業務它是英偉達市值飆升的核心引擎。2.2 英偉達已經做算力服務了很多人可能不知道英偉達不只是賣物理芯片它也有了自己的云服務產品。比如 NVIDIA DGX Cloud它提供的是“GPU 算力即服務”企業可以不自己買顯卡而是按周期租用英偉達的 GPU 算力在上面跑模型訓練和推理任務。再比如 NVIDIA AI Enterprise這是一套企業級 AI 軟件平臺包含 CUDA、cuDNN、Triton Inference Server、NIM 微服務等組件幫助企業快速部署和管理 AI 工作負載。你會發現一個規律英偉達在做的是“賣算力基礎設施”而不是“賣模型推理結果”。2.3 英偉達自己有哪些大模型這里要區分一下。英偉達其實也發布了若干模型比如 Nemotron 系列包括用于智能體場景的 Llama-Nemotron 模型也有用于代碼生成的模型。但英偉達發布這些模型更多是為了展示 GPU 能力、完善生態工具鏈而不是為了成為一家“通用大模型 API 服務商”。它并不想靠“輸出 token”來賺錢它想讓你相信“用英偉達的 GPU 來跑 token 生成才是最省錢的”。3. 核心問題英偉達為什么不親自售賣 token3.1 商業模式定位的沖突要理解這個問題我們需要先梳理 AI 產業鏈的上中下游。上游是算力硬件包括 GPU、CPU、網絡設備、存儲設備。英偉達是這一層的絕對霸主。中游是模型與平臺包括基礎大模型、模型微調平臺、推理服務、云服務。OpenAI、Google、Anthropic、智譜、DeepSeek 等廠商在這一層競爭。下游是應用與終端包括各類 AI 應用、智能體、辦公軟件、垂直行業解決方案。如果英偉達親自下場售賣 token會發生什么它就不再是“中立的上游供應商”而是直接變成了中游模型服務商的競爭對手。那些大模型廠商今天還在瘋狂采購 H100、B200轉頭發現英偉達自己也推出了一個大模型 API并且按 token 收費。你覺得它們還會繼續把英偉達當作最親密的合作伙伴嗎這不是猜測而是商業利益層面的必然沖突。3.2 賣鏟子比淘金更穩定在淘金熱里最賺錢的不一定是挖到黃金的人而是賣鏟子的人。這個比喻雖然老了點但在 AI 時代依然成立。英偉達現在的核心策略就是“賣鏟子”。GPU 是訓練和運行大模型的必需品只要全球 AI 訓練和推理需求在增長英偉達就可以源源不斷地賣出高毛利芯片。相比之下賣 token 是一門需要長期運營、不斷優化模型、持續投入研究和迭代的生意。模型效果不好用戶會立刻流失競爭對手推出更便宜的模型定價權也會被削弱。更重要的一點是token 服務的利潤率不一定比賣 GPU 更高。從公開財報可以窺見英偉達數據中心的毛利率極高。而大模型 API 服務商的利潤空間反而受制于推理成本和激烈的價格戰。過去一年國內外大模型 API 的價格一路走低很多廠商都在通過降價換市場。這種背景下英偉達不可能放棄高毛利的硬件核心業務轉頭扎進低價競爭的 token 市場。3.3 英偉達不賣 token那云廠商為什么不自己做芯片這個問題經常被拿來對比。實際上云廠商確實在嘗試自研芯片。Google 有 TPU亞馬遜有 Trainium 和 Inferentia微軟也在推進自研 AI 芯片。但它們的邏輯和英偉達不一樣云廠商本來就提供 token 服務自研芯片是為了降低采購成本和供應鏈風險同時提升云產品的利潤空間。也就是說云廠商是“模型服務商 芯片自研者”的雙重身份。而英偉達不具備模型服務商的身份也不需要冒險去摧毀自己的核心護城河。3.4 直接賣 token 會帶來哪些技術挑戰除了商業層面的沖突直接售賣 token 對英偉達來說也意味著進入一個完全不同的技術領域。賣 GPU 的核心是硬件工程、驅動開發、互連通信、散熱設計。而賣 token 的核心是大模型訓練、RLHF、推理優化、并發調度、內容安全、用戶增長、API 網關、計費系統。這兩套技術棧雖然有關聯但能力要求差異巨大。一個典型的 token 服務需要具備以下能力高并發推理引擎能在毫秒級響應大量用戶請求。彈性伸縮策略應對潮汐式的調用流量。多用戶隔離和配額管理確保單個用戶不會耗盡整體資源。內容安全和合規審核避免模型生成違規內容。完善的開發者平臺包括文檔、SDK 和調試工具。這些能力不是英偉達的強項如果硬要做需要投入巨大的人力物力而且成功的概率并不高。4. 如果英偉達真的賣 token會怎樣我們可以做一個思想實驗假設英偉達發布了一個“NVIDIA Token”服務會帶來哪些連鎖反應4.1 現有客戶關系的瓦解英偉達的最大客戶是誰是 OpenAI、微軟、Google、亞馬遜、Meta以及無數 AI 創業公司。這些客戶對英偉達又愛又怕。愛的是它的 GPU 性能確實無可替代怕的是供應緊張、價格上漲。如果英偉達自己也做模型 API這些客戶會立刻調整采購策略扶持 AMD、自研芯片或者其他算力渠道降低對英偉達的依賴。這條路風險極大得不償失。4.2 生態內外的雙重競爭在生態內部英偉達和云廠商之間有緊密合作。很多云廠商的實例就是搭載 NVIDIA GPU 的。在生態外部英偉達又在跟云廠商的“自研芯片方案”競爭。如果英偉達進入 token 市場合作關系會被進一步擠壓。云廠商會擔心自己用了英偉達的 GPU 來跑模型服務結果英偉達轉頭用自己的 GPU 資源做 token 服務既當供應商又當競爭對手。這樣的局面會讓“GPU 銷售 云合作”這條路越來越難走。4.3 利潤率可能反而下降賣硬件是相對直接的商業模型研發、生產、銷售、交付然后產生利潤。賣 token 則是高成本運營模型模型訓練要燒錢工程師團隊要燒錢客服支持要燒錢內容安全要燒錢。國內外的模型 API 又在瘋狂打價格戰token 單價一直在往下走。如果英偉達把資源從 GPU 研發轉向 token 運營反而可能導致整體利潤率下滑。5. 那英偉達在 AI 時代到底在賣什么5.1 賣 CUDA 生態英偉達最強的護城河之一是 CUDA 軟件生態。全球有數百萬開發者習慣用 CUDA 進行 GPU 編程。無論是 PyTorch、TensorFlow 還是 JAX底層調用的都可能是 CUDA 庫。這種軟件生態的粘性極強。如果你用了 CUDA 生態即使某天競爭對手的芯片性能追上來遷移成本依然很高。所以英偉達很舍得在軟件生態上投入比如開源大量庫、提供開發者培訓、舉辦 GTC 大會。5.2 賣一站式 AI 基礎設施英偉達現在更愿意做的是“AI 工廠”的解決方案商。從芯片到服務器從網絡到存儲從集群管理到推理框架英偉達希望提供一個完整的 AI 基礎設施方案。企業只需要購買這個方案就可以快速搭建自己的 AI 平臺而不需要自己處理底層軟硬件的復雜適配。這種模式的核心訴求是讓英偉達成為 AI 時代最底層的“基礎設施供應商”。它不需要依賴某一個具體的模型產品賺錢因為無論哪家模型公司贏英偉達都能通過底層硬件獲利。5.3 英偉達的“免費 token”是什么這里要提一個容易混淆的概念。有些開發者會搜索“英偉達免費 token”其實這不是英偉達在售賣 API token而是英偉達在 NVIDIA NIM、NVIDIA Developer Program 等平臺上提供的免費試用額度或演示資源。比如英偉達的 NIM 微服務提供了推理服務的容器化部署方案開發者在一些免費資源配額內可以快速體驗模型推理能力。這種“免費試用”和直接售賣 token 是兩碼事。它更像是一種生態培育手段讓開發者先體驗英偉達的推理軟件平臺熟悉之后再到云環境或企業環境購買完整解決方案。6. 開發者視角理解 token 計費避免踩坑雖然不是所有人都會去搭建一套大模型 API 服務但作為開發者理解 token 計費對日常開發非常有幫助。我結合常見的報錯場景整理了下面這些高頻問題。6.1 token 用量如何計算計算 token 用得最多的地方是成本預估。以大模型 API 調用為例影響 token 用量的變量主要有幾個系統提示詞system prompt的長度上下文的長度用戶輸入的長度模型輸出內容的長度如果你的應用需要頻繁調用大模型最好在服務端記錄每次調用的 usage 信息按用戶或按任務維度統計 token 消耗。下面是統計 token 用量的一個簡單思路def log_token_usage(user_id, task_id, usage): total_tokens usage.get(total_tokens, 0) prompt_tokens usage.get(prompt_tokens, 0) completion_tokens usage.get(completion_tokens, 0) print( f用戶 {user_id} 任務 {task_id} f消耗 token {total_tokens} f(輸入 {prompt_tokens} / 輸出 {completion_tokens}) )在實際項目中可以將這些數據寫入日志或數據庫用于后續的成本分析和配額控制。6.2 token 失效是什么意思開發中經常聽到“token 失效”的說法。這里要區分兩種情況。一種是 API Key 過期。很多模型平臺頒發的 API Key 有有效期到期后請求會返回 401 Unauthorized提示 invalid token 或 authentication failed。另一種是會話 token 失效比如在單點登錄系統里JWT 過期導致登錄態失效需要重新登錄。這兩種場景其實都和“大模型 token 計費”無關。前者屬于密鑰管理后者屬于用戶認證體系。6.3 cookie、session 與 token 的區別有一些初學者會混淆 cookie、session 和 token。簡要說一下cookie 是存儲在瀏覽器端的少量數據每次請求自動攜帶。session 是存儲在服務端的會話數據通過 session id 關聯用戶狀態。token 是一種憑證通常由服務端簽發客戶端保存后隨請求發送服務端校驗其有效性。在 AI 應用里token 往往用于兩層含義一是大模型的文本切分單元二是認證憑證。遇到“token 過期”這類問題要先確認說的是哪一層含義再對癥排查。6.4 常見 token 報錯及處理結合平時開發經驗我整理了一張 token 相關報錯的排查表問題現象常見原因解決思路401 Unauthorized: invalid tokenAPI Key 錯誤或已過期檢查密鑰是否有權限重新生成并配置token 數量超過模型上下文限制prompt 長度超出模型窗口做 prompt 截斷、摘要壓縮或分段處理token 消耗過快、賬單異常循環調用或未做重試限制增加調用頻率限制設置單用戶配額token exchange failed認證服務端異常或網絡不通檢查認證服務地址、網絡策略和服務可用性token endpoint returned 403 forbidden服務端策略拒絕該請求來源檢查賬號區域、訪問策略、請求來源 IP 是否被服務商允許credits 兌換 token 比例不清晰平臺按積分/額度方式計費查閱平臺官方計費文檔按實際模型定價測算注意遇到 403 forbidden 這類報錯時首先要檢查服務商是否允許你所在區域的賬號訪問以及請求來源 IP 是否符合服務商策略。任何繞過服務商區域限制的做法都不可取不僅違反平臺條款也可能帶來安全風險。正確的做法是使用服務商認可的訪問方式或聯系平臺獲取官方支持。6.5 如何在代碼中避免 token 超限調用大模型時一個非常常見的問題就是“prompt too long”。解決思路通常有這幾種提前估算 prompt 的 token 數量超過閾值前進行截斷。對長文本做摘要保留關鍵信息。使用支持更長上下文的模型。把長文本拆分成多個片段分批處理。下面是一個簡單的長度預檢示例MAX_INPUT_TOKENS 3000 def validate_prompt(prompt, tokenizer): token_count len(tokenizer.encode(prompt)) if token_count MAX_INPUT_TOKENS: raise ValueError(fprompt 過長當前 {token_count} token超過限制 {MAX_INPUT_TOKENS}) return token_count在實際工程中還可以在異常捕獲里增加降級邏輯比如提示用戶縮短輸入或自動觸發摘要任務。7. 英偉達與 token 的產業分工誰在賺哪一份錢到現在我們已經把英偉達不賣 token 的原因拆得很清楚了。總結一下核心邏輯可以歸納為三點。7.1 產業鏈定位決定商業模式英偉達希望做 AI 時代的算力基礎設施供應商它賺的是“芯片 軟件棧 云計算”的錢。而 token 售賣屬于模型服務層的生意需要直接面向開發者、面對用戶運營和英偉達目前的商業模式存在結構性沖突。7.2 生態保護決定合作邊界英偉達的大客戶里有大量模型服務商。如果英偉達親自賣 token就相當于和客戶競爭。這不是能力問題而是信任問題。一旦客戶產生“英偉達會搶我生意”的顧慮英偉達的芯片優勢也會被削弱。7.3 利潤結構決定選擇理性GPU 是高毛利產品而 token 服務正面臨激烈的價格戰。從商業收益角度看英偉達沒有理由主動進入一個毛利率下降、競爭慘烈、且可能破壞現有主業的賽道。8. 關注 token也關注產業鏈通過這篇文章我們清楚了幾個關鍵點token 是大模型的文本切分單元也是 AI API 計費的核心維度。按 token 計費的本質是按資源消耗計費。英偉達不是沒能力賣 token而是它更適合做 GPU 和算力基礎設施供應商。英偉達的戰略是通過 CUDA 生態、AI Enterprise 軟件棧、DGX Cloud 等方式鎖定 AI 產業鏈最底層的位置。對開發者來說理解 token 不只是為了讀懂賬單。在設計 AI 應用時token 估算、上下文管理、成本控制和異常處理都是真實落地時繞不開的工程問題。只有理解了 token 的經濟學才能做出既好用又可控成本的 AI 產品。至于未來英偉達會不會推出一款“英偉達自家大模型 API”我認為不會輕易發生。更大的可能是英偉達繼續用硬件、軟件和生態推動整個 AI 產業向前走讓更多玩家在模型和應用的賽道上去競爭。而我們會繼續一邊用著 GPU 加速的算力一邊為大模型的 token 買單。