算力与 Token 经常同时出现在大模型新闻、企业采购和产品定价中,但它们属于不同层面:算力是计算资源与处理能力,Token 是模型输入和输出的计量单位。前者回答“需要多少芯片、多久能算完”,后者回答“一次服务处理了多少内容”。
一、算力承担什么:训练模型,也支撑每一次推理
算力泛指计算系统执行运算的能力。在人工智能领域,核心设备通常是 GPU、AI 加速卡及其组成的服务器和集群。行业常用 FLOPS 表示每秒可完成多少次浮点运算:P FLOPS 是每秒千万亿次,E FLOPS 是每秒百亿亿次。但一个标称算力很高的系统,实际效率仍取决于显存容量与带宽、芯片互联、通信网络、软件框架、集群利用率及供电散热。
训练阶段:把大量算力集中在模型能力形成之前
基础模型训练需要反复读取大规模语料、图像或视频,通过前向计算得到结果,再通过反向传播调整数以十亿计的参数。训练一次前沿模型,可能需要成千上万张加速卡连续运行数周甚至数月。此时算力主要用于“形成模型”:参数越多、数据越大、训练轮次越多,对计算、显存和网络的要求通常越高。
推理阶段:把训练好的模型转化为持续服务
模型上线后,用户每发出一次提问、上传一张图片或让智能体执行一项任务,都会触发推理。单次推理消耗远低于完整训练,但用户量大、上下文长、模型需要深度推理时,累计算力十分可观。今天云厂商和企业关心的“推理成本”,本质上是每秒能处理多少请求、每个 Token 消耗多少计算,以及在并发高峰期能否稳定响应。
二、Token 是什么:模型处理内容的统一刻度
Token 通常译为“词元”。语言模型并不直接按“字数”或“单词数”读取文本,而是先通过分词器把内容切成可计算的片段,再将每个片段转换为数字向量。中文里,一个汉字有时接近一个 Token,也可能多个常见汉字组合为一个 Token;英文单词可能是一个 Token,也可能被拆成词根和后缀。标点、数字、空格、代码符号同样可能占用 Token。
因此,同一段文字在豆包、通义、DeepSeek 或 GPT 系列模型中,Token 数可能不同。平台 API 返回的 usage 数据才是实际计量结果,不能仅按“一个汉字等于一个 Token”机械估算。
Token 不是芯片性能单位,也不是模型参数。它只记录模型处理了多少内容。模型输入、历史对话、系统指令、工具返回和最终回答,都可能进入 Token 统计。
大模型服务通常分别计算输入 Token和输出 Token。用户的问题只是输入的一部分,系统提示词、此前多轮对话、检索到的资料和上传文件也会进入上下文。输出 Token 则是模型生成的正文、代码或结构化结果。输出通常比输入定价更高,因为模型需要按顺序逐个生成 Token,难以像输入处理那样充分并行。
三、算力与 Token 的关系:消耗关系,而非固定换算
模型处理 Token 必然消耗算力,但不存在通用的“一 P 算力等于多少 Token”。原因在于计算量同时受模型参数规模、网络结构、上下文长度、批处理大小、精度、是否启用推理模式以及硬件效率影响。同样处理一百万 Token,小模型做分类与大模型做复杂推理,实际所需计算可能相差数十倍。
在推理阶段,输入 Token 需要经过模型各层计算;输出 Token 不仅要经过同样的模型,还需逐个生成,并持续读取此前的上下文缓存。上下文越长,显存占用和数据搬运压力越大。所谓“长上下文模型很贵”,不仅是因为输入 Token 数增加,也因为注意力计算和 KV Cache 占用了更多算力与显存。
因此,判断基础设施看的是 GPU 数量、FLOPS、显存、带宽和集群效率;判断应用规模则看请求数、输入输出 Token、并发量、响应速度和单位任务成本。二者组合起来,才能说明一个模型服务是否真正具备规模化能力。
四、一次实际使用,究竟会消耗多少?
下面给出的是帮助建立数量级认知的典型场景区间,不是豆包 App 的官方账单。面向普通用户的 App 通常不会显示每轮 Token;开发者通过火山方舟等 API 调用时,才能在返回字段和控制台中看到准确用量。
| 使用场景 | 典型用量或计费方式 | 如何理解 |
|---|---|---|
| 与豆包进行一轮普通文字问答 | 约 400—1000 Token | 假设问题几十个汉字、回答约 300—600 个汉字,并计入系统指令和少量历史对话。连续聊天时,历史记录会使后续每轮输入逐渐增大。 |
| 总结一份约 1 万字报告 | 约 7000—13000 输入 Token,另加 500—1500 输出 Token | 中文分词方式、表格和数字会影响结果。若模型还要检索资料或进行多轮修改,总用量会继续增加。 |
| 生成一张图片 | 通常按张计费,而非固定文本 Token | Seedream 等图片生成模型主要按成功输出的图片数量收费,公开价格大致在 0.20—0.25 元/张。提示词只占少量文本 Token,真正成本来自图像生成推理。 |
| 生成 5 秒 1080P 视频 | 约 24.5 万视频 Token(特定公开案例) | Seedance 1.0 Pro 曾公布每千 Token 0.015 元、5 秒 1080P 约 3.67 元,据此折算。不同版本、分辨率、有无声音和生成模式差异很大。 |
| 编程智能体完成一次复杂任务 | 可达约 20 万 Token/任务 | 智能体会反复读取代码、调用工具、检查结果并修复错误。若开发者一天执行 3—5 个复杂任务,可能达到数十万至百万级 Token,但目前没有权威的“开发者日均值”。 |
注:上述文字用量为场景估算,准确值以具体模型分词器和 API 返回的 usage 字段为准;图片与视频模型的计量方式会随产品版本调整,不能将不同模态的 Token 直接横向比较。
五、中国一天调用 140 万亿 Token,说明了什么?
国家数据局公布的数据显示,我国日均 Token 调用量从 2024 年初的约 1000 亿,增长到 2025 年底的 100 万亿以上,并在 2026 年 3 月超过 140 万亿。两年间增长超过千倍,首先说明大模型使用已从少量试用进入高频、规模化调用阶段。
这 140 万亿并不等于 140 万亿次对话。一次请求可能消耗几百、几千甚至几十万 Token。真正推动总量上升的,是模型进入企业流程:客服系统同时处理大量会话,代码智能体反复读取代码库,办公助手分析长文档,内容平台批量生成图文和视频,智能体还会在后台连续调用搜索、数据库和其他工具。与个人偶尔提问相比,这些机器对机器、系统对系统的调用更持续,也更容易形成大规模消耗。
这一数据还反映了两项产业变化。第一,模型成本下降和推理效率提升,使原本不经济的场景开始可用;第二,竞争重点正在从“谁训练出一个模型”转向“谁能让模型稳定嵌入真实业务”。但 Token 总量不能直接代表产值或技术水平:免费流量会计入,模型价格不同,高效模型也可能用更少 Token 完成任务。因此它更适合衡量 AI 应用的活跃度和渗透深度。
六、杭州企业怎样把算力转化为 Token 和业务
目前没有公开、统一的“杭州每日 Token 总消耗量”,因此不宜给城市编造一个总数。更有意义的是观察企业如何把算力、模型和 Token 转化为具体产品。杭州拥有基础模型、云平台、数字内容、企业软件和智能硬件等多类公司,它们处在同一条价值链的不同位置。
模型与平台企业负责训练、部署和优化模型。它们通过量化、缓存、并行推理和模型路由降低每百万 Token 的成本,使更多中小企业能够调用模型,而不是自建昂贵集群。DeepSeek 等开源模型的影响,也不只是提供一个聊天入口,还在于企业可以依据业务要求进行本地部署、微调和推理优化。
软件和开发团队把 Token 转化为可交付的任务。杭州的电商、客服、办公软件和开发工具企业,会让模型读取商品资料、客户记录、代码仓库或知识库。此时成本控制不只是选择更便宜的模型,还包括减少无效上下文、对重复资料做缓存、用小模型处理简单任务、只在复杂环节调用强模型。
数字内容和文旅企业则同时使用文字、图片、语音和视频模型。策划文案可能只消耗几千 Token,但批量生成海报、数字人视频和短剧时,主要成本会转向图像与视频推理。对这类企业而言,Token 只是成本结构的一部分,还需同时考虑生成成功率、版权、人工审核和内容交付周期。
因此,更准确的结论是:算力决定模型服务的能力上限和运行效率,Token 则把每一次模型使用转化为可观察、可计费和可优化的业务量。企业真正要管理的不是 Token 越多越好,而是每一百万 Token 最终完成了多少有效任务、产生了多少可验证的业务价值。
资料来源与口径
- OpenAI:What are tokens and how to count them,用于 Token 基本定义。
- IBM:FLOPS 基本概念,用于算力计量说明。
- 新华社:我国日均 Token 调用量超过 140 万亿,2026-03-24。
- IDC 中国企业级 MaaS 市场统计摘要,统计口径为公有云对外部客户调用量。
- 火山方舟:模型价格与多模态计费说明,用于区分文字、图片和视频的计量方式。
- 证券时报:豆包模型 Token 定价与企业智能体用量案例。