这段时间,我看到不少“卖 Token 是普通人唯一的出路”的文章。有些还很具体:租一台 GPU 服务器,跑几条命令,部署模型,开放接口,然后等客户来调用。
我看到这些文章浑身恶寒。
不是因为 Token 没有市场。模型推理确实是一门很大的生意,这个判断没有问题。问题出在“普通人”三个字上。一个需要资金、客户、推理工程、网络运维、持续值班和合规处理的服务,被压缩成了“买卡或者托管”。最贵、最难、最容易把钱亏掉的部分,你们是只字不提。
就像告诉别人,买一辆货车就能做物流。车确实是必要条件,但仓储、线路、订单、调度、保险、司机和回款怎么办,只字不提。
这里面大概有几个步骤
现在大家都说“卖 Token”,说的可能根本不是一件事。
- 自己购买或租用 GPU,运行开放权重模型,对外提供推理 API。
- 采购模型厂商的 API,再做聚合、中转、计费或转售。
- 把模型能力放进一个具体产品,向客户出售写代码、处理文档、客服或其他结果。
第一种是重资产推理服务。第二种更像渠道和平台生意。第三种卖的是应用。
资金结构不同,技术要求不同,客户为什么愿意付钱也不同。把它们都叫“卖 Token”,读者很容易产生一个错觉:只要我有一台服务器,就已经站在收入入口了。
现实正好相反。服务器只是成本开始发生的地方。
确实有文章把这件事描述成租 GPU、运行几条命令、支持大量模型,然后等待收入。与此同时,2026 年世界人工智能大会现场出现的“Token 工厂”,提供的是统一接口、模型路由、算力波动兜底和企业服务,还分成重资产与轻资产路线。前者是创业故事,后者已经是一整套交付系统。这是不一样的东西。
自建 IDC 不是在房间里放几台服务器
IDC 是数据中心。哪怕不带 AI,它也不是普通人随手能搭起来的东西。
Uptime Institute 的数据中心认证范围包括供配电、机械系统、现场发电、物理安全、设备维护、消防和容量管理。设计阶段还要考虑主用与备用电源、网络路径、制冷、线缆和安全措施。
这些东西不是纯装饰,是要解决问题的。它们解决的是停电怎么办、制冷故障怎么办、某条链路断了怎么办、设备维护时业务要不要停。
AI 集群又把功率密度和网络要求往上推了一截。多节点推理涉及高速适配器、交换机、光模块、布线、RDMA、拥塞控制和性能隔离。它不是“买一块厉害的网卡”这么简单,也不能拿家用工作站的经验估算。
所以,自建 IDC 不属于普通人的副业选项。它是一个基础设施项目。
服务器托管只替你解决了一部分
有人会说,不自建机房,把服务器送去托管不就行了?
可以。托管能解决场地、供电、制冷和部分网络问题,具体解决到什么程度,要看合同。它没有自动替你解决下面这些事:
- 模型下载、部署、量化和版本升级;
- GPU、驱动、推理框架与运行环境兼容;
- 容量规划、请求路由、限流和负载均衡;
- 监控、告警、日志、备份和故障恢复;
- API 密钥、租户隔离、滥用控制和账单;
- 客户支持、退款争议、服务承诺和夜间故障。
开源推理框架可以帮你把模型运行起来。它不会替你接电话,也不会在凌晨发现某块卡掉线后,自动向付费客户解释为什么接口超时。
托管降低了机房门槛。它没有把推理服务变成被动收入。
模型装进显存,只证明它能启动
这些人很喜欢(只会)算模型权重。
某个模型有多少参数,做成 4BIT 量化后大概占多少显存,几张卡能够装下。算到这里就变成“可以对外提供服务了”。
大模型生成文字时,需要保存前面 Token 的注意力状态,避免每生成一个新 Token 都从头计算。这部分内存通常叫 KV Cache。输入越长、对话越长,同时处理的序列越多,它占用的空间通常越大。具体计算方式由模型结构、精度和推理引擎决定,脱离模型直接报一个固定并发数这不是耍流氓是什么?
NVIDIA NIM 的官方配置文档给过一个很直观的例子:80GB GPU 上,模型权重占 60GB。按照示例配置分配后,KV Cache 得到 12GB,另外 8GB 留给中间结果。
这就是“模型能装下”和“服务能承载请求”之间的空隙。
4BIT 量化能减少一部分权重占用和计算成本,但它不会让上下文免费,也不会让一百个请求共用同一份 KV Cache。模型启动成功,最多说明安装工作完成了。
一百名用户不等于一百个并发
一个人使用和一百个人使用,差多少并不是固定的“N 个数量级”。一百名注册用户可能一天只发几个请求,也可能在同一分钟集中提交长文档。真正影响系统的是同时到达多少请求、输入多长、要生成多长、允许等多久、缓存能否命中。
对外提供服务,至少要看这些指标:
- 排队时间:请求进来以后,多久才获得计算资源;
- 首 Token 延迟:用户多久能看到第一个字;
- Token 间延迟:后续文字出来得是否流畅;
- 吞吐:整个系统每秒处理和生成多少 Token;
- KV Cache 使用率:显存还有多少空间承载新请求;
- 错误率和超时率:高峰期到底有多少请求失败。
vLLM 的生产栈把路由、分布式部署、KV Cache 管理、监控和自动扩缩容都列进了生产方案。vLLM 的指标文档还会观察运行与等待请求、GPU Cache 使用率、输入和输出吞吐、缓存命中与排队时间。
这些项目已经说明问题了:单用户聊天时看到的“每秒多少 Token”,不能代表生产服务能力。
怎么知道你的机器能接多少客户?拿真实请求分布压测。没有上下文长度、输出长度、到达率和延迟目标,就没有可信的并发答案。
建好以后,到底卖给谁
这是整门生意最应该先问的问题,却经常等到设备买完才有人问。
个人用户已经有大量免费或低门槛的聊天产品。愿意付费的专业用户,买的也不是一桶没有用途说明的 Token。
写代码的人选择 Claude、Codex 或 Cursor,看的是代码库理解、文件修改、终端执行、工具调用、版本管理和使用体验。团队还会看身份管理、权限、审计、隐私、统一账单和支持。Cursor 的官方产品页列出的团队功能里,就包含使用分析、隐私模式、身份管理和审计等内容。
通用 API 客户还有另一组选择:直接调用模型厂商。以 DeepSeek 当前的官方定价页为例,价格会区分输入缓存命中、缓存未命中和输出,产品侧还提供明确的并发能力。具体价格会继续变化,这恰恰是小供应商要面对的问题。你刚算好的成本,可能被上游一次降价直接否定。
客户为什么绕开这些产品,把业务交给一台由个人维护的服务器?
“我也能返回 OpenAI 兼容格式”不是答案。客户需要的是更低延迟、特定模型、数据不出域、特殊地区可用、稳定供给、行业功能,或者有人对最终结果负责。没有其中任何一项,剩下的竞争手段通常只有低价。
低价偏偏是个人最没有优势的地方。
价格战还没开始,成本已经在走
服务器、托管、电力、网络和人员费用按时间发生。客户只为实际调用付费。
机器空闲时,成本不会暂停。为了顶住晚上的峰值准备第二套容量,白天可能继续空着。模型更新后,原来的卡也许还能用,但性能、显存或功能不再有竞争力。发生故障时,客户不会因为你是个人创业者,就接受更长的恢复时间。
很多所谓成本测算只算了电费,再用一次短时跑分计算每百万 Token 成本。这个数字看起来很精确,实际没有回答:
- GPU 一个月有多少时间在产生可收费 Token;
- 高峰期为了延迟目标预留了多少空闲容量;
- 输入、输出和缓存命中的比例是什么;
- 失败、重试、攻击流量和赠送额度由谁承担;
- 硬件、托管、带宽、税费和人工如何摊销;
- 模型厂商降价后,客户还愿意支付多少差价。
没有真实客户和负载,这张表算得越细,越可能只是在给购买冲动找理由。
对公众开放服务,还有合规责任
如果只是自己在家运行模型,和向公众收费提供 API,不是同一种责任。
《生成式人工智能服务管理暂行办法》适用于向中国境内公众提供生成文本、图片、音频、视频等内容的服务,其中对服务提供者的定义包含通过 API 提供服务的组织和个人。
《人工智能生成合成内容标识办法》已经自 2025 年 9 月 1 日起施行,涉及生成内容的显式和隐式标识、用户协议、日志以及相关手续。
具体业务是否需要备案、安全评估或承担哪些义务,要根据服务对象、模型、功能和部署方式确认。这里不能用一篇文章代替法律意见。
需要提醒的是:把端口开放到公网、接上支付,就认为自己已经完成商业闭环,风险评估也没提。
哪些情况下,小团队仍然可以做
说到这里,不是要得出“任何个人都不能做推理服务”的结论。
有些条件会改变结果:
- 已经有明确客户,知道他们的模型、上下文、调用曲线和延迟要求;
- 在隐私、地区、延迟、模型或行业交付上有现成产品无法替代的需求;
- 设备原本就存在,空闲算力可以在不影响主业务的情况下使用;
- 客户买的是一个具体结果,底层 Token 只是成本项;
- 可以先用租赁算力或第三方 API 验证需求,再决定是否购买硬件;
- 能承担升级、值班、故障、退款、安全和合规责任。
这种情况下,服务器是已经成立的生意需要的一项资源。
如果顺序反过来,先买卡,再托管,再到处问谁愿意买 Token,那不是进入了 AI 行业。更像是先囤了一批会持续产生费用的库存。
我觉得要先把清单上的内容搞搞清楚
真想做,可以先把下面的问题写在纸上:
- 第一批客户是谁?他们是否已经明确愿意付费?
- 他们为什么不用现成的聊天产品、专业工具或模型厂商 API?
- 高峰期的同时请求数、输入长度和输出长度是什么?
- 能接受多长的排队时间、首 Token 延迟和故障恢复时间?
- 模型更新、GPU 故障和网络中断时,用什么兜底?
- 连续几个月低利用率,现金流能不能撑住?
- 谁负责夜间告警、客户支持、退款和滥用处理?
- 面向公众提供服务时,备案、内容安全、数据和日志责任由谁承担?
有一两项暂时搞不清楚也没问题,你有客户吗? 如果你连客户在哪里都不清楚,那代表你根本没有调研过这个生意,趁早PASS
普通人的机会,不在做最小的云厂商
我反感的不是有人做 Token 生意。这个市场当然会成长,也会出现新的供应商。
我反感的是,把需要资本、团队、客户和工程能力的基础设施生意,包装成普通人的低成本副业。读者承担的是设备、合同和现金流,写文章的人只需要承担一个标题。
普通人的 AI 机会并没有消失。更现实的做法是找到一个有人愿意付费的问题,用现成模型先把结果交付出来。客户稳定了,数据和经营搞明白了,再判断自建推理能不能降低成本或解决现有产品做不到的要求。
Token 是计量单位,不是客户需求。