AI Token 工厂发展前景深度研究报告 AI 算力与 Token 生成基础设施 —— 行业前景 · 分阶段投入规划 · 硬件选型对比

报告日期:2026年8月17日(含 2026-08-17 当日最新定价) 数据窗口:2024–2025 全年口径 + 2026 年上半年最新披露 覆盖:全球 + 中国市场 研究方法:公开数据多源交叉验证
$816亿
英伟达 FY27Q1(2026-05)单季营收,+85%;数据中心 $752 亿(+92%)
1,882 EFLOPS
2026 年一季度中国智能算力规模(FP16),需求同比 +417%(信通院)
¥27 / ¥4.5
DeepSeek-V4 输出 API 价:高峰 ¥27 / 闲时 ¥4.5 每百万 token(2026-08-17 生效,较此前涨 350%)
+20%
2026 年上半年 H100 租赁价回升幅度(英伟达 CFO 财报电话会披露)
PITCH

投资亮点速览

给投资人 30 秒版 —— 完整测算见正文与交互计算器

项目定位:算电协同的 AI 算力项目。用园区光伏余电(成本 0.36 元/度、低于市电 40%)驱动 GPU 集群生产 Token——把"卖不掉、甚至负电价的电"变成"能赚钱的 AI 算力服务",同时吃下 2026 年算力紧缺 + Token 涨价的双重行业红利。

2026-08 | 拟融资约 300–400 万元 | ⏱ 目标回本 18–24 个月 | 广东中山
40%+
电费节省(光伏余电 0.36 元 vs 市电 0.65 元;广东现货负电价时段≈免费)——自带绿电 = 自带护城河
80%+
毛利空间(自建单 Token 成本 ¥2.3 vs 官方售价 ¥13.5–27/百万,见 2.5 节)
$7,100亿
2026 年全球云资本开支(+70%);DeepSeek-V4 输出价较年初涨 350%([67][63])
18–24月
目标回本周期(中性 15 个月 / 保守 30 个月,三情景测算见 2.6.3)

投入与回报(行业假设测算,投产前以实际 POC 校准)

项目金额 / 区间说明
总投资约 350 万元8 卡 H100 整机 250 万 + 机房/电力配套 40 万 + 运营储备 60 万
年收入250–450 万60–70% 利用率;B2B 批发 + 垂直场景组合定价 ¥8–12/百万 token
年净利150–300 万扣折旧、电费(光伏价)、运维与人力
回本周期18–24 个月乐观 18 个月(70% 利用率);保守 24–30 个月(60% 利用率)
敏感性利用率每 ±10% ≈ 年净利 ±60 万;电费每 ±0.1 元/度 ≈ 年 ±3 万

可选超前期(种子验证档):20–50 万先做 POC 验证(Mac 开发机 + 云 GPU 跑通 70B 部署、锁定光伏供电协议、拿到付费意向),M3 验证通过再追加标准档——投资方可低风险试水,投入按实缴计入总股本(详见 2.6.0)。

合作模式:资源 + 资金入股

  • 投资方:现金出资 + 园区机房场地 + 光伏余电长期供电(按 0.36 元/度锁定,低于市电 40%)。
  • 运营方:技术与运营团队、客户与市场渠道、模型工程与平台知识产权(技术干股,建议 25–40%)。
  • 利益结构:"先分红、后股转"——回本前净利润 70% 归投资方优先回收本金、30% 归运营方;回本后按股分红(如 60/40),运营方比例随里程碑达成上调;场地与余电按季度计提为资源回报,投资方现金流有保障、运营方拿股权成长。

风险与保障(可写入协议)

  • 电力:光伏夜间不发电 → 市电兜底 + 批处理任务排到午间(负电价时段)对冲
  • 价格:Token 售价波动 → 垂直场景 SaaS 锁定毛利 + 云弹性池随用随停
  • 技术换代:GPU 2–3 年一代 → 5 年折旧 + 残值处置,B200/Vera Rubin 按需升级
  • 里程碑对赌:M6 MVP 上线、M18 盈亏平衡;未达成则投资方优先比例上调
  • 退出机制:3–5 年按净资产或年净利 ×3–5 倍回购,保障投资方可退出
现场演示:本报告内置 成本计算器光伏余电测算,可拖动参数实时验证任何假设(详见第二部分 2.5 节与第三部分 3.7 节)。

目录

  1. 投资亮点速览(给投资人 30 秒版)
  2. 执行摘要与核心结论
  3. 第一部分 行业前景:AI 算力与 Token 市场的现状、规模与趋势
  4. 第二部分 分阶段投入规划:前期 / 中期 / 后期
  5. 投资合作与回报方案(面向潜在投资人)
  6. 第三部分 硬件选型对比:Mac vs 服务器 GPU 集群
  7. 附录 A:关键指标对比总表
  8. 附录 B:完整数据来源列表
EXEC

执行摘要与核心结论

一句话结论 "AI Token 工厂"(以算力换取 Token 生成能力的商业模式)正处于超级上行周期:2024–2025 年全球算力资本开支以 40%+ 的年增速扩张,推理已取代训练成为算力需求主战场;但Token 单价断崖式下降(1.5 年降 280 倍)与电力供给瓶颈构成两大硬约束。行业已从"英伟达单极"走向"中美双轨"(英伟达中国份额从 95% 降至 55%,昇腾等国产芯片突破 40%)。对中小玩家而言,纯卖 Token 的商业模式已不成立,可行路径是"轻资产起步 + 混合部署 + 垂直场景溢价"。

2026 年最新数据补充说明

本版在 2025 年数据基础上,补入 2026 年上半年最新披露,行业出现三个关键反转

  • 反转一:Token 价格战结束,市场进入涨价周期。DeepSeek 于 2026-08-17(今日)起对 V4 全系执行峰谷定价:V4-Pro 输出高峰 ¥27/百万 token(较此前 ¥6 涨 350%)、闲时 ¥13.5;V4-Flash 输出高峰 ¥9/闲时 ¥4.5。[63] 黄仁勋在 FY27Q1 财报会上直言:"Token 现在能够盈利,模型公司正在竞相生产更多 Token。"[64]
  • 反转二:算力供给重新紧张。英伟达 CFO 披露 2026 年至今 H100 租赁价上涨约 20%、A100 上涨近 15%;中国信通院数据显示 2026Q1 国内 AI 算力需求同比 +417%,而有效供给增速仅 128%——与 2025 年"租价暴跌"完全相反。[65][66]
  • 反转三:资本开支再上台阶。北美四大云厂商 2026Q1 合计 capex $1,316 亿(+70%),全年指引合计约 $7,100 亿,2027 年预计超 $1 万亿;中国"十五五"算力网建设新增直接投资 4 万亿元[67][68]

对报告结论的影响:第二部分"纯卖 Token 不成立"的判断需微调——2026 年下半年起,算力/Token 批发模式的毛利空间正在回升(DeepSeek 官方输出价 ¥13.5–27/百万 vs 自建成本约 ¥2.3/百万),"卖 Token"重新成为可行业务线,但垂直场景溢价依然是更稳健的主航道。硬件选型结论不变。

十大核心判断

  1. 市场规模:全球数据中心系统支出 2025 年实际 $5,060 亿(+51.6%)、2026 年预计 $8,220 亿(+62.5%)(Gartner 2026-07 最新口径);IDC 预计全球 AI 基础设施支出 2028 年达 $2,230 亿(2025 年 2 月上调口径)。[1][2][3][78]
  2. 中国市场:2025 年底全国智算规模 159 万 PFLOPS(FP16)、全球第二,在用机架 1,373 万标准架,建成 42 个万卡级集群。[4]
  3. 推理为王:Gartner 预计 2028 年 80% 以上的数据中心加速器将用于推理而非训练;全球 AI 推理市场 2025 年约 $1,061 亿,2030 年预计 $2,550 亿(CAGR 19.2%)[5][6];Polaris(2026-04)交叉验证 2026E 约 $1,262 亿[81]
  4. Token 单价暴跌:斯坦福 AI Index 2025 测算,GPT-3.5 级性能推理成本 1.5 年降 280 倍;DeepSeek-V3/R1 以约为 GPT-4o 1/10 的价格引爆 2025 年价格战。[7][8]
  5. 算力供给缓解:H100 云租价从 2023 年峰值 $7–10/小时跌至 2025 年 $2–4/小时,瓶颈已从"芯片短缺"转向"电力短缺"(美国 2025–2028 年预计缺口 44–45GW)。[9][10]
  6. 竞争格局:英伟达 FY2026 数据中心收入 $1,934.8 亿(+68%);中国 AI 加速卡市场国产份额首次突破 40%(昇腾 81.2 万颗 / 20.4% 份额)。[11][12][13]
  7. 政策红利:中国"东数西算"+ 地方算力券/模型券(深圳每年最高 1 亿元)大幅降低入场门槛。[14][15]
  8. 硬件格局:Mac 统一内存(512GB / 819GB/s)可本地跑 671B 级大模型,但生成速度仅为 GPU 服务器的 1/5–1/10;规模化生产推理只有 GPU 集群一条主流路径。[16][17]
  9. 经济模型:自建 8 卡 H100 集群在 >70% 利用率下约 20 个月回本;盈亏平衡点约 60–70% 利用率——低利用率时云租赁显著更优[18][19]
  10. 风险提示:54% 机构投资者认为 AI 股票处于泡沫(美银 2025.10 调查);API 价格战持续侵蚀毛利;芯片管制与国产替代生态差距并存。[20][21]

关于数据口径与测算的说明

本报告所有数据均来自公开来源并在正文标注编号([n]),文末附录 B 给出完整来源列表与 URL。部分市场预测数字(如推理市场规模)因机构口径不同差异较大,已注明出处与统计口径;涉及厂商自营博客、二手转载的数据已标注"营销口径/需核实"。所有单 Token 成本、ROI 测算均为基于公开假设的估算模型,用于方案比较而非精确财务预测,具体参数已在相应章节列出。

PART 1

第一部分 行业前景

AI 算力与 Token 市场的现状、规模、驱动力、格局、政策与风险

1.1 全球 AI 算力 / Token 市场:现状与规模

1.1.1 全球算力支出处于历史级扩张周期

2024 年全球数据中心系统支出 $3,333.72 亿(同比 +40.3%)2025 年实际 $5,060 亿(+51.6%)、2026 年预计 $8,220 亿(+62.5%)——Gartner 2026-07 最新口径较一年前预测大幅上调,官方称"AI 算力建设是人类史上最大的基础设施工程";全球 IT 总支出 2026 年预计 $6.37 万亿(+14.2%)。
来源:Gartner(2025-07 旧预测 [1] / 2026-07 最新预测 [78]),口径 = 数据中心系统(服务器/存储/网络硬件)
2025 年全球 AI 优化服务器支出预计约 $2,020 亿,首次超过传统服务器;2026 年预计达传统服务器的 3 倍。
来源:Gartner(分析师 John-David Lovelock 访谈,CIO.com 2025-07)
2024 年上半年全球 AI 基础设施(AI 工作负载的服务器+存储)支出 $474 亿(同比 +97%);IDC 于 2025 年 2 月将 2028 年预测大幅上调至 $2,230 亿(云部署占 82%、加速服务器占 74%)。
来源:IDC Worldwide Semiannual AI Infrastructure Tracker(2025-02-18)
狭义"AI 数据中心市场":2024 年 $982 亿 → 2025 年 $1,296 亿,预计 2034 年达 $1.98 万亿(CAGR 35.5%)。
来源:Global Market Insights(2025-11,口径较宽,含硬件/软件/服务);Fortune Business Insights 按更窄口径测 2025 年仅 $177 亿——差异源于口径,引用时须注明
五大超大规模云厂商(亚马逊/微软/谷歌/Meta/甲骨文)资本开支:2024 年 $2,590 亿 → 2025 年预计 $4,140 亿 → 2026 年预计 $5,310 亿
来源:Guinness Global Investors 引用 Bloomberg(2025-11);高盛口径更激进(2025 年 $4,180 亿 → 2026 年超 $7,000 亿)

1.1.2 2026 年 H1 最新动态:增速再次上修,未见放缓

英伟达 FY27Q1(截至 2026-04,2026-05-20 发布):单季营收 $816 亿(+85% YoY),GAAP 净利润 $583 亿;数据中心收入 $752 亿(+92%),其中网络收入 $148 亿(+199%);GB300 NVL72 需求强劲,Blackwell GPU 累计部署数十万颗(公司史上最快爬坡);Q2 指引 $910 亿。
来源:NVIDIA 官方财报 + 财报电话会实录(2026-05-20)[64]
北美四大云厂商 2026Q1 合计资本开支 $1,316 亿(同比 +70%):亚马逊 $442 亿(全年指引 $2,000 亿)、谷歌 $357 亿(全年 $1,850 亿)、微软 $309 亿(全年 $1,900 亿,+129%)、Meta $198 亿(全年 $1,350 亿);2026 年合计预计约 $7,100 亿,2027 年将超 $1 万亿
来源:各公司 2026Q1 财报(中信建投/兴业证券整理,2026-05)[67]
英伟达预计 AI 基础设施支出 2030 年末达到每年 $3–4 万亿;新一代 Vera Rubin 平台(推理吞吐最高 35 倍于 Blackwell)按计划 2026Q3 开始出货、Q4 起大规模放量。
来源:英伟达 FY27Q1 财报电话会(2026-05)[64]

图 1|北美四大云厂商资本开支:2024 → 2026E(亿美元)

0 $2,000 亿 $4,000 亿 $6,000 亿 $2,590 2024 $4,140 2025 $7,100 2026E 数据:四大云厂商财报与全年指引(2026 为指引中值),来源 [67];2027 年预计再超 $1 万亿

1.2 中国市场:智算规模全球第二,一年翻三倍

1.2.1 规模与增速

2024 年中国智能算力市场规模约 $190 亿(同比 +86.9%)
来源:IDC《中国人工智能计算力发展评估报告》(中国信通院《人工智能算力基础设施赋能研究报告(2025)》引用)
截至 2025 年 6 月底,全国在用算力中心 1,085 万标准机架,智能算力规模 788 EFLOPS(FP16)
来源:中国信通院《2025 综合算力指数》(2025 中国算力大会发布)
截至 2025 年底,全国在用算力设施超 1,373 万标准机架(2024 年为 900 万),建成 42 个万卡级智算集群,智算规模达 159 万 PFLOPS(FP16)(2024 年仅 49.3 万 PFLOPS,一年增长约 3.2 倍),位居全球第二;超大型算力设施平均 PUE 降至 1.34。
来源:国家数据局《数字中国发展报告(2025年)》(2026-06 发布)
截至 2025 年,全国已建及在建智算中心超 250 个,算力总规模约 280 EFLOPS,覆盖八大枢纽。
来源:中国信通院《2025 智算服务发展报告》(中国 IDC 圈转载,2025-08)
中国在全球大模型版图中的占比:全球已发布大模型 3,755 个,其中中国 1,509 个(40.2%,全球第一);截至 2025 年底 748 款生成式 AI 服务完成备案;生成式 AI 用户 6.02 亿(同比 +141.7%)。
来源:信通院《综合算力指数蓝皮书(2025)》;国家数据局《数字中国发展报告(2025年)》

为什么说 2025 年是中国智算的"里程碑年"

工信部等六部门 2023 年《算力基础设施高质量发展行动计划》提出的 2025 年目标(算力 300+ EFLOPS、智能算力占比 35%)已被大幅超额完成(智算 788 EFLOPS、智能算力占比 81%)。"东数西算"八大枢纽 2025 年新增算力占全国新增的 80% 以上,枢纽间 20ms 时延圈基本实现。[4][22] 这意味着:国内算力供给的"硬件荒"正在缓解,竞争重心转向"谁能把算力高效转化为可销售的 Token 服务"。

1.2.2 2026 年最新:需求爆发 +417%,算力价格重回升势

截至 2026 年一季度,中国智能算力规模达 1,882 EFLOPS(FP16)(信通院总工程师何宝宏央视采访披露);IDC 预测 2026 年中国智能算力规模 1,460 EFLOPS、为 2024 年两倍(口径差异:信通院含存量全量监测,IDC 为市场统计)。
来源:中国信通院(2026-06)/ IDC(2026-08 报道)[66][69]
2026Q1 国内 AI 算力需求同比 +417%,有效供给增速仅 128%——供需缺口扩大,算力租赁价格持续上涨,一改 2025 年租价下滑态势。
来源:中国信通院数据(华夏时报 2026-08 报道)[66]
政策再升级:2026-04-28 中央政治局会议首次将"算力网"纳入国家"六张网";"十五五"期间算力网建设新增直接投资 4 万亿元(国家发改委,2026-07);形成"8+10+3"算力空间布局(8 大枢纽、10 个集群、3 个算电协同区);2026-07-10 全国首个国产十万卡 AI 超集群在郑州落成。
来源:华夏时报(2026-08)/ 国家发改委发布会[68]
信通院《智能算力服务研究报告(2026年)》:2025 年中国智能算力服务市场规模超 1,300 亿元;全球 AI 优化服务器市场 2025 年约 $2,800 亿;报告指出算力服务正从"资源租赁"向"任务式交付/词元服务"升级——与"Token 工厂"商业模式同向。
来源:中国信通院(2026 年发布)[70]

图 2|中国智能算力规模:2024 末 → 2026Q1(EFLOPS,FP16)

0 500 1,000 1,500 493 2024 末 1,590 2025 末 1,882 2026Q1 数据:2024/2025 末为国家数据局《数字中国发展报告》口径([4]),2026Q1 为信通院口径([66]);IDC 预测 2026 全年 1,460 EFLOPS([69])

1.3 核心驱动力:需求、成本与商业模式三重共振

驱动力 1|大模型需求井喷:Token 消耗量指数级增长

A
OpenAI:ChatGPT 周活用户 9 亿(2026-02),2026 年中接近 10 亿、月活超 10 亿(2026-06);API 处理能力 150 亿 tokens/分钟(2026-03,较 2025-10 的 60 亿/分钟增长 2.5 倍)。
来源:OpenAI 官方披露(The Information 2026-07-28 / Reuters,经华泰研究转载)[79]
B
推理算力占比快速上升:推理计算市场 2023 年约 $120 亿(占 AI 算力支出 33%)→ 2024 年 $250 亿(占 50%)→ 2025 年约 $380 亿(占 58%)→ 2026 年预计 $550 亿(占 67%)。
来源:第三方测算(非权威机构,仅作趋势参考)

驱动力 2|推理成本断崖式下降:"Token 变便宜"反而扩大总量

A
斯坦福 HAI《2025 AI 指数报告》:GPT-3.5 级性能(MMLU 64.8)的推理成本从 2022 年 11 月 $20/百万 token 降至 2024 年 10 月 $0.07——1.5 年下降 280 倍;GPQA >50% 的模型推理成本不到一年降 125 倍($15 → $0.12)。
来源:Stanford HAI AI Index 2025(与 Epoch AI 合作,3:1 输入输出加权价口径)
B
API 定价战实录:GPT-4o-mini 发布即定价 $0.15 / $0.60(百万输入/输出),为 GPT-4o 的 1/20;DeepSeek-V3 官方 API 输入 $0.27、输出 $1.10/百万 token(约为 GPT-4o 的 1/10);DeepSeek-R1 输出 16 元/百万 token;2025 年 2 月 DeepSeek 夜间错峰再降 50–75%。
来源:OpenAI / DeepSeek 官方 API 定价(2024-05 ~ 2025-02)
C
硬件侧同频降价:英伟达 DeepSeek-R1-FP4(Blackwell 优化)相比 H100,单 Token 成本降低 20 倍,B200 推理吞吐每秒 21,088 token(H100 为 844,提升 25 倍)。
来源:英伟达官方发布(证券时报 2025-02-25 报道)
D
成本下降打开"边际需求":当每百万 token 从 $10 级降到 $0.1 级,调用量从"人工审核的奢侈品"变为"可批量化的工业品"——这是 Token 总量扩张的根本逻辑(类似电价下降反而扩大总用电量)。
逻辑推演(结合 Epoch AI:推理成本年降 9–900 倍、因任务而异)

图 3|GPT-3.5 级性能的推理成本崩塌:$20 → $0.07 / 百万 token(1.5 年降 280 倍)

$20.00 2022-11(GPT-3.5 时代) $0.07 2024-10(Gemini-1.5-Flash-8B) 约 1.5 年下降 280 倍 曲线为趋势示意,端点为实测数据(3:1 输入输出加权价) 数据:Stanford HAI《AI Index 2025》([7]);2026 年 8 月起 DeepSeek-V4 等头部模型已转向涨价([63]),价格曲线进入新阶段

驱动力 3|Token 化商业模式成熟:按 Token 计费成为 AI 基础设施的标准结算单元

A
全球 AI 推理市场规模:2025 年 $1,061.5 亿 → 2030 年 $2,549.8 亿(CAGR 19.2%)(MarketsandMarkets);Grand View Research 交叉验证口径相近(2024 年 $972.4 亿 → 2030 年 $2,537.5 亿,CAGR 17.5%)。
来源:MarketsandMarkets 2025-02;Grand View Research 2025-05(两口径均含硬件+软件+服务)
B
Gartner 预测:到 2028 年 80%+ 的数据中心加速器用于推理,推理成为算力需求主战场。
来源:Gartner 2025 年预测
C
按 Token 计费仍是主流结算方式(约 71%),订阅制与混合计费占比正在上升(2026 年约 19%)。
来源:IIM 信息研究网调研口径(可靠性中等)
D
注意:"词元经济 2030 年 $16.4 万亿""LLM API 市场 2028 年 $957 亿"等激进预测来自中国咨询机构营销页,口径激进且无国际第三方验证,仅作概念性参考,本报告不作主引用。
来源:研精毕智等(已标注不可靠)
E
Token 消耗量级(2026 年):OpenAI 日调用 21.6 万亿词元;字节豆包大模型日调用突破 120 万亿词元(信通院 2026 报告引用)。
来源:中国信通院《智能算力服务研究报告(2026年)》[70]
F
关键拐点(2026-08):DeepSeek-V4 官方 API 大幅涨价——输出价从此前 ¥6/百万 token 上调至高峰 ¥27、闲时 ¥13.5(涨 350%),并引入峰谷定价;叠加 H100 租价回升 20%,"Token 盈利时代"开启,黄仁勋:"Token 现在能够盈利。"
来源:DeepSeek 官方公告(2026-08-13,8-17 生效)/ 澎湃新闻[63][64][65]

一个值得注意的悖论:Token 单价下降与资本开支上涨并存

2024–2025 年出现罕见组合:Token 售价暴跌(API 价格战)+ 算力资本开支暴涨(数据中心建设成本 $20M+/MW,较传统设施溢价约 2 倍)[9][23] 这意味着:上游(芯片/电力/机房)吃走大部分利润,中游(Token 生产与转售)毛利率被持续挤压。对"AI Token 工厂"的启示:单纯做"买卡 → 出 Token → 卖 Token"的中间商模式在 2026 年已无利可图,必须向"垂直场景应用溢价""私有化数据安全溢价""微调/定制服务溢价"三层价值叠加演进(详见第二部分)。

1.4 竞争格局:英伟达单极 → 中美双轨

玩家关键数据(2024–2025)定位判断
英伟达FY2025(截至 2025-01):营收 $1,305 亿(+114%),数据中心 $1,152 亿(+142%);FY2026(2025 自然年):营收 $2,159.4 亿(+65%),数据中心 $1,934.8 亿(+68%),占营收近 90%[11][12]FY27Q1(2026-05)单季营收 $816 亿(+85%),数据中心 $752 亿(+92%)[64]全球绝对霸主;Blackwell(GB300/NVL72)需求超预期,TOP500 中 75%+ 采用其技术;Vera Rubin 平台 2026Q3 出货
AMD2026Q1 营收 $103 亿(+38%),数据中心 $58 亿(+57%);与 OpenAI、Meta 各达成 6GW Instinct GPU 部署合作(MI450 Helios 平台 2026H2 量产);预计 2027 年 Instinct 收入达数百亿美元[24][80]英伟达最强挑战者,生态差距仍在;数据中心已成核心增长支柱
华为昇腾2025 年中国市场出货 81.2 万颗(份额 20.41%,占国产 AI 芯片出货近 50%);910C 推理速度约为 H100 的 60%(外媒独立测试);深圳万卡 910C 超节点实测故障率 0.3‰[13][25][26]中国国产替代龙头,训练生态仍落后(CUDA vs CANN)
寒武纪2025 年营收 64.97 亿元(+453%),净利润 20.59 亿元,扭亏为盈;市值一度近 5,000 亿元[27]A 股"国产算力"核心标的,业绩兑现拐点
国产整体2025 年中国 AI 加速卡出货约 400 万张:英伟达 220 万张(55.22%,从制裁前约 95% 大幅下滑);国产合计 165 万张(份额首破 40%[28]中美双轨格局确立;黄仁勋自述英伟达在华高端芯片份额"从 95% 降至 0%"
云厂商五大超大规模云 2026 年 capex 预计 $5,310 亿;H100 云租价跌至 $2–4/小时[9][10]算力供给主体正从"卖卡"转向"卖算力服务"

1.5 政策环境:中国红利密集释放,美国管制持续收紧

中国:从"东数西算"到"算力券",政策全面托底

  • 顶层规划:《算力基础设施高质量发展行动计划》(工信部等六部门,2023-10)——2025 年目标已超额完成;《算力互联互通行动计划》(2025-05)提出 2028 年实现全国公共算力标准化互联;国务院 2025-08 印发《关于深入实施"人工智能+"行动的意见》。[22]
  • "东数西算"工程:八大枢纽持续集聚算力(2025 年枢纽新增算力占全国 80%+),全国一体化算力网监测平台已接入 1,129 个算力设施。[4]
  • 地方补贴(算力券/模型券):深圳每年最高 1 亿元"模型券"(单企业最高 100–200 万/年、抵扣最高 30%);东莞最高 5,000 万元算力券;珠海总额最高 5 亿元算力券 + 1 亿元模型券;广州黄埔三类券各最高 1,000 万元。[15] —— 这是中小 Token 工厂最重要的"入场券"。
  • 电价红利:西部绿电区度电 0.20–0.35 元(内蒙古乌兰察布约 0.35 元、甘肃庆阳低至 0.2188 元),东部 0.60–0.80+ 元——"Token 工厂"选址西部可省 50%+ 电费。[29]

美国:出口管制层层加码,国产替代被迫加速

  • 2024-12-02:BIS 新增 140 家实体清单(136 家中国公司),首次对 HBM 高带宽内存实施管制(带宽密度 >2GB/s/mm² 的 HBM 对华出口受限,当时所有量产 HBM 均超标)。[30]
  • 2025 年 H20 博弈:4 月实质禁售(英伟达计提 $55 亿减值);7 月 15 日获准恢复对华出口(仅限库存);8 月英伟达转向面向中国的 Blackwell 衍生品 B30A。[21]
  • 影响量化:摩根大通测算 2024 年中国芯片自给率约 34%,预计 2027 年大幅提升(预测值);英伟达在华高端 AI 芯片份额"从 95% 降至 0%"(黄仁勋 2025-10 表态)。[21][31]
  • 启示:中国"Token 工厂"的硬件供应链已不可逆地分为"英伟达合规线(H20/B30A)"与"国产线(昇腾/寒武纪/海光)"两条,选型必须考虑合规与供应链安全(详见第三部分)。

1.6 潜在风险:电力瓶颈、泡沫争议、价格战与生态差距

风险类别关键事实与数据对"Token 工厂"的影响
电力供给瓶颈Morgan Stanley:美国 2025–2028 年数据中心新增用电需求 65GW,可用供给仅 21GW,缺口 44–45GW(约等于意大利全国用电量);GenAI 耗电 2023 年 20 TWh → 2025 年 165 TWh → 2028 年预计 675 TWh[10]选址决定生死:西部绿电区/近电网节点是唯一解;电费占运营成本 50%+(东部更高)
AI 资本开支泡沫争议美银 2025-10 调查:54% 机构投资者认为 AI 股票处于泡沫;2023–2025 全球 AI 基础设施投入约 $5,600 亿,而 AI 软件与服务收入远低于此;纳德拉承认"芯片插不上电"问题[20][32]融资环境随时可能收紧;现金流为正的垂直场景比"烧钱囤卡"更安全
Token 价格战 → 涨价周期旗舰模型输入价 17 个月降 8 倍;H100 租价 2 年跌 60%+[7][9];但 2026 年 H1 反转:H100 租价回升 20%,DeepSeek-V4 输出价上调 350%[63][65]毛利正在修复;但"涨价后需求是否回落"是新的观察点,定价策略(峰谷/错峰)成为运营必修课
技术换代风险GPU 世代 2–3 年换代(A100→H100→H200→B200),单卡价格 $25K–45K,自购存在技术过时风险[33]自建资产折旧周期必须 ≤3 年;云弹性部署对冲换代风险
国产生态差距昇腾推理可达 H100 的 60%,但训练生态(CANN vs CUDA)差距明显,框架兼容性成本高[25]国产线适合推理型 Token 工厂;训练/前沿研发仍依赖英伟达合规卡或海外云
PART 2

第二部分 分阶段投入规划

前期验证 → 中期扩容 → 后期规模化
规划总思路:先轻后重、以销定产、弹性优先 基于第一部分的行业判断(Token 单价暴跌 + 资本开支上升 + 电力瓶颈),本规划反对"一步到位重资产囤卡"。推荐路径:前期用 Mac + 云 GPU 验证商业模式 → 中期按客户需求自建 8 卡级 GPU 集群 → 后期多元算力规模化。所有预算均为人民币、按 2025 年市场价估算,实际以询价为准。
阶段时间轻资产档标准档(推荐)重资产档
前期0–6 月 15–40 万
(Mac 开发机 + 云 GPU 按需)
150–350 万
(1 台 8 卡 H100 整机或等量云预留)
500–1,000 万
(2 台 8 卡 + 机房机柜 + 团队 5–8 人)
中期6–18 月 +20–60 万
(长期云预留实例 / 扩容 Mac)
+300–800 万
(加购 1–2 台 8 卡,或引入昇腾 910C 混合)
+1,000–3,000 万
(整机房扩容、液冷改造、多集群)
后期18–36 月 按需追加
(维持弹性,不沉淀重资产)
1,000–3,000 万
(多元算力:英伟达 + 国产 + 云弹性)
5,000 万–2 亿
(双机房、PUE 优化、全国节点)

2.1 前期(0–6 月):验证期 —— 设备采购 / 机房部署 / 团队组建

阶段目标

用最小成本验证三个问题:① 目标客户是否真的愿意为 Token 服务付费(付费意愿验证);② 自建 vs 云 API 的成本结构是否成立;③ 技术链路(模型部署 → 推理优化 → API 网关 → 计费)是否跑通。

预算与成本结构(标准档示例,合计约 150–350 万)

成本项金额区间占比说明
硬件采购180–250 万(可选:首年以云预留替代,约 100–150 万/年)65–75%8 卡 H100 整机($250–460K);或先租后买:H100 云价 $2–4/卡时,8 卡 24/7 月成本约 ¥8–17 万[9][18]
开发机8–15 万5%Mac Studio M3 Ultra 512GB(¥74,249)或 256GB(约 ¥5 万)用于开发调试、私有数据推理、超大模型试验[34]
机房/托管月 5,000–20,0005–8%整机柜托管(8–10kW);或租用智算中心机柜(西部托管电费更优)
电力月 1.3–3 万5–8%8 卡满负荷 10kW;西部 0.35 元/度 vs 东部 0.65 元/度,差距约 2 倍[29]
网络与带宽月 2,000–8,0002–3%BGP 带宽 + 高防;出 Token 服务对带宽时延敏感
团队人力月 5–10 万10–15%2–5 人:算法/推理优化 1–2 人、后端/API 1–2 人、产品运营 1 人
软件与合规3–8 万2–3%推理框架(vLLM/SGLang)、监控、备案/合规咨询

参考:华为云 10MW 智算中心 TCO 模型——GPU 服务器占 CAPEX 52%,年 OPEX 约 $2.56M/MW;美国全口径数据中心 CAPEX 约 $37.6–38M/MW(IT 设备占 2/3)。[19][35]

关键里程碑(前期)

M1:技术链路跑通
vLLM 部署 70B 级开源模型(Qwen/Llama),单卡吞吐 ≥1,800 tok/s(100 并发);API 网关 + Token 计费系统上线;自建每百万 token 成本进入测算表。
M3:种子客户验证
签约 3–5 个付费客户(建议垂直场景:客服 Agent、内容批量生产、行业私有化部署);确认客单价与复购逻辑。通过 = 进入中期;不通过 = 止损或转向纯云 API 分销。
M6:决策评审
真实利用率、单 Token 全成本、客户毛利三张表对齐;决定自建规模。若平均利用率 <40%,维持云弹性策略。

2.2 中期(6–18 月):扩容期 —— 扩容 / 运维 / 优化

阶段目标

把"验证过的客户需求"转化为稳定产能:扩容到 2–3 个 8 卡集群,建立标准运维体系,把单 Token 成本降到云 API 批发价以下,实现盈亏平衡或接近盈亏平衡

扩容决策要点(结合数据)

  • 自建 vs 云租赁的盈亏平衡点约为 60–70% 利用率:持续利用率 >70% 且预期 >18 个月时自建 8 卡 H100(约 ¥250 万)优于云租(8 卡云租年成本约 ¥100–140 万),约 20 个月回本;大多数组织实际 GPU 利用率仅 40–50%,扩容前必须先测真实利用率。[18][36]
  • 容量规划参考:70B FP8 权重约 70GB——单张 H100 80GB 恰好装下但 KV cache 仅剩约 10GB(高并发风险);H200(141GB)单卡可替代 2 张 H100,长上下文场景优先 H200。[37]
  • 国产算力选项:昇腾 910C(推理约为 H100 的 60%,FP16 780–800 TFLOPS)成本与供给受政策支持,适合推理为主的中期扩容;注意 CANN 生态迁移成本。[25]
  • 电力是隐性瓶颈:每加一个 8 卡机柜 = 10kW 电力 + 散热;机房扩容前先确认电力配额(参考:美国数据中心 2025–2028 年电力缺口 44–45GW)。[10]

运维与优化体系(中期核心工作)

维度关键动作量化目标
推理优化vLLM/TensorRT-LLM 批处理、PagedAttention、FP8 量化、前缀缓存高并发吞吐提升 2–5 倍(H100 70B:单流 120 → 100 并发 2,400 tok/s)[17]
调度弹性自建集群保底 + 云 GPU($2–4/卡时)吸收峰值 + 外部 API(DeepSeek 等)兜底峰值利用率 >90%,空转率 <15%
监控告警GPU 温度/显存/吞吐/延迟/TTFT 全链路监控TTFT <200ms,P99 时延达标
成本核算每集群每周输出单 Token 全成本报表(硬件折旧+电+运维+人力分摊)单 Token 成本持续下降,月度复盘
能耗优化PUE 管理、错峰运行(借鉴 DeepSeek 夜间 50–75% 折扣策略)PUE ≤1.3(全国超大型设施均值 1.34)[4]

关键里程碑(中期)

M9:产能翻倍
完成第二集群上线(或国产卡混合扩容),总吞吐 ≥40,000 tok/s 峰值。
M12:客户规模化
付费客户 ≥30 家 / 或 1–2 个标杆大客户;月出货 Token ≥10 亿级;形成标准化 SLA 与计费套餐(按量/包月/私有化三档)。
M18:盈亏平衡点
目标:月收入覆盖全成本(含折旧)。若未达,触发收缩方案(转售算力时间、降级云资源、聚焦高毛利客户)。

2.3 后期(18–36 月):规模化扩张 / 多元算力 / 盈利模式

阶段目标

从"算力转售"升级为"算力 + 应用"复合体:多元算力(英伟达/国产/云弹性)对冲供应链与政策风险,垂直场景产品贡献 60%+ 毛利,ROI 转正。

多元算力架构(推荐的后期形态)

算力池定位比例建议理由
英伟达集群(H200/B200 级)高并发生产推理 + 微调40–50%生态最成熟、吞吐最高;B200 单 Token 成本较 H100 降 20 倍[8]
国产算力(昇腾 910C / 寒武纪)推理主力 + 政策合规场景20–30%供应链安全;可申报算力券补贴(深圳模型券最高抵扣 30%)[15]
云弹性池(H100 按需)峰值吸收、地域就近15–20%$2–4/卡时,随用随停,对冲技术换代风险[9]
外部 API 兜底(DeepSeek 等)长尾/超低价场景5–10%2026-08 起 DeepSeek-V4 峰谷定价(输出高峰 ¥27/闲时 ¥13.5),批发转售价差重新打开[63]

四大盈利模式(按毛利从高到低)

模式定价逻辑毛利空间实施要点
① 垂直场景 SaaS按业务价值收费(如客服 Agent 按坐席、内容工厂按篇)60–85%推理成本控制在营收 25–30% 以内(行业经验值)[39];避开与 OpenAI/DeepSeek 直接比价
② 私有化部署 + 数据安全溢价一次性授权 + 年维护费50–70%政企客户对"数据不出域"付费意愿强;Mac/国产卡组合满足合规审查
③ 模型微调 / 定制服务项目制 + 持续推理分成40–60%8B–70B 微调是中小 Token 工厂的差异化入口
④ 算力/Token 批发按 Token 或 GPU 时计费10–30%仅在高利用率 + 批量场景成立(详见 2.5 测算);可叠加地方算力券降低实际成本[15]

关键里程碑(后期)

M24:ROI 转正
累计现金流回正;垂直 SaaS 收入占比 ≥50%;单 Token 成本较中期再降 30%+(规模化 + 优化)。
M30:区域化复制
在西部绿电区(乌兰察布/庆阳等,电价 0.22–0.35 元/度)部署第二节点,PUE ≤1.3。[29]
M36:规模效应
月出货 Token 千亿级;形成"自建保底 + 云弹性 + 国产合规"三角架构;技术换代按 2–3 年折旧周期滚动更新。[33]

2.4 三类投入策略的 ROI 对比

策略累计投入(36 个月)年化收入目标回本周期适合谁
轻资产(云为主)40–120 万30–80 万(纯应用层毛利)18–24 个月个人/小团队;先验证再重投;零硬件折旧风险
标准(自建+弹性)300–900 万300–500 万(垂直 SaaS + 批发组合)约 20–24 个月(需利用率 >70%)[18]有明确客户的创业团队;本报告推荐路径
重资产(规模化)2,000 万–2 亿数千万级3–4 年(参照华为云智算 ROI:基础 4.2 年 / 液冷优化后 3.1 年)[19]有融资能力的机构;对标区域智算中心运营

2.5 单 Token 成本测算模型(核心决策工具,所有假设公开)

假设:70B 级 FP8 模型;vLLM 高并发;硬件按 5 年折旧(GPU 世代 2–3 年,实际按 3 年更保守);西部电价 0.35 元/度;汇率 7.2。产能引用实测基准:单卡 H100 100 并发聚合吞吐 2,400 tok/s。[17]

方案月产能(tokens)月全成本单 Token 成本(元/百万)对标市价结论
Mac Studio M3 Ultra 512GB ×1(单机)约 5,000 万(40 tok/s 聚合 × 24h × 50% 负载)约 2,600 元(折旧 2,062 + 电 46 + 杂项 500)约 50–200 元DeepSeek-V4 输出 ¥13.5–27/百万[63]单机量产无经济性——定位是"容量+安全"而非"便宜"
8 卡 H100 集群(30% 负载)约 149 亿约 6.9 万(折旧 4.2 万 + 电 0.8 万 + 运维 2 万)约 4.6 元接近 DeepSeek 输出价,仅适合高价值场景
8 卡 H100 集群(70% 负载)约 348 亿约 7.9 万(电随负载升至 1.8 万)约 2.3 元(≈$0.32)DeepSeek-V4 输出 ¥13.5–27;B2B 批发 ¥10–20成本优势扩大:约为官方 API 的 1/6–1/12,毛利 80–90%+
纯云 API 转售不限按量约 1.9–7 元(进价)零资产风险,但毛利被上游锁定,适合起步期

测算结论(2026-08 更新):① Mac 不适合做 Token 量产单元(单 Token 成本高出集群 20–100 倍);② 8 卡 H100 集群在 70% 利用率下成本约 ¥2.3/百万 token,而 DeepSeek-V4 官方输出价已涨至 ¥13.5–27(高峰)——自建成本仅为官方价的 1/6–1/12,毛利空间较 2025 年显著扩大;③ 30% 利用率下自建约 ¥4.6/百万,仍低于官方闲时价——利用率依然是 Token 工厂的生死线,但 2026 年的定价环境给了自建模式更大的安全边际。[63][18]

图 4|每百万 Token 成本对比(元/百万 token,对数刻度)

¥1 ¥10 ¥100 8卡H100 @70%利用率 GPT-4o-mini 输出 8卡H100 @30%利用率 DeepSeek-V4 闲时输出 DeepSeek-V4 高峰输出 Mac Studio 512GB 单机 ¥2.3 ≈¥4.3 ¥4.6 ¥13.5 ¥27 ¥50–200 自建成本为本报告测算(假设见 2.5 节);API 价为官方定价([61][63])。灰色条为区间值,深灰为 ¥50–200 的延伸示意

交互式计算器:AI Token 工厂成本测算 离线可用

基于 2.5 节测算模型:拖拽/下拉调整参数,右侧实时输出。模型假设:70B FP8 + vLLM 高并发;H100 整机 19,200 tok/s(100 并发/卡,[17]);H200 按带宽优势保守取 21,000 tok/s;5 年折旧(Mac 3 年);运维与电费按报告口径。数值为估算参考,投产前请用自有 POC 校准。

月产能(token)
月全成本(折旧 + 电费 + 运维)
单 Token 成本(元/百万)
月收入 / 月毛利
回本周期
注:以上为估算模型:产能按 70B FP8 + vLLM 高并发基准推算(cloudai.pt 2026 实测),未计微调训练占用、模型切换损耗、故障冗余;成本未计机房一次性改造、安全设备与合规费用。实际投产前请以自有 POC 数据校准。B300 展望(2026):单卡 288GB/8TB/s 带宽、FP4 原生支持,70B 级高并发吞吐约为 H100 的 1.5–2 倍、同量级成本下单 Token 成本可再降约 40%(估算),但需液冷且对华受管制——可先在计算器中选择"8 卡 B300"对比,投产前以云租实测为准。[75][76]

投资合作与回报方案

面向潜在投资人的合作结构 · 回报测算 · 保障条款
一句话项目定位(对投资人说) 这是"算电协同"的 AI 算力项目:用园区光伏余电(成本 0.36 元/度、低于市电 40%)驱动 GPU 集群生产 Token——把"卖不掉、甚至负电价的电"变成"能赚钱的 AI 算力服务",同时吃下 2026 年算力紧缺 + Token 涨价的双重行业红利。

2.6.0 超前期(种子验证档):低风险入场选项 新增

定位:在正式投资标准档之前,先以 20–50 万元完成技术验证与商务准备——适合"先小额试错、看到结果再重仓"的投资人。对谈投资是极强的风险缓释工具:投失败了损失可控(约一辆车钱),投成了再按标准档追加,且超前期投入按实缴计入总股本

资金用途(20–50 万)金额交付物 / 验证目标
开发验证机3–8 万Mac mini M4 Pro 64GB(约 ¥1.6 万)×1–2 + 云 GPU 验证费上调;预算充足再升级 Mac Studio 512GB(¥74,249)——跑通 vLLM 70B 部署 + API 计费网关,实测真实吞吐与单 Token 成本
云 GPU 验证费5–10 万H100 云租($2–4/卡时)按需验证高并发批处理性能([9]),产出 POC 测试报告
公司注册/资质/备案3–5 万主体设立、ICP/算法备案路径梳理、机房消防与电力合规预审
运营储备(3–6 个月)10–20 万核心团队 2 人、商务差旅(光伏供电协议、客户拜访)

超前期的三个验证里程碑

M1:技术 POC 跑通
70B 级模型 vLLM 部署完成,实测吞吐与单 Token 成本(目标 ≥¥5/百万 以内,接近 2.5 节模型)
M2:资源协议落地
光伏余电供电协议(0.36 元/度锁定)、机房场地方案、电力容量核验完成
M3:付费意向验证
拿到 3–5 个付费意向客户(可签意向书);产出《POC 验证与投产测算报告》

通过 / 不通过的处理:M3 验证通过 → 触发标准档(300–400 万)追加投资,超前期投入按实缴金额计入总股本;不通过 → 云资源停用止损,损失控制在 20–50 万以内,投资方可选择整体退出。

2.6.1 总投资盘子与资金用途

档位总投资资金用途结构适用
超前期(种子验证)20–50 万开发机 8–15 万 + 云 GPU 验证 5–10 万 + 注册备案 3–5 万 + 运营储备 10–20 万(详见 2.6.0)低风险试错;验证通过再触发标准档,投入计入总股本
起步档150–200 万8 卡 H100 整机 250 万 → 压缩为首年云预留(100–150 万)+ 开发机(15 万)+ 运营储备(35 万)先验证再重投,风险最低
标准档(推荐)300–400 万硬件 8 卡 H100/H200 整机 250–320 万(70%)+ 机房/电力/散热配套 40 万(10%)+ 云弹性与运营储备 60 万(20%)一步到位建产能,18–24 个月回本目标
扩张档600–800 万双集群(2×8 卡,可混国产卡)+ 储能试点 + 西部备选节点已有客户基础,直接规模化

注:硬件价格为 2025–2026 年市场价([33][44]);机房配套含机柜、电力改造、散热(液冷加装约 $10–50M/设施 级别按比例折算,[9]);运营储备覆盖 6 个月人力与云弹性费用。

2.6.2 合作模式与股权设计(资源 + 资金入股)

双方投入与对应权益

角色投入作价/权益逻辑
投资方① 现金出资(标准档约 300–350 万)
② 园区机房场地(约 50–100㎡)
③ 光伏余电长期供电(按 0.36 元/度锁定,含价格保护条款)
现金按实缴金额计股;场地按市场租金作价(中山工业厂房 15–25 元/㎡·月,可折股或固定租金);余电按"低于市电 40%"的锁定价计入成本结构,既保障投资方收益又不摊薄运营方技术股
运营方① 技术与运营团队(推理工程/API 平台/客户交付)
② 客户与市场渠道
③ 模型工程与平台知识产权
技术干股参与(建议 25–40%,按投资额与贡献协商);若投资方出资含"隐性资源价值",可约定技术股比例随回本进度递增(详见保障条款)

推荐的收益与股权结构(示例,可协商)

  • 分阶段出资(推荐结构):第一笔 20–50 万(超前期)→ M3 验证通过后追加 250–350 万(标准档)——投资方每一笔钱都对应已验证的里程碑,避免一次性重仓;追加时超前期投入按实缴计入总股本,权益不稀释。
  • 回本前:净利润按出资比例 + 资源成本后,投资方优先回收本金(如净利润的 70% 归投资方直至本金收回,30% 归运营方)——降低投资方风险,谈判更容易通过。
  • 回本后:转入按股分红(如投资方 60% / 运营方 40%),运营方比例可随里程碑达成上调(对赌条款触发)。
  • 资源持续作价:光伏余电按 0.36 元/度、场地按租金,每季度从收入中计提(计入成本),投资方因此获得"现金流型回报",运营方获得"股权型回报",利益绑定且结构清晰。
以上为商业结构建议,非法律意见。正式协议请由律师起草,明确:出资额与到账时间、资源作价方式、分红顺序、知识产权归属、违约与退出条款。

2.6.3 投资回报测算(标准档,行业假设)

指标保守(60% 利用率)中性(70% 利用率)乐观(80% 利用率)
月产能(token)298 亿348 亿398 亿
加权售价(元/百万)¥8(批发为主)¥11(批发+垂直混合)¥14(垂直场景为主)
月收入¥23.8 万¥38.3 万¥55.7 万
月成本(折旧+电+运维+人力)¥12 万¥14 万¥16 万
月净利¥11.8 万¥24.3 万¥39.7 万
回本周期(350 万投入)约 30 个月约 15 个月约 9 个月
3 年累计净利(估)约 380 万约 800 万约 1,300 万

测算基准:8 卡 H100 集群产能 19,200 tok/s([17]);电费按光伏余电 0.36 元/度([72]);折旧 5 年;人力按 2–4 人。售价加权假设见 2.5 节与 2.3 节盈利模式。此为行业假设估算,非承诺;投产 6 个月内以实际 POC 数据替换。

给投资人的回报话术(中性场景):350 万投入,中性预计 15 个月回本、3 年累计净利约 800 万(2.3 倍本金);叠加场地租金与光伏售电原本的收益,投资方综合回报率(含资源回报)高于纯财务投资口径

2.6.4 里程碑、保障与退出条款(可写入协议)

节点承诺内容未达成的处理
超前期 M1–M3POC 跑通 → 资源协议落地 → 3–5 个付费意向(详见 2.6.0)云资源停用止损,损失控制在 20–50 万内;投资方可整体退出
M3技术链路跑通(vLLM 70B 部署 + API 计费系统)可终止合作,按出资比例清算,运营方退还开发期费用
M6MVP 上线 + 首批 3–5 个付费客户调整市场策略;投资方有权要求转为纯云轻资产模式
M18盈亏平衡(月收入 ≥ 月全成本)触发"保本优先":净利润 80% 归投资方直至本金收回
M36ROI 转正(累计现金流回正)运营方技术股比例按协议递增(对赌兑现)
退出3–5 年,投资方有权要求回购按"净资产或年净利 ×3–5 倍"孰高回购;运营方享有优先购买权

2.6.5 与投资人沟通要点(一页纸口径)

  • 为什么是现在:算力紧缺(H100 租价 +20%)、Token 涨价(DeepSeek 输出价 350%↑)、资本开支上台阶(2026 全球 $7,100 亿)——三周期共振窗口。
  • 为什么是我们:独有的"光伏余电 + 园区场地"资源禀赋(电费省 40%、负电价时段免费),把别人最大的成本项(电力)变成自己的护城河。
  • 为什么赚钱:自建单 Token 成本 ¥2.3 vs 官方售价 ¥13.5–27(毛利 80%+);垂直场景 SaaS 进一步锁定毛利(60–85%)。
  • 为什么风险可控:轻资产起步备选、云弹性兜底、里程碑对赌、退出回购条款——投资方的本金保护优先于一切。
  • 演示工具:本报告内置交互式计算器与光伏场景测算,可现场拖动参数验证任何假设(含投资方的疑问场景)。
PART 3

第三部分 硬件选型对比

Mac(Studio / Pro)vs 服务器 GPU 集群(A100 / H100 / H200)

3.1 两大战术的核心差异:容量与带宽的错位

LLM 推理是显存带宽瓶颈型任务:生成每个 Token 都要读一遍全部权重(70B Q4 量化 ≈ 42GB)。因此衡量推理硬件的两个核心指标是显存(装得下多大模型)带宽(每秒能吐多少 Token)

  • Mac 阵营(统一内存):入门级 Mac mini M4 Pro 64GB(273GB/s,约 ¥1.6 万)已能本地跑 70B Q4(9–11 tok/s),是超前期开发机的高性价比选择[82];往上走,M3 Ultra 最高 512GB 统一内存,官方称可完整在内存中运行 6,000 亿参数级模型[16],实测 DeepSeek-R1 671B Q4(448GB)、V3-0324 685B 4bit 均可在单机运行,这是任何单卡 GPU 做不到的。2026 年新品 M4 Ultra(最高 192GB)速度更快但容量上限收窄,Mac Pro 已停产[77]。带宽 819GB/s(M3 Ultra)——约为 H100(3.35TB/s)的 1/4。[40]
  • GPU 服务器阵营:带宽猛兽——H100 SXM5 带宽 3.35TB/s、H200 达 4.8TB/s,配合 vLLM 等推理引擎的连续批处理,单卡 100 并发可达 2,400 tok/s,是 Mac 单机(15–30 tok/s)的 80–160 倍[17][41]
  • 结论先行:Mac 赢在"一次装下超大模型 + 数据不出设备 + 低功耗静音";GPU 集群赢在"吞吐、并发、扩展、生态"。两者不是替代关系,是互补关系。

3.2 详细规格与实测性能对比表(2025–2026 最新数据)

维度Mac mini M4 Pro 64GB(小主机)Mac Studio M3 Ultra(512GB)Mac Studio M4 Ultra(192GB,2026 新品)A100 80GB SXMH100 SXM5 80GBH200 SXM 141GBB300(Blackwell Ultra,2026 主力)
市场价(2026)$2,199(64GB 顶配,约 ¥1.6 万);M4 基础版 $599 起[82]$11,699 / ¥74,249(512GB+1TB)[34]$1,999 起;192GB 高配约 $5,000–9,000+[77]云租 $0.66–4/卡时[9]新卡 $35–40K;二手 $6–22K;云租 $1.85–4.5/卡时(2026H1 租价回升 20%)[33][43][66]$38–45K;渠道 $45–50K[44]单卡约 $53K(无零售,随整机);云租 $7.1–17.8/卡时[75][76]
内存/显存64GB 统一内存512GB 统一内存最高 192GB 统一内存[77]80GB HBM2e80GB HBM3141GB HBM3e288GB HBM3e(单卡可装 200B+ 模型)
内存带宽273GB/s(M4 Pro;基础 M4 为 120GB/s)[82]819GB/s[40]800GB/s(实测 806GB/s,M2 Ultra 的 1.8 倍)[77]2.039TB/s3.35TB/s4.8TB/s8TB/s(H200 的 1.7 倍)
算力(FP16/FP8)20 核 GPU(M4 Pro)约 24 TFLOPS(GPU 部分)80 核 GPU(双 M4 Max 融合)312 TFLOPS(FP16)990(FP16)/ 1,979(FP8 稠密)同 H100(FP8 1,979)FP8 2,250 TFLOPS(稠密)+ 原生 FP4(推理 2× FP8)
70B 模型生成速度9–11 tok/s(Q4/MLX,单用户)[82]15–30 tok/s(Q4/MLX,单用户)[48]与 M3 Ultra 同级(带宽相近;单用户 20–35 tok/s,估算)[77]约 56 tok/s(单流)[50]120 tok/s 单流;2,400 tok/s @100 并发[17]≥H100(KV 缓存更足)高并发吞吐显著高于 H100(带宽 2.4×,估 3,000+ tok/s @100 并发);单卡直跑 200B+
可承载最大模型70B Q4(约 40GB,紧);30B Q5 舒适[82]671B Q4 / 685B 4bit 单机可跑[51]100B 级(70B Q8 / 405B 极限量化)[77]70B FP8(紧)70B FP8(KV 仅剩 ~10GB)[37]70B FP8 + 大 KV;单卡替代 2×H100单卡 200B+ / 1T 级 MoE 分片,无需跨卡分片
功耗(满载)65–100W(安静)约 215W 实测[52]约 200W(跑 671B 实测)[77]400W700W700W1,400W(必选液冷)
每瓦性能(70B 推理)约 0.11 tok/s/W(估算)约 0.065 tok/s/W[53]约 0.07–0.11 tok/s/W(估算)0.17 tok/s/W(单流)
互连扩展Thunderbolt 5Thunderbolt 5(80–120Gbps,RDMA 实验性集群)[54]NVLink 4 900GB/s + InfiniBand 400Gb/s 组网[41]NVLink 5 / GB300 NVL72 机架(72×B300,21TB HBM3e,~132kW)[75]
部署环境桌面静音,巴掌大小桌面/办公环境,静音数据中心:液冷/风冷、700W 供电、机柜散热数据中心液冷必选(80–120kW/柜时代)
工具链MLX / llama.cpp / OllamaMLX / llama.cpp / Ollama / ExoCUDA / vLLM / SGLang / TensorRT-LLM(生产级)同左 + FP4 推理栈

8 卡整机对比:DGX H100($250–460K / 640GB / ~10kW)|DGX H200($400–500K / 1.1TB / ~7kW)|DGX B300($300–350K / 2.3TB / ~14.5kW / FP4 144 PFLOPS,2026 年出货,对华受管制)[75][76]。注:单流速度指单用户连续生成;聚合吞吐指多并发批处理。Mac 实测数据来自 MLX/llama.cpp 社区基准(omlx.ai、insiderllm、Jeff Geerling 等);GPU 数据来自 NVIDIA 官方规格 + cloudai.pt 2026 vLLM 实测。Mac Pro(M2 Ultra)已于 2026 年 3 月正式停产,由 Mac Studio M4 Ultra 顶替[77];标"估算"的为基于带宽/算力推算,非实测。

3.3 单 Token 成本与性价比专项测算

核心结论:按"每百万 Token 全成本"排序——8 卡集群(高利用率)< H100 云租(含利润)< 8 卡集群(低利用率)< Mac 单机 << Mac 集群。Mac 的性价比体现在"每万元能买到的内存容量"而非 Token 产量:

购买对象价格可运行模型每万元内存单 Token 成本(70B)
Mac mini M4 Pro 64GB约 ¥1.6 万70B Q4(紧)/ 30B Q5 舒适40GB/万元单 Token 成本高于集群;适合开发与超前期验证
Mac Studio M3 Ultra 512GB¥74,249671B Q4 / 685B 4bit6.9GB/万元50–200 元/百万(量产无优势)
H200 单卡约 ¥28–33 万70B FP8 + 大 KV0.43GB/万元单卡难支撑规模化,多卡才有意义
8 卡 H100 整机约 ¥180–330 万多租户并发0.24GB/万元(640GB)约 2.3 元/百万(70% 利用率)
换算依据:512GB ÷ 7.42 万 ≈ 6.9GB/万元;141GB ÷ 约 30 万 ≈ 0.47GB/万元(H200 单卡)。"每万元内存"衡量的是"花同样的钱,谁能装下更大的模型"——这正是 Mac 统一内存的杀手锏。

3.4 扩展性与运维现实(常见误区澄清)

议题Mac 阵营GPU 服务器阵营
多机集群Thunderbolt 5 RDMA 已可实现 4 机 1.5TB 统一内存池(macOS 26.2 + Exo),实测 Qwen3 235B 达 31.9 tok/s、Kimi K2 Thinking 25 tok/s@280W——但 TB5 无交换机只能菊花链、节点数受限、实验性质,Geerling 本人称"无法为这笔钱找到合理理由"[54][56]NVLink(900GB/s/卡)+ InfiniBand(400Gb/s)+ NVSwitch,8 卡至 72 卡(GB200 NVL72 机架)成熟扩展;生产唯一主流路径[41]
4 机 Mac 集群成本约 $40,000(2×512GB + 2×256GB)≈ ¥29 万——1.5TB 内存确实便宜(每 GB 约 ¥193)1.5TB 显存等价配置需 8–10 卡 H200/B200,成本 $380K+ ≈ ¥270 万+
故障与运维整机更换即可,无需机房;但高负载偶发系统崩溃[56]GPU 故障率高发、需备件库与 7×24 值守;参考深圳万卡昇腾集群故障率 0.3‰ 级别[26]
噪音/物理环境静音桌面设备,办公室可用8 卡整机噪音 90dB+,必须机房
云替代无(Mac 云实例极少见)完整:H100 $1.85–4.5/卡时、H200 $3.5–4.5、B200 $4–6[43]

3.5 选型建议:按规模与场景的决策矩阵

你的情况推荐方案预算参考理由
个人开发者 / 起步验证(日 Token 量 <1,000 万)Mac mini M4 Pro 64GB(约 ¥1.6 万)起步 + 云 GPU 按需 + 外部 API 兜底;需求升级再上 Mac Studio 512GB3–25 万一台 mini 即跑 70B Q4(9–11 tok/s)[82],数据安全、零机房成本;验证期不沉淀 GPU 资产
小团队 / 内部工具(日 1,000 万–1 亿)Mac 开发机 + 1 台 8 卡 H100(或长期云预留)200–350 万(或云年付 100–150 万)70% 利用率下自建成本约 ¥2.3/百万 token,约为官方 API 1/7;云预留对冲利用率不足风险[18]
商业 Token 工厂(日 1 亿+)8 卡 H100/H200 集群起步,H200 优先(长上下文/大 KV);预算充足可选 B300(单卡 288GB 直跑 200B+,省跨卡分片)300–1,000 万H200 单卡替代 2 张 H100、KV 充足支撑高并发;B300 单 Token 成本更低但需液冷且对华受管制[37][75]
政企 / 数据敏感 / 合规场景Mac(本地开发)+ 国产算力(昇腾 910C)集群按需数据不出域 + 供应链合规 + 可申报算力券(最高抵扣 30%)[15][25]
研究 / 超大模型试验(671B+ 级)Mac Studio 512GB ×2–4(RDMA 集群)15–30 万唯一能在桌面上跑 671B 级 MoE 的方案;实验性质,不建议承载生产 SLA[54][56]
规模化生产(多集群)GPU 集群(H200/B200)+ 云弹性池 + 国产合规池1,000 万+吞吐、扩展、生态三要素只有 GPU 集群齐备;Mac 退出生产位,退居开发/试验位[41]

3.6 推荐混合部署方案(三池架构)

客户端 / API 网关(路由 · 计费 · 限流) 开发试验池 Mac Studio 512GB ×1–2 模型评测 · 私有数据推理 671B 级超大模型 · POC 演示 约 ¥15 万 · 215W 生产算力池 8 卡 H100/H200 集群 高并发推理 · 批量生成 微调 · vLLM 生产服务 约 ¥250–500 万 · 10kW 弹性缓冲池 云 GPU($2–4/卡时) 外部 API(DeepSeek 等) 峰值吸收 · 新模型试水 纯变动成本 · 随用随停 模型服务 · 计费结算 · 监控告警 调度逻辑:常规请求 → 生产池(成本最低);突发峰值 → 弹性池;数据敏感请求 → 强制本地池(Mac / 国产卡);长尾低价 → 外部 API
点击上方任意算力池卡片,查看该池的定位、成本与适用场景
构成职责成本特征
开发试验池1–2 台 Mac Studio 512GB(约 ¥15 万)模型评测、私有数据推理、超大模型试验、演示 POC、客户现场部署原型一次性投入低;电费几乎可忽略(215W)
生产算力池自建 8 卡 H100/H200 集群(约 ¥250–500 万)主力推理:70B–405B 级、高并发 API 服务、批量生成、微调固定成本主导;70%+ 利用率时单 Token 成本最低
弹性缓冲池云 GPU($2–4/卡时)+ 外部 API(DeepSeek 等)峰值吸收、地域就近、新模型快速试水、兜底 SLA纯变动成本;随用随停,对冲技术换代[9][38]

流量调度逻辑:API 网关按"优先级 + 成本 + 时延"路由——常规请求进生产池(成本最低);突发峰值溢出到弹性池(贵但零等待);超长尾/超低价场景直连外部 API(避免自建资源空转)。数据敏感请求强制落在本地池(Mac 或国产卡),满足合规。这一架构兼顾成本、弹性与合规,是 2025 年行业共识的形态。

选型红线(结合市场数据的提醒)

  • 不要用 Mac 集群扛生产并发:TB5 菊花链无交换机、节点受限,吞吐远低于 GPU 集群,Geerling 实测 4 机集群性能甚至低于单机场景。[56]
  • 不要在高位囤 H100 新卡:2023 年二级市场曾炒到 $80–120K/张,2025 年二手已跌至 $6–22K(较峰值 -85%)——市场证明"囤卡"是高风险动作。[33]
  • 不要忽视合规:H20 政策一年内三次反转(禁售→解禁→停产的教训);面向政企的 Token 工厂必须准备国产算力替代路径。[21]
  • 不要把"每瓦性能"当唯一指标:Mac 每瓦性能虽优,但产量绝对值低;每瓦 × 每卡吞吐 × 总装机量才是收入公式。

3.7 光伏余电 + Token 工厂:广东中山工业园场景测算 离线可用

场景:工业园屋顶光伏在白天午间存在大量"消纳不完"的余电(广东现货市场已出现负电价时段,午间电近乎白给 [73])。把余电喂给 GPU 集群做批处理推理/微调,是典型的"算电协同"——电费从"卖不掉"变成"直接创造收入"。拖动滑杆测算:

可支撑 8 卡 H100 机柜数(70% 利用率)
对应光伏装机规模(1MW ≈ 年发 105 万度,中山 1000–1100h)
月电费节省 vs 全用市电
8 卡整机月电费:光伏价 / 市电价

落地要点(结合中山实际)

  • 电力账算得过来吗?:广东 2025-11-01 起新能源电量全面入市,增量项目机制电价 0.36 元/度、存量 0.453 元/度,2026 年度交易均价下限暂定 0.372 元/度 [72][73];余电自用的机会成本 ≈ 上网价(0.36–0.45),比市电(0.6–0.8)低 40% 左右,且午间负电价时段≈免费。
  • 光伏出力的时间窗口:中山年等效利用小时约 1000–1100h(1MW 年发电约 100–110 万度),白天午间为发电高峰——把微调、批量生成、数据蒸馏这类可中断任务排到午间,与 DeepSeek 峰谷定价是同一套逻辑 [63]
  • 夜间无光怎么办:推理是 7×24 业务,机柜需市电兜底或配储能;可先用光伏电做"边际产能",市电做保底,避免电力配额成为瓶颈。
  • 物理与合规前提:需核实园区变压器容量、并网容量、机房消防备案;中山属湿热气候,机柜散热建议液冷或加强空调,夏季 PUE 会偏高(全国超大型设施均值 1.34 [4])。
  • 政策红利:广东是虚拟电厂与需求响应先行区,自备储能/可调负荷未来可参与现货套利;叠加报告 1.5 节的算力券政策可进一步降本 [15]
APPENDIX A

附录 A:关键指标对比总表

A0. 2026 年 H1 最新数据速查(本版新增)

指标数值时点来源
英伟达单季营收$816 亿(+85%);数据中心 $752 亿(+92%)FY27Q1(2026-05 发布)NVIDIA 官方 [64]
北美四大云 capex单季 $1,316 亿(+70%);2026 全年指引约 $7,100 亿;2027 预计超 $1 万亿2026Q1各公司财报/券商整理 [67]
中国智能算力规模1,882 EFLOPS(FP16)2026Q1信通院 [66]
中国 AI 算力需求增速+417%(供给仅 +128%)2026Q1信通院 [66]
DeepSeek-V4 输出价高峰 ¥27 / 闲时 ¥13.5(较此前 ¥6 涨 350%)2026-08-17 生效DeepSeek 官方 [63]
H100 租赁价变动年初至今 +20%;A100 +15%2026H1英伟达 CFO 电话会 [65]
中国算力网投资"十五五"新增直接投资 4 万亿元;首个全国产十万卡集群落地郑州2026国家发改委/华夏时报 [68]
Token 日消耗量OpenAI 日调用 21.6 万亿词元;豆包日调用超 120 万亿词元2026信通院 2026 报告 [70]

A1. 市场规模与增速

指标数值年份/时点来源
全球数据中心系统支出$5,060 亿(+51.6%)→ $8,220 亿(+62.5%)2025 实际 → 2026EGartner 2026-07 [78]
全球 AI 基础设施支出$474 亿(+97%,半年)→ 2028E $2,230 亿2024H1 → 2028EIDC [3]
全球 AI 推理市场$1,061.5 亿 → $2,549.8 亿(CAGR 19.2%)2025 → 2030EMarketsandMarkets [6](Grand View 口径相近 [57]
中国智能算力市场$190 亿(+86.9%)2024IDC(信通院引用)[58]
中国智算规模49.3 万 PFLOPS → 159 万 PFLOPS(FP16),全球第二2024 末 → 2025 末国家数据局 [4]
全国万卡级智算集群42 个;智算中心超 250 个2025国家数据局 / 信通院 [4][14]
全球大模型数量3,755 个(中国 1,509 个 / 40.2%)2025-06信通院 [59]
超大规模云 capex$2,590 亿 → $4,140 亿 → $5,310 亿(预计)2024 → 2025 → 2026EBloomberg / Guinness GI [60]

A2. Token 成本与定价

指标数值时点来源
GPT-3.5 级推理成本降幅$20 → $0.07/百万 token,降 280 倍2022-11 → 2024-10Stanford AI Index 2025 [7]
GPQA>50% 模型推理成本降幅$15 → $0.12/百万 token,降 125 倍2024-05 → 2024-12Stanford AI Index 2025 [7]
GPT-4o-mini API 价$0.15 / $0.60(输入/输出,百万 token)2024-07OpenAI 官方 [61]
DeepSeek-V3 API 价$0.27 输入(缓存未命中)/ $1.10 输出2024-12DeepSeek 官方 [62]
DeepSeek-R1 API 价¥4 输入(未命中)/ ¥16 输出2025-01DeepSeek 官方 [38]
B200 vs H100 单 Token 成本降 20 倍;吞吐 21,088 vs 844 tok/s2025-02英伟达官方 [8]
H100 云租价$7–10 → $2–4/卡时(峰值跌 60%+)2023 → 2025Silicon Data / wiki 汇总 [9]
自建 8 卡 H100 单 Token 成本约 ¥2.3/百万(70% 利用率,估算)2026 测算本报告测算模型(2.5 节)

A3. 硬件核心指标速查

指标Mac mini M4 Pro 64GBMac Studio M3 Ultra 512GB / M4 Ultra 192GBA100 80GBH100 SXM5H200 SXMB300(2026 主力)
价格(2026)$2,199(约 ¥1.6 万)[82]$11,699 / ¥74,249(M3U)[34];M4U $1,999 起[77]云租 $0.66–4/时 [9]$35–40K 新卡 [33]$38–45K [44]约 $53K/卡;云租 $7.1–17.8/时 [75][76]
内存/显存64GB 统一内存512GB / 192GB 统一内存80GB80GB141GB288GB
带宽273GB/s819 / 800GB/s2.04TB/s3.35TB/s4.8TB/s8TB/s
70B 生成速度9–11 tok/s(单用户)[82]15–30 / 20–35 tok/s(单用户)[48][77]≈56 tok/s 单流 [50]120 tok/s 单流 / 2,400 tok/s @100 并发 [17]≥H100(KV 更足)[37]高并发超 H100(带宽 2.4×)
最大模型承载70B Q4(紧)671B Q4(M3U)/ 100B 级(M4U)[51][77]70B FP8(紧)70B FP870B FP8 + 大 KV [37]单卡 200B+ [75]
功耗65–100W≈215 / ≈200W 实测 [52][77]400W700W700W1,400W(液冷必选)
扩展性TB5TB5 菊花链(实验)[54]NVLink 900GB/s + InfiniBand 400Gb/s(生产级)[41]NVLink 5 / GB300 NVL72 机架 [75]

A4. 投入规划速查

阶段时间预算(标准档)关键里程碑退出/止损条件
前期(验证)0–6 月150–350 万M1 技术跑通;M3 种子客户;M6 决策评审M6 利用率 <40% → 转纯云策略
中期(扩容)6–18 月+300–800 万M9 双集群;M12 ≥30 客户;M18 盈亏平衡M18 未平衡 → 聚焦高毛利客户
后期(规模化)18–36 月1,000–3,000 万M24 ROI 转正;M30 西部节点;M36 千亿 Token/月
APPENDIX B

附录 B:完整数据来源列表

编号与正文上标 [n] 一一对应。数据检索与核实时间:2026 年 8 月。部分来源为二手转载(已在正文标注),建议关键决策数据以一手来源为准。

官方机构与权威报告(一手来源)

  1. [1] Gartner:Worldwide IT Spending to Grow 7.9% in 2025(2025-07)
  2. [2] Gartner / CIO.com:AI 优化服务器支出超传统服务器(2025-07)
  3. [3] IDC:AI Infrastructure Spending Press Release(2025-02-18)
  4. [4] 国家数据局:《数字中国发展报告(2025年)》(2026-06 发布;转载:digitalchina.gov.cn
  5. [5] Gartner:2028 年 80% 数据中心加速器用于推理(2025 年预测,经 AAAI 2026 论文引用)
  6. [6] MarketsandMarkets:AI Inference Market(2025-02);[57] Grand View Research:AI Inference Market Report(2025-05)
  7. [7] Stanford HAI:AI Index Report 2025(与 Epoch AI 合作)
  8. [11] NVIDIA:FY2025 Q4 & Full Year Results(2025-02-26)
  9. [12] NVIDIA FY2026 财报(2026-02,经 21 世纪经济报道转载:报道链接
  10. [14] 中国信通院:《2025 综合算力指数》(2025 中国算力大会);[59] 《综合算力指数蓝皮书(2025年)》:PDF
  11. [16] Apple Newsroom:Mac Studio M3 Ultra 发布(2025-03-05,512GB 统一内存 / 6000 亿参数)
  12. [22] 工信部等六部门:《算力基础设施高质量发展行动计划》(2023-10)
  13. [24] AMD:2025 Q3 财报(2025-11-04,OpenAI 6GW 合作)
  14. [26] 观点网/深圳发布:全国首个万卡昇腾 910C 超节点(故障率 0.3‰)
  15. [27] 寒武纪 2025 年度业绩快报(2026-02-27,营收 +453%):上海证券报
  16. [38] DeepSeek 官方 API 文档:R1 发布与定价(2025-01-20,¥4/¥16);[62] V3 定价($0.27/$1.10)
  17. [58] IDC《中国人工智能计算力发展评估报告》2024 数据(经中国信通院《人工智能算力基础设施赋能研究报告(2025年)》引用)
  18. [61] OpenAI 官方 API 定价(GPT-4o-mini $0.15/$0.60,2024-07)

行业研究与媒体来源(可核实,部分为转载)

  1. [8] 证券时报:英伟达发布 DeepSeek-R1-FP4,B200 单 Token 成本降 20 倍(2025-02-25)
  2. [9] artificial-intelligence-wiki:GPU Cloud Comparison 2025(各云公开标价汇总);Silicon Data:H100 Rental Price Over Time
  3. [10] RBC BlueBay 研报转载 Morgan Stanley 电力数据:AI: Paradigm Shift or Bubble(2025)
  4. [13] IDC 中国 AI 加速卡出货数据(经行业报告转载:2025 年中国 AI 芯片格局;昇腾 81.2 万颗:报道
  5. [15] 南方财经 21 世纪经济报道:深圳模型券与地方算力补贴政策(2025-07)
  6. [17] cloudai.pt:vLLM vs TensorRT-LLM vs SGLang H100 基准(2026,H100 70B 100 并发 2,400 tok/s)
  7. [18] GMI Cloud:H100 2025 Buy vs Rent(盈亏平衡 60–70% 利用率;厂商口径);[36] gpu.fm:GPU Server Pricing Guide(20 个月回本)
  8. [19] sparkco.ai:华为云 10MW 智算中心 TCO 模型(CAPEX $48.3M/MW,ROI 4.2 年 / 优化 3.1 年;模型化测算)
  9. [20] Bancara:AI CapEx 与泡沫争论综述(含美银 54% 调查);[32] remio.ai:纳德拉"芯片插不上电"发言
  10. [21] 光明网:H20 芯片解禁怎么看(2025-07,含 55 亿美元减值)
  11. [23] aitooldiscovery:Hyperscale Data Center Cost(Turner & Townsend 指数 $10.7M/MW);[35] aicerts(美银估算):全口径 $37.6–38M/MW
  12. [25] kocka.news:昇腾 910C 技术分析(推理约为 H100 60%)
  13. [28] IDC 中国 AI 加速卡市场(2025 出货 400 万张、英伟达 55.22%、国产首破 40%,经券商行业报告转载)
  14. [29] 虎嗅:数据中心电价与选址分析;财联社:"Token 之都"乌兰察布(电价 0.35 元/度)
  15. [30] 21 世纪经济报道:美国 2024-12 对华半导体管制升级(含 HBM)
  16. [31] 摩根大通芯片自给率测算(34% → 2027E 82%,经光明网 2025-07 引用)
  17. [33] RunPod:NVIDIA H100 价格指南(新卡 $35–40K、二手 $6–22K、2023 峰值 $80–120K);[43] GMI Cloud / gpu.fm:云租价汇总
  18. [34] 新浪财经:Mac Studio M3 Ultra 512GB 国行售价 ¥74,249 / ¥108,749(2025-03)
  19. [37] aitechconnect:vLLM 生产部署手册(70B FP8 ≈70GB、H200 替代 2×H100)
  20. [39] startups.com:Inference Cost 行业综述(推理成本占营收 25–30% 经验值)
  21. [40] computingforgeeks:统一内存 vs 显存(推理带宽瓶颈分析)
  22. [41] gpusmith:NVIDIA 数据中心 GPU 规格对比;[45][46] ima.qq(AIDC 行业研究转载):H200 $38–45K、DGX 整机 $250–460K
  23. [42] Macworld:Mac Pro 2023 定价;[55] 新浪:Mac Pro 停产(2025)
  24. [44] cyfuture.cloud:H200 渠道价 $45–50K(2025 年中)
  25. [47] Apple Newsroom HK:Mac Studio / Mac Pro M2 Ultra(800GB/s)
  26. [48] insiderllm:Mac Studio 本地 AI 实测(M3 Ultra 70B Q4:25–30 tok/s)
  27. [49] willitrunai:M2 Ultra 128GB 跑 70B(估算模型,非实测);[50] aitot.net 推理基准(估算模型)
  28. [51] specpicks:M3 Ultra vs RTX 5090(671B Q4 18 tok/s、每瓦性能对比)
  29. [52] thinkdifferent.blog:Mac Studio 功耗实测(待机 ~10W / 负载 150–270W)
  30. [53] specpicks:M3 Ultra 70B 每瓦性能 0.065 tok/s/W 推算
  31. [54] Jeff Geerling:1.5TB VRAM on Mac Studio(RDMA over Thunderbolt 5,2025-12)
  32. [56] AppleInsider:Mac 集群 RDMA 评测(Qwen3 235B 31.9 tok/s、局限分析)

2026 年最新数据来源补充

  1. [63] DeepSeek 官方:V4 全系 API 峰谷定价公告(2026-08-13 发布,8-17 生效;南都·湾财社)澎湃新闻:V4 定价上调详情(V4-Pro-0813 发布)
  2. [64] NVIDIA:FY27Q1 财报(2026-05-20,营收 $816 亿 / 数据中心 $752 亿)财报电话会实录("Token 现在能够盈利")
  3. [65] 上海证券报/中国证券网:英伟达 FY27Q1 报道(2026-05-22,H100 租价 +20%、A100 +15%、Vera Rubin 计划)
  4. [66] 中国信通院何宝宏(CCTV 采访):2026Q1 中国智能算力 1,882 EFLOPS 与算力网建设(2026-06);华夏时报(2026-08):2026Q1 算力需求 +417% vs 供给 +128%
  5. [67] 中信建投:北美四大 CSP 2026Q1 资本开支合计 $1,316 亿(+70%)、全年约 $7,100 亿(2026-05);兴业证券(2026-05):谷歌/微软全年 capex 增速 102%/129%
  6. [68] 华夏时报:"十五五"算力网 4 万亿投资、政治局"六张网"、郑州十万卡集群、庆阳集群 185.5 EFLOPS(2026-08)
  7. [69] IDC:2026 年中国智能算力规模预测 1,460.3 EFLOPS(为 2024 年两倍;华夏时报/今日头条 2026-08 引用)
  8. [70] 中国信通院:《智能算力服务研究报告(2026年)》(2025 年中国智能算力服务市场超 1,300 亿元、全球 AI 优化服务器市场 $2,800 亿、OpenAI 日调用 21.6 万亿词元、豆包日调用超 120 万亿词元;川观智库快讯转载)
  9. [72] 广东省发改委/省能源局:《关于公布 2025 年新能源项目机制电价竞价结果的通知》(粤发改价格函〔2025〕2137 号,分布式光伏机制电价 0.36 元/kWh);人民日报:广东推进新能源上网电价市场化改革(2026-01)
  10. [73] 21 世纪经济报道:大湾区分布式光伏:全面入市、负电价、2026 年度交易均价下限 0.372 元/kWh(2026-07)
  11. [74] 中山光伏行业数据(行业媒体口径,供参考):年等效利用小时约 1000–1100h、2025 年分布式光伏新增备案超 300MW(链接
  12. [75] NVIDIA B300/DGX B300/GB300 规格与价格:DGX B300 对比表B300 单卡 $53K / 288GB HBM3e / 8TB/s(2026)
  13. [76] B300 云租价与供货:$7.1–17.8/卡时(2026-08)预留 $5.65/时、TDP 1400W;百度爱企查:B300 2026 年初出货、7 月向客户交付
  14. [77] Apple Mac Studio M4 Ultra 与 Mac Pro 停产:M4 Ultra 规格(192GB 统一内存、80 核 GPU)Mac Pro 2026-03 正式停产统一内存对比(M4 Ultra 约 200W 跑 671B)
  15. [78] Gartner:Worldwide IT Spending to Grow 14.2% in 2026(2026-07-27,数据中心系统 2025 实际 $506B/+51.6% → 2026E $822B/+62.5%)2026-04 版(2026E $788B/+55.8%)
  16. [79] OpenAI 用户与 API 数据(2026):The Information《OpenAI's ChatGPT Nears 1 Billion WAU》(2026-07-28,周活 9 亿→近 10 亿);Reuters:ChatGPT 周活 9 亿(2026-02)、月活超 10 亿(2026-06);axis-intelligence:API 150 亿 tokens/分钟(2026-03)
  17. [80] AMD:2026Q1 财报(2026-05-05,数据中心 $58 亿 +57%;Meta 6GW 合作;MI450 下半年量产)
  18. [81] Polaris Market Research:AI Inference Market(2026-04,2025 $1,060 亿 → 2026E $1,262 亿,CAGR 19.4%)
  19. [82] Mac mini M4 Pro 规格与推理实测:64GB/273GB/s、70B Q4 约 9–11 tok/s(2026)价格阶梯:M4 $599 / M4 Pro 24GB $1,399 / 48GB $1,799 / 64GB $2,1992026 年 mini 主机 LLM 对比(70B 9–11 tok/s)

补充来源(正文涉及但未编号)

数据质量分级说明

  • 一级(高可信)官方财报/官方 API 定价/政府报告/国际权威机构(Gartner、IDC、斯坦福 HAI、信通院、国家数据局)——正文主引用。
  • 二级(可核实)权威媒体与专业网站(21 财经、证券时报、媒体转载 IDC 数据、cloudai.pt 等基准站)——已标注转载属性。
  • 三级(谨慎)厂商自营博客(GMI Cloud、ertas、Ariax 等,营销立场)、估算模型站(willitrunai、aitot)、中国咨询机构营销页(研精毕智、IIM)——仅作趋势/框架参考,不单独支撑结论。
报告生成说明:本报告基于公开网络数据整理,数据检索与交叉验证完成于 2026-08-17。由于部分 2026 年数据为最新披露(如英伟达 FY2026 财报、数字中国发展报告 2025),个别转载来源未及与一手渠道逐条比对,请以来源链接中的原始文档为准。