项目定位:算电协同的 AI 算力项目。用园区光伏余电(成本 0.36 元/度、低于市电 40%)驱动 GPU 集群生产 Token——把"卖不掉、甚至负电价的电"变成"能赚钱的 AI 算力服务",同时吃下 2026 年算力紧缺 + Token 涨价的双重行业红利。
| 项目 | 金额 / 区间 | 说明 |
|---|---|---|
| 总投资 | 约 350 万元 | 8 卡 H100 整机 250 万 + 机房/电力配套 40 万 + 运营储备 60 万 |
| 年收入 | 250–450 万 | 60–70% 利用率;B2B 批发 + 垂直场景组合定价 ¥8–12/百万 token |
| 年净利 | 150–300 万 | 扣折旧、电费(光伏价)、运维与人力 |
| 回本周期 | 18–24 个月 | 乐观 18 个月(70% 利用率);保守 24–30 个月(60% 利用率) |
| 敏感性 | — | 利用率每 ±10% ≈ 年净利 ±60 万;电费每 ±0.1 元/度 ≈ 年 ±3 万 |
可选超前期(种子验证档):20–50 万先做 POC 验证(Mac 开发机 + 云 GPU 跑通 70B 部署、锁定光伏供电协议、拿到付费意向),M3 验证通过再追加标准档——投资方可低风险试水,投入按实缴计入总股本(详见 2.6.0)。
本版在 2025 年数据基础上,补入 2026 年上半年最新披露,行业出现三个关键反转:
对报告结论的影响:第二部分"纯卖 Token 不成立"的判断需微调——2026 年下半年起,算力/Token 批发模式的毛利空间正在回升(DeepSeek 官方输出价 ¥13.5–27/百万 vs 自建成本约 ¥2.3/百万),"卖 Token"重新成为可行业务线,但垂直场景溢价依然是更稳健的主航道。硬件选型结论不变。
本报告所有数据均来自公开来源并在正文标注编号([n]),文末附录 B 给出完整来源列表与 URL。部分市场预测数字(如推理市场规模)因机构口径不同差异较大,已注明出处与统计口径;涉及厂商自营博客、二手转载的数据已标注"营销口径/需核实"。所有单 Token 成本、ROI 测算均为基于公开假设的估算模型,用于方案比较而非精确财务预测,具体参数已在相应章节列出。
工信部等六部门 2023 年《算力基础设施高质量发展行动计划》提出的 2025 年目标(算力 300+ EFLOPS、智能算力占比 35%)已被大幅超额完成(智算 788 EFLOPS、智能算力占比 81%)。"东数西算"八大枢纽 2025 年新增算力占全国新增的 80% 以上,枢纽间 20ms 时延圈基本实现。[4][22] 这意味着:国内算力供给的"硬件荒"正在缓解,竞争重心转向"谁能把算力高效转化为可销售的 Token 服务"。
2024–2025 年出现罕见组合:Token 售价暴跌(API 价格战)+ 算力资本开支暴涨(数据中心建设成本 $20M+/MW,较传统设施溢价约 2 倍)。[9][23] 这意味着:上游(芯片/电力/机房)吃走大部分利润,中游(Token 生产与转售)毛利率被持续挤压。对"AI Token 工厂"的启示:单纯做"买卡 → 出 Token → 卖 Token"的中间商模式在 2026 年已无利可图,必须向"垂直场景应用溢价""私有化数据安全溢价""微调/定制服务溢价"三层价值叠加演进(详见第二部分)。
| 玩家 | 关键数据(2024–2025) | 定位判断 |
|---|---|---|
| 英伟达 | FY2025(截至 2025-01):营收 $1,305 亿(+114%),数据中心 $1,152 亿(+142%);FY2026(2025 自然年):营收 $2,159.4 亿(+65%),数据中心 $1,934.8 亿(+68%),占营收近 90%[11][12];FY27Q1(2026-05)单季营收 $816 亿(+85%),数据中心 $752 亿(+92%)[64] | 全球绝对霸主;Blackwell(GB300/NVL72)需求超预期,TOP500 中 75%+ 采用其技术;Vera Rubin 平台 2026Q3 出货 |
| AMD | 2026Q1 营收 $103 亿(+38%),数据中心 $58 亿(+57%);与 OpenAI、Meta 各达成 6GW Instinct GPU 部署合作(MI450 Helios 平台 2026H2 量产);预计 2027 年 Instinct 收入达数百亿美元[24][80] | 英伟达最强挑战者,生态差距仍在;数据中心已成核心增长支柱 |
| 华为昇腾 | 2025 年中国市场出货 81.2 万颗(份额 20.41%,占国产 AI 芯片出货近 50%);910C 推理速度约为 H100 的 60%(外媒独立测试);深圳万卡 910C 超节点实测故障率 0.3‰[13][25][26] | 中国国产替代龙头,训练生态仍落后(CUDA vs CANN) |
| 寒武纪 | 2025 年营收 64.97 亿元(+453%),净利润 20.59 亿元,扭亏为盈;市值一度近 5,000 亿元[27] | A 股"国产算力"核心标的,业绩兑现拐点 |
| 国产整体 | 2025 年中国 AI 加速卡出货约 400 万张:英伟达 220 万张(55.22%,从制裁前约 95% 大幅下滑);国产合计 165 万张(份额首破 40%)[28] | 中美双轨格局确立;黄仁勋自述英伟达在华高端芯片份额"从 95% 降至 0%" |
| 云厂商 | 五大超大规模云 2026 年 capex 预计 $5,310 亿;H100 云租价跌至 $2–4/小时[9][10] | 算力供给主体正从"卖卡"转向"卖算力服务" |
| 风险类别 | 关键事实与数据 | 对"Token 工厂"的影响 |
|---|---|---|
| 电力供给瓶颈 | Morgan Stanley:美国 2025–2028 年数据中心新增用电需求 65GW,可用供给仅 21GW,缺口 44–45GW(约等于意大利全国用电量);GenAI 耗电 2023 年 20 TWh → 2025 年 165 TWh → 2028 年预计 675 TWh[10] | 选址决定生死:西部绿电区/近电网节点是唯一解;电费占运营成本 50%+(东部更高) |
| AI 资本开支泡沫争议 | 美银 2025-10 调查:54% 机构投资者认为 AI 股票处于泡沫;2023–2025 全球 AI 基础设施投入约 $5,600 亿,而 AI 软件与服务收入远低于此;纳德拉承认"芯片插不上电"问题[20][32] | 融资环境随时可能收紧;现金流为正的垂直场景比"烧钱囤卡"更安全 |
| Token 价格战 → 涨价周期 | 旗舰模型输入价 17 个月降 8 倍;H100 租价 2 年跌 60%+[7][9];但 2026 年 H1 反转:H100 租价回升 20%,DeepSeek-V4 输出价上调 350%[63][65] | 毛利正在修复;但"涨价后需求是否回落"是新的观察点,定价策略(峰谷/错峰)成为运营必修课 |
| 技术换代风险 | GPU 世代 2–3 年换代(A100→H100→H200→B200),单卡价格 $25K–45K,自购存在技术过时风险[33] | 自建资产折旧周期必须 ≤3 年;云弹性部署对冲换代风险 |
| 国产生态差距 | 昇腾推理可达 H100 的 60%,但训练生态(CANN vs CUDA)差距明显,框架兼容性成本高[25] | 国产线适合推理型 Token 工厂;训练/前沿研发仍依赖英伟达合规卡或海外云 |
| 阶段 | 时间 | 轻资产档 | 标准档(推荐) | 重资产档 |
|---|---|---|---|---|
| 前期 | 0–6 月 | 15–40 万 (Mac 开发机 + 云 GPU 按需) |
150–350 万 (1 台 8 卡 H100 整机或等量云预留) |
500–1,000 万 (2 台 8 卡 + 机房机柜 + 团队 5–8 人) |
| 中期 | 6–18 月 | +20–60 万 (长期云预留实例 / 扩容 Mac) |
+300–800 万 (加购 1–2 台 8 卡,或引入昇腾 910C 混合) |
+1,000–3,000 万 (整机房扩容、液冷改造、多集群) |
| 后期 | 18–36 月 | 按需追加 (维持弹性,不沉淀重资产) |
1,000–3,000 万 (多元算力:英伟达 + 国产 + 云弹性) |
5,000 万–2 亿 (双机房、PUE 优化、全国节点) |
用最小成本验证三个问题:① 目标客户是否真的愿意为 Token 服务付费(付费意愿验证);② 自建 vs 云 API 的成本结构是否成立;③ 技术链路(模型部署 → 推理优化 → API 网关 → 计费)是否跑通。
| 成本项 | 金额区间 | 占比 | 说明 |
|---|---|---|---|
| 硬件采购 | 180–250 万(可选:首年以云预留替代,约 100–150 万/年) | 65–75% | 8 卡 H100 整机($250–460K);或先租后买:H100 云价 $2–4/卡时,8 卡 24/7 月成本约 ¥8–17 万[9][18] |
| 开发机 | 8–15 万 | 5% | Mac Studio M3 Ultra 512GB(¥74,249)或 256GB(约 ¥5 万)用于开发调试、私有数据推理、超大模型试验[34] |
| 机房/托管 | 月 5,000–20,000 | 5–8% | 整机柜托管(8–10kW);或租用智算中心机柜(西部托管电费更优) |
| 电力 | 月 1.3–3 万 | 5–8% | 8 卡满负荷 10kW;西部 0.35 元/度 vs 东部 0.65 元/度,差距约 2 倍[29] |
| 网络与带宽 | 月 2,000–8,000 | 2–3% | BGP 带宽 + 高防;出 Token 服务对带宽时延敏感 |
| 团队人力 | 月 5–10 万 | 10–15% | 2–5 人:算法/推理优化 1–2 人、后端/API 1–2 人、产品运营 1 人 |
| 软件与合规 | 3–8 万 | 2–3% | 推理框架(vLLM/SGLang)、监控、备案/合规咨询 |
参考:华为云 10MW 智算中心 TCO 模型——GPU 服务器占 CAPEX 52%,年 OPEX 约 $2.56M/MW;美国全口径数据中心 CAPEX 约 $37.6–38M/MW(IT 设备占 2/3)。[19][35]
把"验证过的客户需求"转化为稳定产能:扩容到 2–3 个 8 卡集群,建立标准运维体系,把单 Token 成本降到云 API 批发价以下,实现盈亏平衡或接近盈亏平衡。
| 维度 | 关键动作 | 量化目标 |
|---|---|---|
| 推理优化 | vLLM/TensorRT-LLM 批处理、PagedAttention、FP8 量化、前缀缓存 | 高并发吞吐提升 2–5 倍(H100 70B:单流 120 → 100 并发 2,400 tok/s)[17] |
| 调度弹性 | 自建集群保底 + 云 GPU($2–4/卡时)吸收峰值 + 外部 API(DeepSeek 等)兜底 | 峰值利用率 >90%,空转率 <15% |
| 监控告警 | GPU 温度/显存/吞吐/延迟/TTFT 全链路监控 | TTFT <200ms,P99 时延达标 |
| 成本核算 | 每集群每周输出单 Token 全成本报表(硬件折旧+电+运维+人力分摊) | 单 Token 成本持续下降,月度复盘 |
| 能耗优化 | PUE 管理、错峰运行(借鉴 DeepSeek 夜间 50–75% 折扣策略) | PUE ≤1.3(全国超大型设施均值 1.34)[4] |
从"算力转售"升级为"算力 + 应用"复合体:多元算力(英伟达/国产/云弹性)对冲供应链与政策风险,垂直场景产品贡献 60%+ 毛利,ROI 转正。
| 算力池 | 定位 | 比例建议 | 理由 |
|---|---|---|---|
| 英伟达集群(H200/B200 级) | 高并发生产推理 + 微调 | 40–50% | 生态最成熟、吞吐最高;B200 单 Token 成本较 H100 降 20 倍[8] |
| 国产算力(昇腾 910C / 寒武纪) | 推理主力 + 政策合规场景 | 20–30% | 供应链安全;可申报算力券补贴(深圳模型券最高抵扣 30%)[15] |
| 云弹性池(H100 按需) | 峰值吸收、地域就近 | 15–20% | $2–4/卡时,随用随停,对冲技术换代风险[9] |
| 外部 API 兜底(DeepSeek 等) | 长尾/超低价场景 | 5–10% | 2026-08 起 DeepSeek-V4 峰谷定价(输出高峰 ¥27/闲时 ¥13.5),批发转售价差重新打开[63] |
| 模式 | 定价逻辑 | 毛利空间 | 实施要点 |
|---|---|---|---|
| ① 垂直场景 SaaS | 按业务价值收费(如客服 Agent 按坐席、内容工厂按篇) | 60–85% | 推理成本控制在营收 25–30% 以内(行业经验值)[39];避开与 OpenAI/DeepSeek 直接比价 |
| ② 私有化部署 + 数据安全溢价 | 一次性授权 + 年维护费 | 50–70% | 政企客户对"数据不出域"付费意愿强;Mac/国产卡组合满足合规审查 |
| ③ 模型微调 / 定制服务 | 项目制 + 持续推理分成 | 40–60% | 8B–70B 微调是中小 Token 工厂的差异化入口 |
| ④ 算力/Token 批发 | 按 Token 或 GPU 时计费 | 10–30% | 仅在高利用率 + 批量场景成立(详见 2.5 测算);可叠加地方算力券降低实际成本[15] |
| 策略 | 累计投入(36 个月) | 年化收入目标 | 回本周期 | 适合谁 |
|---|---|---|---|---|
| 轻资产(云为主) | 40–120 万 | 30–80 万(纯应用层毛利) | 18–24 个月 | 个人/小团队;先验证再重投;零硬件折旧风险 |
| 标准(自建+弹性) | 300–900 万 | 300–500 万(垂直 SaaS + 批发组合) | 约 20–24 个月(需利用率 >70%)[18] | 有明确客户的创业团队;本报告推荐路径 |
| 重资产(规模化) | 2,000 万–2 亿 | 数千万级 | 3–4 年(参照华为云智算 ROI:基础 4.2 年 / 液冷优化后 3.1 年)[19] | 有融资能力的机构;对标区域智算中心运营 |
假设:70B 级 FP8 模型;vLLM 高并发;硬件按 5 年折旧(GPU 世代 2–3 年,实际按 3 年更保守);西部电价 0.35 元/度;汇率 7.2。产能引用实测基准:单卡 H100 100 并发聚合吞吐 2,400 tok/s。[17]
| 方案 | 月产能(tokens) | 月全成本 | 单 Token 成本(元/百万) | 对标市价 | 结论 |
|---|---|---|---|---|---|
| Mac Studio M3 Ultra 512GB ×1(单机) | 约 5,000 万(40 tok/s 聚合 × 24h × 50% 负载) | 约 2,600 元(折旧 2,062 + 电 46 + 杂项 500) | 约 50–200 元 | DeepSeek-V4 输出 ¥13.5–27/百万[63] | 单机量产无经济性——定位是"容量+安全"而非"便宜" |
| 8 卡 H100 集群(30% 负载) | 约 149 亿 | 约 6.9 万(折旧 4.2 万 + 电 0.8 万 + 运维 2 万) | 约 4.6 元 | — | 接近 DeepSeek 输出价,仅适合高价值场景 |
| 8 卡 H100 集群(70% 负载) | 约 348 亿 | 约 7.9 万(电随负载升至 1.8 万) | 约 2.3 元(≈$0.32) | DeepSeek-V4 输出 ¥13.5–27;B2B 批发 ¥10–20 | 成本优势扩大:约为官方 API 的 1/6–1/12,毛利 80–90%+ |
| 纯云 API 转售 | 不限 | 按量 | 约 1.9–7 元(进价) | — | 零资产风险,但毛利被上游锁定,适合起步期 |
测算结论(2026-08 更新):① Mac 不适合做 Token 量产单元(单 Token 成本高出集群 20–100 倍);② 8 卡 H100 集群在 70% 利用率下成本约 ¥2.3/百万 token,而 DeepSeek-V4 官方输出价已涨至 ¥13.5–27(高峰)——自建成本仅为官方价的 1/6–1/12,毛利空间较 2025 年显著扩大;③ 30% 利用率下自建约 ¥4.6/百万,仍低于官方闲时价——利用率依然是 Token 工厂的生死线,但 2026 年的定价环境给了自建模式更大的安全边际。[63][18]
基于 2.5 节测算模型:拖拽/下拉调整参数,右侧实时输出。模型假设:70B FP8 + vLLM 高并发;H100 整机 19,200 tok/s(100 并发/卡,[17]);H200 按带宽优势保守取 21,000 tok/s;5 年折旧(Mac 3 年);运维与电费按报告口径。数值为估算参考,投产前请用自有 POC 校准。
定位:在正式投资标准档之前,先以 20–50 万元完成技术验证与商务准备——适合"先小额试错、看到结果再重仓"的投资人。对谈投资是极强的风险缓释工具:投失败了损失可控(约一辆车钱),投成了再按标准档追加,且超前期投入按实缴计入总股本。
| 资金用途(20–50 万) | 金额 | 交付物 / 验证目标 |
|---|---|---|
| 开发验证机 | 3–8 万 | Mac mini M4 Pro 64GB(约 ¥1.6 万)×1–2 + 云 GPU 验证费上调;预算充足再升级 Mac Studio 512GB(¥74,249)——跑通 vLLM 70B 部署 + API 计费网关,实测真实吞吐与单 Token 成本 |
| 云 GPU 验证费 | 5–10 万 | H100 云租($2–4/卡时)按需验证高并发批处理性能([9]),产出 POC 测试报告 |
| 公司注册/资质/备案 | 3–5 万 | 主体设立、ICP/算法备案路径梳理、机房消防与电力合规预审 |
| 运营储备(3–6 个月) | 10–20 万 | 核心团队 2 人、商务差旅(光伏供电协议、客户拜访) |
通过 / 不通过的处理:M3 验证通过 → 触发标准档(300–400 万)追加投资,超前期投入按实缴金额计入总股本;不通过 → 云资源停用止损,损失控制在 20–50 万以内,投资方可选择整体退出。
| 档位 | 总投资 | 资金用途结构 | 适用 |
|---|---|---|---|
| 超前期(种子验证) | 20–50 万 | 开发机 8–15 万 + 云 GPU 验证 5–10 万 + 注册备案 3–5 万 + 运营储备 10–20 万(详见 2.6.0) | 低风险试错;验证通过再触发标准档,投入计入总股本 |
| 起步档 | 150–200 万 | 8 卡 H100 整机 250 万 → 压缩为首年云预留(100–150 万)+ 开发机(15 万)+ 运营储备(35 万) | 先验证再重投,风险最低 |
| 标准档(推荐) | 300–400 万 | 硬件 8 卡 H100/H200 整机 250–320 万(70%)+ 机房/电力/散热配套 40 万(10%)+ 云弹性与运营储备 60 万(20%) | 一步到位建产能,18–24 个月回本目标 |
| 扩张档 | 600–800 万 | 双集群(2×8 卡,可混国产卡)+ 储能试点 + 西部备选节点 | 已有客户基础,直接规模化 |
注:硬件价格为 2025–2026 年市场价([33][44]);机房配套含机柜、电力改造、散热(液冷加装约 $10–50M/设施 级别按比例折算,[9]);运营储备覆盖 6 个月人力与云弹性费用。
| 角色 | 投入 | 作价/权益逻辑 |
|---|---|---|
| 投资方 | ① 现金出资(标准档约 300–350 万) ② 园区机房场地(约 50–100㎡) ③ 光伏余电长期供电(按 0.36 元/度锁定,含价格保护条款) | 现金按实缴金额计股;场地按市场租金作价(中山工业厂房 15–25 元/㎡·月,可折股或固定租金);余电按"低于市电 40%"的锁定价计入成本结构,既保障投资方收益又不摊薄运营方技术股 |
| 运营方 | ① 技术与运营团队(推理工程/API 平台/客户交付) ② 客户与市场渠道 ③ 模型工程与平台知识产权 | 以技术干股参与(建议 25–40%,按投资额与贡献协商);若投资方出资含"隐性资源价值",可约定技术股比例随回本进度递增(详见保障条款) |
| 指标 | 保守(60% 利用率) | 中性(70% 利用率) | 乐观(80% 利用率) |
|---|---|---|---|
| 月产能(token) | 298 亿 | 348 亿 | 398 亿 |
| 加权售价(元/百万) | ¥8(批发为主) | ¥11(批发+垂直混合) | ¥14(垂直场景为主) |
| 月收入 | ¥23.8 万 | ¥38.3 万 | ¥55.7 万 |
| 月成本(折旧+电+运维+人力) | ¥12 万 | ¥14 万 | ¥16 万 |
| 月净利 | ¥11.8 万 | ¥24.3 万 | ¥39.7 万 |
| 回本周期(350 万投入) | 约 30 个月 | 约 15 个月 | 约 9 个月 |
| 3 年累计净利(估) | 约 380 万 | 约 800 万 | 约 1,300 万 |
测算基准:8 卡 H100 集群产能 19,200 tok/s([17]);电费按光伏余电 0.36 元/度([72]);折旧 5 年;人力按 2–4 人。售价加权假设见 2.5 节与 2.3 节盈利模式。此为行业假设估算,非承诺;投产 6 个月内以实际 POC 数据替换。
给投资人的回报话术(中性场景):350 万投入,中性预计 15 个月回本、3 年累计净利约 800 万(2.3 倍本金);叠加场地租金与光伏售电原本的收益,投资方综合回报率(含资源回报)高于纯财务投资口径。
| 节点 | 承诺内容 | 未达成的处理 |
|---|---|---|
| 超前期 M1–M3 | POC 跑通 → 资源协议落地 → 3–5 个付费意向(详见 2.6.0) | 云资源停用止损,损失控制在 20–50 万内;投资方可整体退出 |
| M3 | 技术链路跑通(vLLM 70B 部署 + API 计费系统) | 可终止合作,按出资比例清算,运营方退还开发期费用 |
| M6 | MVP 上线 + 首批 3–5 个付费客户 | 调整市场策略;投资方有权要求转为纯云轻资产模式 |
| M18 | 盈亏平衡(月收入 ≥ 月全成本) | 触发"保本优先":净利润 80% 归投资方直至本金收回 |
| M36 | ROI 转正(累计现金流回正) | 运营方技术股比例按协议递增(对赌兑现) |
| 退出 | 3–5 年,投资方有权要求回购 | 按"净资产或年净利 ×3–5 倍"孰高回购;运营方享有优先购买权 |
LLM 推理是显存带宽瓶颈型任务:生成每个 Token 都要读一遍全部权重(70B Q4 量化 ≈ 42GB)。因此衡量推理硬件的两个核心指标是显存(装得下多大模型)与带宽(每秒能吐多少 Token):
| 维度 | Mac mini M4 Pro 64GB(小主机) | Mac Studio M3 Ultra(512GB) | Mac Studio M4 Ultra(192GB,2026 新品) | A100 80GB SXM | H100 SXM5 80GB | H200 SXM 141GB | B300(Blackwell Ultra,2026 主力) |
|---|---|---|---|---|---|---|---|
| 市场价(2026) | $2,199(64GB 顶配,约 ¥1.6 万);M4 基础版 $599 起[82] | $11,699 / ¥74,249(512GB+1TB)[34] | $1,999 起;192GB 高配约 $5,000–9,000+[77] | 云租 $0.66–4/卡时[9] | 新卡 $35–40K;二手 $6–22K;云租 $1.85–4.5/卡时(2026H1 租价回升 20%)[33][43][66] | $38–45K;渠道 $45–50K[44] | 单卡约 $53K(无零售,随整机);云租 $7.1–17.8/卡时[75][76] |
| 内存/显存 | 64GB 统一内存 | 512GB 统一内存 | 最高 192GB 统一内存[77] | 80GB HBM2e | 80GB HBM3 | 141GB HBM3e | 288GB HBM3e(单卡可装 200B+ 模型) |
| 内存带宽 | 273GB/s(M4 Pro;基础 M4 为 120GB/s)[82] | 819GB/s[40] | 800GB/s(实测 806GB/s,M2 Ultra 的 1.8 倍)[77] | 2.039TB/s | 3.35TB/s | 4.8TB/s | 8TB/s(H200 的 1.7 倍) |
| 算力(FP16/FP8) | 20 核 GPU(M4 Pro) | 约 24 TFLOPS(GPU 部分) | 80 核 GPU(双 M4 Max 融合) | 312 TFLOPS(FP16) | 990(FP16)/ 1,979(FP8 稠密) | 同 H100(FP8 1,979) | FP8 2,250 TFLOPS(稠密)+ 原生 FP4(推理 2× FP8) |
| 70B 模型生成速度 | 9–11 tok/s(Q4/MLX,单用户)[82] | 15–30 tok/s(Q4/MLX,单用户)[48] | 与 M3 Ultra 同级(带宽相近;单用户 20–35 tok/s,估算)[77] | 约 56 tok/s(单流)[50] | 120 tok/s 单流;2,400 tok/s @100 并发[17] | ≥H100(KV 缓存更足) | 高并发吞吐显著高于 H100(带宽 2.4×,估 3,000+ tok/s @100 并发);单卡直跑 200B+ |
| 可承载最大模型 | 70B Q4(约 40GB,紧);30B Q5 舒适[82] | 671B Q4 / 685B 4bit 单机可跑[51] | 100B 级(70B Q8 / 405B 极限量化)[77] | 70B FP8(紧) | 70B FP8(KV 仅剩 ~10GB)[37] | 70B FP8 + 大 KV;单卡替代 2×H100 | 单卡 200B+ / 1T 级 MoE 分片,无需跨卡分片 |
| 功耗(满载) | 65–100W(安静) | 约 215W 实测[52] | 约 200W(跑 671B 实测)[77] | 400W | 700W | 700W | 1,400W(必选液冷) |
| 每瓦性能(70B 推理) | 约 0.11 tok/s/W(估算) | 约 0.065 tok/s/W[53] | 约 0.07–0.11 tok/s/W(估算) | — | 0.17 tok/s/W(单流) | — | — |
| 互连扩展 | Thunderbolt 5 | Thunderbolt 5(80–120Gbps,RDMA 实验性集群)[54] | NVLink 4 900GB/s + InfiniBand 400Gb/s 组网[41] | NVLink 5 / GB300 NVL72 机架(72×B300,21TB HBM3e,~132kW)[75] | |||
| 部署环境 | 桌面静音,巴掌大小 | 桌面/办公环境,静音 | 数据中心:液冷/风冷、700W 供电、机柜散热 | 数据中心液冷必选(80–120kW/柜时代) | |||
| 工具链 | MLX / llama.cpp / Ollama | MLX / llama.cpp / Ollama / Exo | CUDA / vLLM / SGLang / TensorRT-LLM(生产级) | 同左 + FP4 推理栈 | |||
8 卡整机对比:DGX H100($250–460K / 640GB / ~10kW)|DGX H200($400–500K / 1.1TB / ~7kW)|DGX B300($300–350K / 2.3TB / ~14.5kW / FP4 144 PFLOPS,2026 年出货,对华受管制)[75][76]。注:单流速度指单用户连续生成;聚合吞吐指多并发批处理。Mac 实测数据来自 MLX/llama.cpp 社区基准(omlx.ai、insiderllm、Jeff Geerling 等);GPU 数据来自 NVIDIA 官方规格 + cloudai.pt 2026 vLLM 实测。Mac Pro(M2 Ultra)已于 2026 年 3 月正式停产,由 Mac Studio M4 Ultra 顶替[77];标"估算"的为基于带宽/算力推算,非实测。
核心结论:按"每百万 Token 全成本"排序——8 卡集群(高利用率)< H100 云租(含利润)< 8 卡集群(低利用率)< Mac 单机 << Mac 集群。Mac 的性价比体现在"每万元能买到的内存容量"而非 Token 产量:
| 购买对象 | 价格 | 可运行模型 | 每万元内存 | 单 Token 成本(70B) |
|---|---|---|---|---|
| Mac mini M4 Pro 64GB | 约 ¥1.6 万 | 70B Q4(紧)/ 30B Q5 舒适 | 40GB/万元 | 单 Token 成本高于集群;适合开发与超前期验证 |
| Mac Studio M3 Ultra 512GB | ¥74,249 | 671B Q4 / 685B 4bit | 6.9GB/万元 | 50–200 元/百万(量产无优势) |
| H200 单卡 | 约 ¥28–33 万 | 70B FP8 + 大 KV | 0.43GB/万元 | 单卡难支撑规模化,多卡才有意义 |
| 8 卡 H100 整机 | 约 ¥180–330 万 | 多租户并发 | 0.24GB/万元(640GB) | 约 2.3 元/百万(70% 利用率) |
| 议题 | Mac 阵营 | GPU 服务器阵营 |
|---|---|---|
| 多机集群 | Thunderbolt 5 RDMA 已可实现 4 机 1.5TB 统一内存池(macOS 26.2 + Exo),实测 Qwen3 235B 达 31.9 tok/s、Kimi K2 Thinking 25 tok/s@280W——但 TB5 无交换机只能菊花链、节点数受限、实验性质,Geerling 本人称"无法为这笔钱找到合理理由"[54][56] | NVLink(900GB/s/卡)+ InfiniBand(400Gb/s)+ NVSwitch,8 卡至 72 卡(GB200 NVL72 机架)成熟扩展;生产唯一主流路径[41] |
| 4 机 Mac 集群成本 | 约 $40,000(2×512GB + 2×256GB)≈ ¥29 万——1.5TB 内存确实便宜(每 GB 约 ¥193) | 1.5TB 显存等价配置需 8–10 卡 H200/B200,成本 $380K+ ≈ ¥270 万+ |
| 故障与运维 | 整机更换即可,无需机房;但高负载偶发系统崩溃[56] | GPU 故障率高发、需备件库与 7×24 值守;参考深圳万卡昇腾集群故障率 0.3‰ 级别[26] |
| 噪音/物理环境 | 静音桌面设备,办公室可用 | 8 卡整机噪音 90dB+,必须机房 |
| 云替代 | 无(Mac 云实例极少见) | 完整:H100 $1.85–4.5/卡时、H200 $3.5–4.5、B200 $4–6[43] |
| 你的情况 | 推荐方案 | 预算参考 | 理由 |
|---|---|---|---|
| 个人开发者 / 起步验证(日 Token 量 <1,000 万) | Mac mini M4 Pro 64GB(约 ¥1.6 万)起步 + 云 GPU 按需 + 外部 API 兜底;需求升级再上 Mac Studio 512GB | 3–25 万 | 一台 mini 即跑 70B Q4(9–11 tok/s)[82],数据安全、零机房成本;验证期不沉淀 GPU 资产 |
| 小团队 / 内部工具(日 1,000 万–1 亿) | Mac 开发机 + 1 台 8 卡 H100(或长期云预留) | 200–350 万(或云年付 100–150 万) | 70% 利用率下自建成本约 ¥2.3/百万 token,约为官方 API 1/7;云预留对冲利用率不足风险[18] |
| 商业 Token 工厂(日 1 亿+) | 8 卡 H100/H200 集群起步,H200 优先(长上下文/大 KV);预算充足可选 B300(单卡 288GB 直跑 200B+,省跨卡分片) | 300–1,000 万 | H200 单卡替代 2 张 H100、KV 充足支撑高并发;B300 单 Token 成本更低但需液冷且对华受管制[37][75] |
| 政企 / 数据敏感 / 合规场景 | Mac(本地开发)+ 国产算力(昇腾 910C)集群 | 按需 | 数据不出域 + 供应链合规 + 可申报算力券(最高抵扣 30%)[15][25] |
| 研究 / 超大模型试验(671B+ 级) | Mac Studio 512GB ×2–4(RDMA 集群) | 15–30 万 | 唯一能在桌面上跑 671B 级 MoE 的方案;实验性质,不建议承载生产 SLA[54][56] |
| 规模化生产(多集群) | GPU 集群(H200/B200)+ 云弹性池 + 国产合规池 | 1,000 万+ | 吞吐、扩展、生态三要素只有 GPU 集群齐备;Mac 退出生产位,退居开发/试验位[41] |
| 池 | 构成 | 职责 | 成本特征 |
|---|---|---|---|
| 开发试验池 | 1–2 台 Mac Studio 512GB(约 ¥15 万) | 模型评测、私有数据推理、超大模型试验、演示 POC、客户现场部署原型 | 一次性投入低;电费几乎可忽略(215W) |
| 生产算力池 | 自建 8 卡 H100/H200 集群(约 ¥250–500 万) | 主力推理:70B–405B 级、高并发 API 服务、批量生成、微调 | 固定成本主导;70%+ 利用率时单 Token 成本最低 |
| 弹性缓冲池 | 云 GPU($2–4/卡时)+ 外部 API(DeepSeek 等) | 峰值吸收、地域就近、新模型快速试水、兜底 SLA | 纯变动成本;随用随停,对冲技术换代[9][38] |
流量调度逻辑:API 网关按"优先级 + 成本 + 时延"路由——常规请求进生产池(成本最低);突发峰值溢出到弹性池(贵但零等待);超长尾/超低价场景直连外部 API(避免自建资源空转)。数据敏感请求强制落在本地池(Mac 或国产卡),满足合规。这一架构兼顾成本、弹性与合规,是 2025 年行业共识的形态。
场景:工业园屋顶光伏在白天午间存在大量"消纳不完"的余电(广东现货市场已出现负电价时段,午间电近乎白给 [73])。把余电喂给 GPU 集群做批处理推理/微调,是典型的"算电协同"——电费从"卖不掉"变成"直接创造收入"。拖动滑杆测算:
| 指标 | 数值 | 时点 | 来源 |
|---|---|---|---|
| 英伟达单季营收 | $816 亿(+85%);数据中心 $752 亿(+92%) | FY27Q1(2026-05 发布) | NVIDIA 官方 [64] |
| 北美四大云 capex | 单季 $1,316 亿(+70%);2026 全年指引约 $7,100 亿;2027 预计超 $1 万亿 | 2026Q1 | 各公司财报/券商整理 [67] |
| 中国智能算力规模 | 1,882 EFLOPS(FP16) | 2026Q1 | 信通院 [66] |
| 中国 AI 算力需求增速 | +417%(供给仅 +128%) | 2026Q1 | 信通院 [66] |
| DeepSeek-V4 输出价 | 高峰 ¥27 / 闲时 ¥13.5(较此前 ¥6 涨 350%) | 2026-08-17 生效 | DeepSeek 官方 [63] |
| H100 租赁价变动 | 年初至今 +20%;A100 +15% | 2026H1 | 英伟达 CFO 电话会 [65] |
| 中国算力网投资 | "十五五"新增直接投资 4 万亿元;首个全国产十万卡集群落地郑州 | 2026 | 国家发改委/华夏时报 [68] |
| Token 日消耗量 | OpenAI 日调用 21.6 万亿词元;豆包日调用超 120 万亿词元 | 2026 | 信通院 2026 报告 [70] |
| 指标 | 数值 | 年份/时点 | 来源 |
|---|---|---|---|
| 全球数据中心系统支出 | $5,060 亿(+51.6%)→ $8,220 亿(+62.5%) | 2025 实际 → 2026E | Gartner 2026-07 [78] |
| 全球 AI 基础设施支出 | $474 亿(+97%,半年)→ 2028E $2,230 亿 | 2024H1 → 2028E | IDC [3] |
| 全球 AI 推理市场 | $1,061.5 亿 → $2,549.8 亿(CAGR 19.2%) | 2025 → 2030E | MarketsandMarkets [6](Grand View 口径相近 [57]) |
| 中国智能算力市场 | $190 亿(+86.9%) | 2024 | IDC(信通院引用)[58] |
| 中国智算规模 | 49.3 万 PFLOPS → 159 万 PFLOPS(FP16),全球第二 | 2024 末 → 2025 末 | 国家数据局 [4] |
| 全国万卡级智算集群 | 42 个;智算中心超 250 个 | 2025 | 国家数据局 / 信通院 [4][14] |
| 全球大模型数量 | 3,755 个(中国 1,509 个 / 40.2%) | 2025-06 | 信通院 [59] |
| 超大规模云 capex | $2,590 亿 → $4,140 亿 → $5,310 亿(预计) | 2024 → 2025 → 2026E | Bloomberg / Guinness GI [60] |
| 指标 | 数值 | 时点 | 来源 |
|---|---|---|---|
| GPT-3.5 级推理成本降幅 | $20 → $0.07/百万 token,降 280 倍 | 2022-11 → 2024-10 | Stanford AI Index 2025 [7] |
| GPQA>50% 模型推理成本降幅 | $15 → $0.12/百万 token,降 125 倍 | 2024-05 → 2024-12 | Stanford AI Index 2025 [7] |
| GPT-4o-mini API 价 | $0.15 / $0.60(输入/输出,百万 token) | 2024-07 | OpenAI 官方 [61] |
| DeepSeek-V3 API 价 | $0.27 输入(缓存未命中)/ $1.10 输出 | 2024-12 | DeepSeek 官方 [62] |
| DeepSeek-R1 API 价 | ¥4 输入(未命中)/ ¥16 输出 | 2025-01 | DeepSeek 官方 [38] |
| B200 vs H100 单 Token 成本 | 降 20 倍;吞吐 21,088 vs 844 tok/s | 2025-02 | 英伟达官方 [8] |
| H100 云租价 | $7–10 → $2–4/卡时(峰值跌 60%+) | 2023 → 2025 | Silicon Data / wiki 汇总 [9] |
| 自建 8 卡 H100 单 Token 成本 | 约 ¥2.3/百万(70% 利用率,估算) | 2026 测算 | 本报告测算模型(2.5 节) |
| 指标 | Mac mini M4 Pro 64GB | Mac Studio M3 Ultra 512GB / M4 Ultra 192GB | A100 80GB | H100 SXM5 | H200 SXM | B300(2026 主力) |
|---|---|---|---|---|---|---|
| 价格(2026) | $2,199(约 ¥1.6 万)[82] | $11,699 / ¥74,249(M3U)[34];M4U $1,999 起[77] | 云租 $0.66–4/时 [9] | $35–40K 新卡 [33] | $38–45K [44] | 约 $53K/卡;云租 $7.1–17.8/时 [75][76] |
| 内存/显存 | 64GB 统一内存 | 512GB / 192GB 统一内存 | 80GB | 80GB | 141GB | 288GB |
| 带宽 | 273GB/s | 819 / 800GB/s | 2.04TB/s | 3.35TB/s | 4.8TB/s | 8TB/s |
| 70B 生成速度 | 9–11 tok/s(单用户)[82] | 15–30 / 20–35 tok/s(单用户)[48][77] | ≈56 tok/s 单流 [50] | 120 tok/s 单流 / 2,400 tok/s @100 并发 [17] | ≥H100(KV 更足)[37] | 高并发超 H100(带宽 2.4×) |
| 最大模型承载 | 70B Q4(紧) | 671B Q4(M3U)/ 100B 级(M4U)[51][77] | 70B FP8(紧) | 70B FP8 | 70B FP8 + 大 KV [37] | 单卡 200B+ [75] |
| 功耗 | 65–100W | ≈215 / ≈200W 实测 [52][77] | 400W | 700W | 700W | 1,400W(液冷必选) |
| 扩展性 | TB5 | TB5 菊花链(实验)[54] | NVLink 900GB/s + InfiniBand 400Gb/s(生产级)[41] | NVLink 5 / GB300 NVL72 机架 [75] | ||
| 阶段 | 时间 | 预算(标准档) | 关键里程碑 | 退出/止损条件 |
|---|---|---|---|---|
| 前期(验证) | 0–6 月 | 150–350 万 | M1 技术跑通;M3 种子客户;M6 决策评审 | M6 利用率 <40% → 转纯云策略 |
| 中期(扩容) | 6–18 月 | +300–800 万 | M9 双集群;M12 ≥30 客户;M18 盈亏平衡 | M18 未平衡 → 聚焦高毛利客户 |
| 后期(规模化) | 18–36 月 | 1,000–3,000 万 | M24 ROI 转正;M30 西部节点;M36 千亿 Token/月 | — |
编号与正文上标 [n] 一一对应。数据检索与核实时间:2026 年 8 月。部分来源为二手转载(已在正文标注),建议关键决策数据以一手来源为准。