云计算美
← 贴纸墙
MODEL · DETAIL
Modal按秒计费LLM推理托管服务
1)按计算资源实际使用时长按秒计费,GPU与CPU算力即用即付
MODEL
关键字段
FIELD STAMPSINDUSTRY 行业云计算
REGION 地区美
SCALE 规模中型
CHANNEL 渠道线上
📌 背景
2026年全球AI总支出预计达2.52万亿美元,推理算力需求爆发。Modal以Python装饰器加自动扩缩的无服务器模式切入,ARR一年内从6000万美元增至3亿美元,2026年5月完成3.55亿美元C轮融资,估值46.5亿美元,资金用于扩建H100与Blackwell集群。
👤 目标客户
需要将开源或自研大模型快速部署为生产级推理端点的AI工程师与数据团队,尤其是负载波动大、希望免运维基础设施的中小型AI公司。
💰 盈利点
1)按计算资源实际使用时长按秒计费,GPU与CPU算力即用即付;2)无闲置成本的模式吸引间歇性负载客户将其全部推理工作负载迁入,随客户调用量增长获得持续性用量收入;3)峰值弹性:突发超出日常用量的秒级GPU时长按弹性档另行结算。
🧮 成本结构
巨额H100与Blackwell GPU集群采购与机房成本、软件工程团队人力、免费额度与开发者社区补贴。
🛡️ 护城河
Python原生的开发者体验与亚秒级冷启动的自研运行时构成切换壁垒;百亿级资本购入的GPU库存形成规模与议价优势;装饰器式API深度嵌入客户代码,迁移成本高。
🔑 成功关键
- 亚秒级冷启动与自动扩缩的核心运行时性能
- 持续锁定GPU供给并摊薄硬件成本
- 围绕Python开发者社区的口碑传播与低摩擦上手
⚠️ 风险
- 算力价格暴跌导致按量计费收入缩水
- 大客户回流公有云自研平台
- 融资扩张过快但需求增速回落
🏢 案例
- 企业用Modal托管Qwen3等开源模型做生产推理,美名节省闲置算力开支
- 开发者通过modal.Volume挂载Hugging Face模型权重,数分钟内部署vLLM推理端点
- LangChain自定义LLM链路直接调用Modal云端函数运行自托管模型
📊 SWOT 分析
优势 Strengths
- 开发者体验极佳,只需装饰器即可上线GPU工作负载
- 按秒计费对波动性推理负载性价比突出
- ARR一年5倍增长验证市场需求
劣势 Weaknesses
- 重资产GPU采购导致资本开支巨大
- 与公有云巨头相比企业级合规资质历史较短
机会 Opportunities
- 企业推理工作负载从AWS等通用云向专业平台迁移
- 模型自托管与数据隐私需求持续扩大市场
威胁 Threats
- AWS、Azure等巨头推出同类无服务器GPU产品压价
- GPU供给过剩导致算力价格战侵蚀毛利