资讯

招商银行统一近万张AI加速卡:利用率从35%提至60%+、每百万Token推理成本降低60%

InfoQ中文·2026/9/9 12:07:58🔗 原文

📋总体概括

招商银行宣布将全行近万张AI加速卡纳入统一算力调度平台,通过资源池化与集中管理,将原本分散闲置的GPU利用率从35%提升至60%以上,同时每百万Token的推理成本降低60%。这一案例展示了金融机构在AI基础设施运营层面的优化路径:不依赖新增采购,而是通过调度软件与集约化管理释放存量算力潜力,为银行业大模型落地的高成本问题提供了可量化的降本样本。

关键信息

  • 招商银行将全行近万张AI加速卡统一纳入集中调度管理
  • GPU利用率从35%提升至60%以上,接近翻倍
  • 每百万Token推理成本降低60%,降本效果显著
  • 核心思路是算力池化盘活存量资源,而非追加硬件采购

🔥犀利点评

金融业大模型落地最疼的从来不是模型能力,而是账单。招行这组数字戳破了一个行业隐疾:大量机构GPU利用率长期趴在三四成,卡没少买,活没多干。提升到60%依然算不上高水平,说明池化调度之外,任务编排和推理优化还有大把油水可榨。这套打法的门槛不在技术,而在组织——愿意把各业务部门的算力收归统一调度,本身就是一场部门利益再分配,这才是多数银行学不来的部分。

本文由本站自动聚合,以下为原始来源:前往 InfoQ中文 阅读全文