NEW Kimi-K3 API 全新上线

HAT智算云

全链路大模型推理与优化服务平台

基于自研 IRIS 推理优化框架,提供大模型 API、推理服务专属部署、模型微调一站式服务,助力 AI 业务低成本、快速落地。

最新动态最新

Kimi-K3 API 全新上线

体验中心热门

体验模型 API 及专属部署模型推理

免费算力福利福利

注册即送 20 元算力体验券

模型定价

查看最新算力和模型 tokens 价格

产品介绍

模型 API

Kimi-K3

基于高并发算力保障,提供热门开源模型API,无需部署即刻接入。

模型专属部署

专属算力集群,一键部署即可将模型转化为高性能、可扩展的生产级 API 服务。

模型微调

SFT/DPO 模型微调,搭配 QAT 量化感知训练,实现无损精度 NVFP4 模型量化,性能翻倍。

弹性 GPU

提供多种高性能规格算力,支持按需弹性租用,极速秒级开机,即开即用。

三大驱动力,构建下一代智算体验

High Performance

极致性能

提供高性能 NVIDIA GPU 专属集群,配合超高速 RDMA 网络接口,保障无瓶颈高速计算。

高性能 NVIDIA GPU 和 RDMA 网络
Accelerated Inferencing

推理加速

自研 IRIS 推理优化服务套件,通过无损量化、动态 KV 缓存、算子优化与投机推理,实现在大规模并发业务场景下整体吞吐和计算响应速率提升。

自研 IRIS 推理框架,大规模并发性价比翻倍
Tailored for Production

工业级交付标准

打造工业级高可用架构,流量负载均衡和多维度监测,支持高敏捷自动化弹性扩容与故障无感迁移。

专为企业级高并发业务场景设计

IRIS 推理加速服务

IRIS 是腾云智算自研的推理加速服务套件,围绕真实生产环境,对模型推理链路进行深度优化,在保证精度的前提下,显著提升吞吐与算力利用率。

IRIS Lite
面向中低 QPS 场景的高效推理方案
  • 面向中低 QPS 场景的高效推理方案
  • 基于自研 TY-vLLM 推理框架
  • 深度重构 vLLM 推理路径
  • 推理性能提升 10%+
IRIS Pro
面向大规模、高并发场景的定制化推理加速
  • 面向大规模、高并发场景的定制化推理加速
  • 支持投机推理与并行调度
  • 针对业务负载进行深度优化
  • 推理加速最高可达 80%+

行业突破与开源认可

全球首家适配 Eagle3 × Qwen3 的推理加速方案:推理吞吐提升280% 推理成本下降高达 60%

Eagle 社区官方认证

全球首个适配 Eagle3 投机推理而训练的 Tengyunw/qwen3_8b_eagle3 和 Tengyunw/qwen3_30b_moe_eagle3 模型被 Eagle 官方社区引用。

Eagle 官方推荐 查看

SGLang 社区官方认证

Qwen 适配 Eagle3 核心代码已被 SGLang 开源项目正式合并。

合入官方主分支 查看

HuggingFace 月下载量超7k

Tengyunw/qwen3_8b_eagle3 和 Tengyunw/qwen3_30b_moe_eagle3 模型已在多场景推理与算力加速实践中验证可用性。

落地场景

深度探寻不同工业级业务边界下的极简智算表现

客户案例

见证前沿 AI 技术如何赋能行业标杆企业

打造极致响应的 AIGC 情感陪伴体验

元象科技旗下的 AIGC 情感陪伴应用基于 HAT 智算云 实现 DPO 精调与 NVFP4 无损量化,并基于专属集群完成生产级部署,在保障社交交互细腻度的同时,实现了推理效率翻倍与业务稳定性的全面跃升。

+100%推理效率提速
NVFP4无损高精度量化
100%专属集群稳定性
元象情感陪伴 AI
DPO 精调
今天过得开心吗?跟我分享一下你的烦恼吧,我随时都会在这里听。
谢谢你,有你在身边陪伴,感觉推理性能和心情都变好了。
那太棒了!我们在 HAT 智算云专属集群的支持下,现在回复你的速度仅需 50ms 哦。
让算力真正成为可用、可控、可持续的能力

让算力真正成为可用、可控、可持续的能力

无论是模型训练、在线推理,还是多任务混部与规模化运行,
腾云智算 AI 算力云平台,帮助企业把算力从“资源问题”变成“工程能力”。