启望 S3大模型与智能体推理 GPU

产品概况

专为大模型及 AI 智能体推理设计

启望 S3 是曦望面向多模态大模型与 AI 智能体推理打造的新一代高性价比推理 GPU , 支持大容量显存与低精度计算,并具备灵活的集群扩展能力,致力于持续提高单位经济性与降低 TCO ,推动 AI 推理算力的普惠化落地。

启望 S3 芯片连接多种计算负载的算力平台
  • LPDDR6/5X
  • PCIe Gen6
  • FP16-FP4 无缝切换

更大容量 · 更低成本 · 更足供应

显著性能提升

支持 FP32、FP16、FP8、INT8 及 FP4 等多种计算精度,面向大模型推理实现更高效能;仿真实测显示,GEMM 算子 TensorCore 和 FlashAttention 算子计算效率约达 99%和 98%,逼近理论上限;AI 引擎核心架构突破,FP4 算力达到 P 级,单卡性能密度提升数倍。

推理成本持续优化

S3 采用 LPDDR6 内存(向下兼容 LPDDR5X)和 PCIe Gen6 ,以更大显存容量、更优互联带宽和更低成本支持大模型推理,并通过对 Prefill / Decode 等关键阶段优化,提升吞吐与响应效率,实现推理性价比的飞跃。

专为大模型与 AI 智能体设计

依托大容量内存减少 GPU 与系统内存之间的数据交换,支持低延迟的长上下文工作负载推理,并提升复杂多轮、多模态任务的稳定性,对 AI 智能体核心任务进行算子级优化。为适应 AI 智能体任务以及多模态大模型进行定向优化,支撑百万级 Token 超长上下文,显著减少数据在显存与系统内存之间的反复交换,大幅提升 Agent 的执行效率与稳定性。

黄金算力访存比

S3 围绕真实推理负载,采用统一芯片架构与软件栈,可实现云边端一体化部署;并通过架构、IP 设计多点突破,达到算力访存比的甜点,不浪费一分算力和带宽,实现计算性能、显存与能效的显著提升。

产品形态

启望 S3 凭借高带宽、低延时和高可扩展能力满足高算力需求

寰望 SC3-256 超节点

Rise SC3-256 SuperPOD

寰望 SC3-256 超节点

  • 专为万亿乃至更大参数量的多模态 MoE 模型提供高并发、高效率的推理支持,同等性能下总拥有成本(TCO)降低一个数量级
  • PD 分离和大 EP 部署,通信延迟降低一个数量级,吞吐优势提升 20 倍以上¹
  • 液冷设计实现卓越 PUE,可使数据中心能耗大幅降低
  • 整机柜开箱即用,配备自研高性能 SIRE 软件栈和 AI 推理平台,提供稳定可靠的模块化交付
1 数据来源于曦望实验室

SIRE

自研 SIRE 软件栈

兼容第三方 GPGPU 计算软件平台,支持零代码无缝迁移

  • 支持 PyTorch 框架,并自适配最新版本
  • 支持 SGLang、vLLM、LightLLM、LightX2V 等知名开源大模型推理框架
  • 适配国内外主流大模型,如 DeepSeek、Qwen、Llama 大语言模型,SD、Flux、Wan、Seko、hunyuan3D 等图像视频 3D 模型,以及多种 CNN 和语音模型等
  • 与北京、上海、杭州、深圳等地国家 AI 算力牵头单位保持重要生态合作

悬浮探索每一层

Sunrise Integrated Running EnvironmentSIRE
  • SoC 固件层
  • 驱动与运行时层
  • 编译器与算子库层
  • 框架层与生态应用

进一步咨询

深入了解曦望Sunrise 全系列产品及服务