尊时凯时

handlogo
中国图标
尊时凯时 AI Factory 融合规划|灵炼模型部署融合 NVIDIA NIM & Dynamo!

尊时凯时企业级大模型训练与治理平台-灵炼(英文名 H-AI TrainHub ,,,,,,,以下简称灵炼) ,,,,,,,是尊时凯时 AI Factory 融合解决规划的企业级一站式模型训练与治理平台 ,,,,,,,覆盖数据集治理、精调、推理部署与评测等端到端能力 ,,,,,,,专一机能与安全保险 ,,,,,,,全面支持企业 AI 模型开发与落地。 。。。。。 。


本文将带您急剧把握灵炼模型部署的推理新能力:在现有 vLLM 推理引擎基础上 ,,,,,,,集成 NVIDIA NIM 与 NVIDIA Dynamo 推理框架 ,,,,,,,构建统一、高效且可扩大的推理平台。 。。。。。 。从镜像守护、模型版本配置 ,,,,,,,到部署选择、服务监控 ,,,,,,,再到一键对接灵猿 AI 中台 ,,,,,,,援手您为分歧业务场景选择最相宜的推理规划。 。。。。。 。

为什么要引入

新的推理能力

做过大模型私有化落地的团队应该都有体味:模型部署这件事 ,,,,,,,难的从来不是“跑起来” ,,,,,,,而是“跑得稳、跑得快、管得住”。 。。。。。 。统一个模型 ,,,,,,,换个引擎、换套参数 ,,,,,,,吞吐和时延可能差出一倍。 。。。。。 。


在推理侧 ,,,,,,,灵炼此前一向以 vLLM 作为默认引擎。 。。。。。 。vLLM 足够优良 ,,,,,,,但随着企业 AI 利用从“试点验证”走向“规模;;;;;;;霾 ,,,,,,,单一引擎的局限逐步显露:

💢场景在分化

有的客户钻营开箱即用与企业级支持保险 ,,,,,,,有的客户在多机多卡集群上钻营极致吞吐 ,,,,,,,一把尺子量不了所有场景;;;;;;;;

💢算力驱动营收

GPU 算力是企业级AI部署的主题资源 ,,,,,,,推理规划 每提升一分吞吐 ,,,,,,,就意味着处置一样工作负载时 所需的 GPU 数量更少 ——规划选择将直接影响 企业拓展营收规模与降低总体占有成本(TCO)的能力;;;;;;;;

💢生态在演进

基于 NVIDIA 构建的推理软件栈(TensorRT-LLM、NIM、Dynamo)持续优化 ,,,,,,,企业必要一条能持续吸纳新推理能力盈利的蹊径 ,,,,,,,而不是被锁死在某一代规划上。 。。。。。 。

因而 ,,,,,,,灵炼这次升级的意思不只是“多了两个选项” ,,,,,,,而是让平台具备了多能力栈治理的系统化能力——容器镜像、模型适配、部署选择、参数实际、监控运维一条链路买通。 。。。。。 。企业只管按场景选用 ,,,,,,,把“换推理规划”的成本压缩到一次下拉选择。 。。。。。 。

灵炼模型部署融合

NVIDIA NIM & Dynamo

部署再升级!灵炼模型部署正式接入 NVIDIA NIM 与 NVIDIA Dynamo ,,,,,,,形成 vLLM、NIM、Dynamo 三大推理技术协同的架构 ,,,,,,,进一步提升模型服务的机能、不变性与运维效能。 。。。。。 。

推理规划自由选

在现有 vLLM 基础上 ,,,,,,,新增对 NVIDIA NIM 与 NVIDIA Dynamo 的支持。 。。。。。 。部署时可凭据模型配置按需选择推理规划 ,,,,,,,通过一套尺度化流程实现多种推理技术的统一部署与治理。 。。。。。 。

镜像有章法

底层配置支持守护通用镜像;;;;;;;;针对 NIM 模型专用镜像的特点 ,,,,,,,支持在模型仓库对应版本上守护 NIM 专用镜像 ,,,,,,,镜像随着模型版本走 ,,,,,,,部署自动带出。 。。。。。 。

参数不用猜

平台内置各推理规划可配置的内置参数与最佳实际 ,,,,,,,部署时给出推荐配置 ,,,,,,,无需从零翻阅引擎文档调参。 。。。。。 。

监控开箱即用

NIM、Dynamo 服务指标同步支吃旖台监控 ,,,,,,,与  vLLM 维持一致的可观测履历。 。。。。。 。

生态一键贯通

部署实现后支持一键对接灵猿 AI 中台的模型账号守护与模型账号组合配置 ,,,,,,,推理服务直达上层利用。 。。。。。 。

意识两位新成员

先看它们地点的大图景

AI Factory 与 NVIDIA AI Enterprise

在正式介绍这两位新成员之前 ,,,,,,,有必要先理解它们从何而来。 。。。。。 。

AI  Factory(AI工厂)

这是一套软硬件协同设计的齐整系统 ,,,,,,,指标是让企业可能规模;;;;;;;⒖沙中匕阉懔Ω咝У亍傲丁背  AI 出产力——这也正是 AI 推理进入出产环节后 ,,,,,,,对吞吐、时延与成本提出的现实要求。 。。。。。 。


要把这座“工厂」劓正跑起来 ,,,,,,,除了底层硬件 ,,,,,,,还必要一整套经过验证、可持久守护的软件栈 ,,,,,,,这就是 NVIDIA AI Enterprise。 。。。。。 。

NVIDIA AI Enterprise

将面向 AI 开发的微服务、框架和库与先进的  GPU 编排和基础设施治理相集成 ,,,,,,,打造出全面受支持的出产就绪型贸易软件套件。 。。。。。 。助力企业自负部署当先的开源工具和AI模型 ,,,,,,,提逾越产力 ,,,,,,,加快价值实现 ,,,,,,,同时以优化的资源利用率大规模运行 AI 工作负载。 。。。。。 。


能够把 NVIDIA AI Enterprise 理解为 AI Factory 的软件操作系统:AI Factory 描述了指标状态 ,,,,,,,NVIDIA AI Enterprise 则提供了让这套系统真正落地运行的尺度化软件基座。 。。。。。 。


而本次要介绍的 NIM 与 Dynamo ,,,,,,,正是 AI Factory 软件栈中两个关键组件:一个掌管让单个推理服务开箱即用、跑得又快又省心;;;;;;;;另一个掌管在大规模 GPU 集群上把散布式推理编排到极致。 。。。。。 。


理解了这层归属关系 ,,,,,,,再来看它们各自的能力 ,,,,,,,就更容易把握它们在整个 AI 工厂里所表演的角色。 。。。。。 。

1

NVIDIA NIM


官方预优化的“开箱即用”

NVIDIA NIM 是一套易于使用的预构建容器工具 ,,,,,,,主张是援试祗业客户在云 ,,,,,,,数据中心和工作站上安全 ,,,,,,,靠得住的部署高机能的 AI 模型推理。 。。。。。 。


它由 Model-Free NIM ,,,,,,,Day0 NIM 和 Refresh NIM 组成 ,,,,,,,它把推理框架(vLLM/SGLang) ,,,,,,,最幼运行时依赖 ,,,,,,,最佳推理实际统一打包为容器镜像 ,,,,,,,启动即为尺度 API 服务。 。。。。。 。它的价值重要在三点:

? 开箱即用:无需自行处置复杂的推理框架部署和配置 ,,,,,,,容器启动时自动匹配当前 GPU 的最优 profile。 。。。。。 。其中:

Model-Free NIM 允许用户以最新的推理框架版本加载肆意模型 ,,,,,,,同时两全合规和企业级 feature;;;;;;;;

Day0 NIM 允许用户在第一功夫获取最新的验证过的开箱即用模型;;;;;;;;

Refresh NIM 允许用户获得对于特定模型的最佳机能。 。。。。。 。

? 机能有保险:若是用户使用的是 Refresh NIM ,,,,,,,底层是深杜着化的推理蹊径 ,,,,,,,在 NVIDIA GPU 上通? ?????苫竦糜庞谕ㄓ霉婊耐掏掠胧 Token 时延。 。。。。。 。同时用户还可针对特定需要天生自界说优化规划 ,,,,,,,并将其无缝集成到 NIM;;;;;;;;

? 企业级支持:具备官方的版本守护与安全更新 ,,,,,,, 没有 高危代码缝隙风险 ,,,,,,,符合合规要求高的企业客户。 。。。。。 。

必要把稳的是 ,,,,,,,NIM 镜像是“多档次” 的——每个模型和框架版本对应各自的 NIM 镜像 ,,,,,,,这对平台的镜像治理能力提出了更高要求 ,,,,,,,也是灵炼本次在产品设计上沉点解决的问题。 。。。。。 。

2

NVIDIA Dynamo


数据中心级的散布式推理框架

若是说 NVIDIA NIM 解决的是“单个服务若何跑得又快又省心” ,,,,,,,Dynamo 对准的则是另一个维度:大规模散布式场景下 ,,,,,,,GPU 集群若何协同把推理跑到极致。 。。。。。 。Dynamo 是一个开源的数据中心级散布式推理框架 ,,,,,,,主题能力蕴含:

? P/D 分离(Disaggregated Serving):将推理的 Prefill(提醒词推算)与 Decode(逐 Token 天生)拆到分歧 GPU 组别离调度——前者吃算力、后者吃显存带宽 ,,,,,,,分隔后各用其长 ,,,,,,,在长高低文、高并发场景下集群整体吞吐提升非? ?????晒郏;;;;;;;

? KV Cache 感知路由:智能路由器把握各节点的 KV Cache 散布 ,,,,,,,将要求调度到缓存射中率最高的节点 ,,,,,,,削减大量沉复推算;;;;;;;;

? 多级 KV 缓存治理:KV Cache可在显存、内存、本地皮之间分层流转 ,,,,,,,用更经济的存储扛住更大的缓存量;;;;;;;;

? 引擎无关:底层可对接 TensorRT-LLM、vLLM、SGLang 等推理内核 ,,,,,,,Dynamo 掌管上层调杜纂编排。 。。。。。 。

若何选择相宜的推理规划? ?????

一个求实的选型参考:日? ?????⒀橹び vLLM;;;;;;;;NVIDIA GPU 上的尺度化高机能出产部署优先  NVIDIA NIM;;;;;;;;当业务量大到必要跨节点扩大推理集群时 ,,,,,,,就是 NVIDIA Dynamo 的主场。 。。。。。 。

急剧入门 - 配置守护

守护推理规划通用镜像

模型部署/配置守护:为各推理规划守护通用镜像。 。。。。。 。


vLLM、Dynamo 等选取“一个镜像服务所有模型”的通用镜像模式 ,,,,,,,在配置中统一登记镜像地址与版本 ,,,,,,,部署时直接引用 ,,,,,,,镜像升级只需守护一处 ,,,,,,,不再必要在各个环境里口口相传“该用哪个 tag”。 。。。。。 。

? 推理规划:vLLM / NVIDIA NIM / NVIDIA Dynamo;;;;;;;;

? 通用镜像:守护对应的镜像地址与版本 ,,,,,,,针对 NVIDIA NIM 的渠路类型 ,,,,,,,平台内置了 Model-Free NIM。 。。。。。 。

模型仓库

守护 NIM 专用镜像

模型仓库/模型版本:为模型版本守护 NVIDIA NIM 模型专用镜像。 。。。。。 。


与通用引擎分歧 ,,,,,,,NIM 模型专用镜像与模型逐一对应。 。。。。。 。灵炼将 NIM 专用镜像的守护入口设计在模型仓库的对应模型版本上 ,,,,,,,镜像与模型版本强绑定 ,,,,,,,部署时自动带出 ,,,,,,,若是官方没有颁布模型专属 NIM ,,,,,,,会默认使用 Model-Free NIM。 。。。。。 。


在模型版本上配置该版本支持的推理清单。 。。。。。 。分歧模型对推理底层的适配情况分歧 ,,,,,,,通过版本级的配置 ,,,,,,,部署环节只展示合法选项 ,,,,,,,从源头预防“用错引擎起不来服务”的低技误。 。。。。。 。

模型部署

选择推理规划

模型部署:新建部署工作 ,,,,,,,选择推理规划。 。。。。。 。

? 模型及版本:选择指标模型;;;;;;;;

? 推理规划:从该模型版本配置的规划当选择  vLLM / NVIDIA NIM / NVIDIA Dynamo;;;;;;;;

? 参数配置:平台预置各引擎默认参数与最佳实际推荐值—— vLLM 的显存利用率与最大序列长度、NVIDIA NIM 的 profile 选择、NVIDIA Dynamo 的散布式拓扑等 ,,,,,,,均给出参数注明与推荐配置 ,,,,,,,同时支持关键参数自界说调优。 。。。。。 。

统一个模型 ,,,,,,,开发环境用 vLLM 急剧验证 ,,,,,,,出产环境切换NVIDIA NIM 或NVIDIA Dynamo 上强度 ,,,,,,,切换成本被压缩到一次下拉选择。 。。。。。 。

服务监控

新技术栈不能是“监控盲区”。 。。。。。 。部署实现后 ,,,,,,, NVIDIA NIM 与 NVIDIA Dynamo 服务的运行状态与推理指标已同步接入平台监控 ,,,,,,,与原有 vLLM 服务维持一致的运维履历 ,,,,,,,服务健全度、推理指标了如指掌 ,,,,,,,问题急剧定位。 。。。。。 。

一键对接

灵猿 AI 中台

推理服务就绪后 ,,,,,,,支持一键对接灵猿 AI 中台 ,,,,,,,自动实现模型账号守护与模型账号组合配置 ,,,,,,,无需在两个平台间手工复造接入信息 ,,,,,,,推理服务直达上层 AI 利用 ,,,,,,,买通从模型部署到利用消费的最后一公里。 。。。。。 。

推理世界迭代很快 ,,,,,,,平台的价值不在于押注某一个引擎 ,,,,,,,而在于把“换推理规划」剽件事件得足够便宜。 。。。。。 。


以上内容重要解说了灵炼模型部署接入 NVIDIA NIM 与 NVIDIA Dynamo 后的推理规划镜像守护、推理规划选择、部署参数最佳实际、服务监控、灵猿一键对接有关能力——从镜像、参数、监控到上层利用对接的整条链路都是现成的 ,,,,,,,企业只需按场景选择最相宜的推理规划。 。。。。。 。


更多职能细节可参阅盛开平台文档 ,,,,,,,或随时联系研发团队:openhand@vip.hand-china.com。 。。。。。 。


将来我们将持续迭代 ,,,,,,,为您带来更多 AI 模型开发与落地履历 ,,,,,,,等待与您互换!欢迎在评论区留言 ,,,,,,,一路探求 AI 模型推理部署在您业务中的利用潜力~

携手尊时凯时 ,,,,,,,共铸硬核竞争力!


热点

尊时凯时 x SKG|主数据治理项目启动 ,,,,,,,为AI领航铺路 ,,,,,,,为高效运营筑基!

尊时凯时产品出海|HiFins尊时凯时智慧财政套件援手香港综合能源服务客户 ,,,,,,,构建全球化财政运营统一电子管帐档案!

尊时凯时 x 京新药业|共建企业级 AI 智能体平台 ,,,,,,,共拓医药行业智能化升级!

  • 交谊链接
  • 汇联易
  • SRM
  • 1m筑造
  • 甄一
  • 鼎医信息
  • 甄零一诺
? Copyright Hand China Co.,Ltd. All Rights Reserved 尊时凯时
  • 登记 沪ICP备14039535号-1
  • 登记图标 沪公网安备 31011802002577号

业务征询

美满信息后我们会第一功夫跟您联系
*
*
*
*
*请输入正确的验证码
captcha
*
*
发送失败
立即征询
尊时凯时·(中国区)人生就是搏!征询热线
尊时凯时·(中国区)人生就是搏!业务征询
微信扫码 在线征询 微信征询二维码
联系尊时凯时
400-168-4263
业务征询
美满信息后我们会第一功夫跟您联系
【网站地图】【sitemap】