(来源:青云科技)
近日,由中关村云计算产业联盟牵头的《通算智算一体化云基础设施总体技术要求》团体标准编制工作正式启动。青云科技作为参编单位深度参与本次标准建设,将自身企业级 AI 基础设施的落地实践融入标准编制,推动通算智算一体化产业共识的形成。
《通算智算一体化云基础设施总体技术要求》团体标准面向中心云、边缘云多元部署场景,覆盖 AI 推理、智能体应用、通用业务处理、多业务混合承载等主流业务,重点对通算、智算、存储资源统一纳管、协同调度建立技术准则,同时明确接口兼容、安全可靠、运维运营、测试评价等多维度规范,为通智一体基础设施建设提供依据。后续该团体标准还将推进向国家标准升级申报。
青云科技于今年正式确立了企业级 AI 基础设施(AI Infra)与解决方案提供商的核心战略定位,以 AI 原生理念驱动全栈产品体系重构。依托 KubeSphere 内核打造的 UniDock 统一智能底座,打通虚拟化、云、云原生与 AI 智算能力,实现算力资源从分散孤立走向一体化统一供给。这条技术演进路线,与本次标准倡导的通智一体、存算分离、统一纳管、协同调度、开放兼容、可运营等核心诉求高度契合。
从 “多套平台” 到 “一套底座”
统一管控是通智一体化的起点
通算智算一体化的核心,不只是具备 GPU 算力,更要实现异构计算资源在同一技术体系下识别、管理与调度。本次标准草案将统一管控平台、资源池化、跨集群协同、多元算力协同作为核心要求,通过管理调度层完成资源管理、调度、监控、计量与运维,推动通算、智算、存储、网络,从分散设备、独立平台转变为可统一编排、按需供给的基础设施能力。
青云科技产品体系正沿着该方向持续迭代。KubeSphere 作为全栈产品统一的技术基座,持续优化多集群治理、节点组管理、租户资源隔离、异构基础设施纳管、弹性调度、可观测等核心能力;底座的统一让虚拟机、容器、AI 推理等多种工作负载可共享底层基础设施能力,规避多平台重复建设、重复适配难题。 对于企业客户而言,一体化不是各类软硬件简单堆砌,而是支撑传统业务与 AI 业务,在同一套基础设施之上持续迭代演进。
从 “设备接入” 到 “算力协同”
把异构硬件变成可调度算力池
当前产业内 NVIDIA GPU、国产 GPU/NPU 等多元芯片并存,行业诉求已经从 “硬件设备能否被平台识别” 升级为 “异构算力统一抽象、分配、度量、面向业务任务调度”。标准草案针对 GPU/NPU/TPU 智算资源、GPU 共享、多任务排队、任务优先级抢占、弹性伸缩、多租户隔离、跨资源池调度提出明确规范,标志异构算力建设,从硬件兼容迈入协同运营新阶段。
青云 AI 智算平台可面向多区域、多业务完成算力统一管理与分布式调度,兼容 NVIDIA GPU 以及多款国产 GPU、NPU 芯片,构建灵活可调度的算力资源池,支持 GPU 虚拟化等多样化供给模式。通过统一资源模型 + 统一调度平面 + 上层任务编排架构,青云将孤立硬件资产转化为面向 AI 推理、工程计算、通用业务按需交付的服务能力,最大化释放算力价值。
从 “算力堆叠” 到 “算存协同”
补齐 AI 基础设施的数据效率短板
AI 业务整体性能,并不单纯取决于算力峰值。模型加载、数据集读取、向量检索、推理缓存、检查点保存、多实例模型共享,都会受存储吞吐、访问时延、网络能力深度制约。为此,标准草案专门增设存储资源与存算分离独立章节,对统一共享访问、弹性扩展、多协议接入、数据保护、冷热分层、AI 推理场景数据访问优化做出要求,正式将数据基础设施纳入通算智算一体化整体架构。
青云拥有全栈自研存储与云原生数据能力:QingStor 对象存储兼容 S3、RESTful API,作为模型、数据集、业务数据统一存储入口;QingStor NeonSAN 全闪块存储结合 RDMA 技术,保障高性能核心业务;KubeSphere 集成 Fluid 云原生数据编排,实现 NFS、对象存储本地缓存与数据预取,消解远程访问 I/O 瓶颈。 由此实现计算灵活编排、存储独立扩缩容、业务数据高效访问的存算协同体系。
从 “技术可用” 到 “生产可运营”
标准聚焦落地建设、验收与持续运维
一套通算智算一体化基础设施,不能仅以硬件规模、理论性能作为评判标尺。标准草案覆盖多集群治理、弹性伸缩、监控告警、计量审计、自动化运维、安全可靠性、测试评价,从功能完备、性能、安全、运维多维度建立评价体系,更加看重生产环境稳定性、资源利用率、故障恢复、可观测与运营能力。
青云 UniDock 统一智能底座继承 KubeSphere 内核能力,具备面向生产环境的多集群治理、节点精细化管控、弹性伸缩、监控告警、日志审计、全链路可观测能力;青云 AI 智算平台面向算力中心建设运营,完成多区域多业务资源整合、可视化监控、精细化运维、算力统一调度。 青云将把大量生产落地实践沉淀为可验证的标准条款与测试方法,让标准不仅定义 “需要具备什么能力”,更能够指导产业 “如何建设、如何验收、如何长期运营”。
坚持开放兼容
以标准化接口降低产业协同成本
通算智算一体化,不等于封闭的一体化。芯片、服务器、存储、网络、云平台、AI 应用会长期多元共存,成熟的基础设施,需要依靠开放接口、标准化适配降低生态接入成本。本次标准草案纳入 RESTful API、gRPC、OpenAPI、Kubernetes 原生 API、CNI、CSI、异构设备接入、跨平台互通等接口兼容性要求,贯彻 “统一而不封闭” 的设计理念。
开放也是青云一贯坚持的技术路线。KubeSphere 基于 Kubernetes 构建插件化可扩展架构;QingStor 对象存储原生兼容 S3 标准接口;AI 智算平台开放应用框架,向上层训练、推理业务输出算力与平台能力。 在标准编制过程中,青云将推动 “标准接口 + 插件适配 + 分层能力 + 可验证测试” 落地,减少重复适配,规避厂商绑定,让不同技术路线在统一规则下协同创新。
《通算智算一体化云基础设施总体技术要求》团体标准的编制,将打通产业链上下游共识,为资源管理、接口兼容、运营评价建立统一 “行业语言”。作为全栈自研企业级 AI Infra 服务商,青云科技将持续深度参与标准起草各项工作,输出在统一资源管理、异构算力调度、云原生、多集群治理、存算协同、开放接口、生产级运维领域的实践经验,携手中关村云计算产业联盟及广大产业伙伴,共同完善标准、推动落地,助力企业打造适配 AI 与智能体时代的的数智化基础设施。