品目1:AI(人工智能)训推一体机 5台 国产 信息中心
一、技术参数
★1.单台CPU(中央处理器)配置:国产C86架构(一种国产高性能通用 CPU 架构),数量≥2颗,单颗 CPU(中央处理器) 基准频率≥2.7GHz(千兆赫兹),单颗 CPU(中央处理器) 核心数≥64核,单颗CPU(中央处理器)功耗≤400W(瓦)。
★2.单台内存配置:内存规格DDR5 RDIMM(多路复用秩双列直插式内存模块),总容量不少于1536GB。
★3.单台存储配置:配置不少于4块3.84TB(存储单位:太字节) NVMe-SSD 硬盘(一种采用M.2接口外形、使用NVMe协议的固态硬盘);配置不少于2块 480GB(存储单位:吉字节)SATA-SSD硬盘( 一种SATA接口技术的固态硬盘)。
★4.单台网卡配置:不少于4块400G(数据传输单位:千兆比特每秒)单口光网卡,不少于1块25G(数据传输单位:千兆比特每秒)双口光网卡,均含配套光模块及线缆。
★5.单台AI(人工智能)加速模组:类CUDA技术架构(通过某些兼容CUDA的技术手段实现模型训练和推理的技术手段),配置不少于 8个OAM (开放加速模组)规格加速计算模组;模组显存采用HBM3类型(第三代高带宽内存),单模组显存容量≥96GB(显存容量单位);单模组FP16算力≥290T(人工智能算力单位),单模组功耗≤400W(瓦),模组互联带宽≥400GB/s(数据传输单位:每秒传输吉字节)。
★6.单台RAID卡(阵列卡)配置:不少于1块12G SAS RAID卡(指基于“12Gb/s SAS(Serial Attached SCSI)”接口标准的磁盘阵列技术),缓存容量≥4GB,配备掉电保护模组,支持硬盘热插拔与故障预警。
★7.单台电源配置:不少于3+3冗余,支持热插拔。
★8.单机高度≤8U(U指高度单位)。
★二、配置
1.AI(人工智能)训推一体机5台。
单台配置:
1.1国产C86架构CPU≥2颗(核心数≥64核)。
1.2内存总容量不少于1536GB。
1.3存储NVMe-SSD 硬盘配置不少于4块3.84TB,SATA-SSD固态硬盘配置不少于2块 480GB。
1.4网卡不少于4块400G,不少于1块25G双口光网卡,均含配套光模块及线缆。
1.5配置不少于 8个OAM (开放加速模组)规格加速计算模组。
1.6配置不少于1块12G SAS RAID卡,缓存容量≥4GB,不少于3+3冗余电源。
★三、售后服务
1.AI(人工智能)训推一体机质保3年。
品目2:大模型训练工具链平台 1套 国产 信息中心
1.平台应支持模型全生命周期管理能力,包括模型导入、版本管理、训练和部署流程管理,支持基于模型类型和算力资源的分类管理。
▲2.平台应支持国内外开源大模型的接入与纳管,包括但不限于:DeepSeek、Qwen、GLM、Kimi、MiniMax等模型(解释说明:DeepSeek、Qwen、GLM、Kimi、MiniMax均为模型名称)。平台应兼容Transformers,vLLM, SGlang, TRT-LLM, LlamaFactory,Deepspeed等大模型训推框架(解释说明:Transformers,vLLM, SGlang, TRT-LLM, LlamaFactory,Deepspeed均为大模型训推框架名称)。
3.平台应支持Post-pretrain(后预训练)训练能力,基于大规模纯文本数据开展预训练任务。平台应支持多机分布式训练,支持训练任务的超参数配置与管理。
4.平台应支持多种数据源接入,包括自有调优数据集、公开数据集和存储系统,支持训练数据的统一管理。
5.平台应支持训练任务的资源配置管理,包括但不限于资源池选择、实例数量、CPU(中央处理器)核数、内存大小、AI(人工智能)加速卡类型和数量等参数配置。
6.平台应支持训练任务的监控与状态管理,能够查看任务配置、运行状态、资源使用情况等关键信息。
▲7.平台应支持训练任务的继续训练能力,能够基于Checkpoint(检查点)恢复或继续训练任务。
▲8.平台应支持DPO(直接偏好优化)偏好对齐训练能力,基于偏好数据进行模型对齐训练,支持训练任务的全生命周期管理(创建、运行、停止、删除)。
▲9.平台应支持RFT(强化学习微调)训练能力,支持通过自动化生成的奖励信号驱动模型优化,让模型通过多轮试错和反馈逐步提升推理能力。支持训练任务的全生命周期管理(创建、运行、停滞、删除)。
▲10.平台应支持模型蒸馏功能,支持选择教师模型和学生模型,数据集的导入、多种大模型网络、不同训练类型,训练资源的配置。支持展示训练任务列表,支持查看训练任务详情,支持对模型蒸馏训练任务进行停止、发布、删除。
▲11.平台应支持判别式AI(人工智能)模型训练,提供包括但不限于Notebook(交互式编程环境)建模,作业建模等训练方式。其中:Notebook(交互式编程环境)建模功能,可为用户提供web(指在互联网上不同类型的设备之间进行通信的过程中使用的各种工具和技术)交互式开发环境(可视化界面),对原生Notebook(交互式编程环境)进行定制与扩展。
12.平台应支持模型评估能力,提供判别式AI(人工智能)评估和裁判员评估两种模式。支持评估任务的创建与管理,包括评估对象选择、评估方法配置(支持自动规则打分)、评估数据集选择等。支持评估结果的可视化展示和报告生成,支持评估结果导出功能。
13.平台应支持将模型管理中纳管的大模型发布为在线服务进行管理,创建服务支持选择实例数。服务详情支持查看在线服务信息及查看/编写接口信息,服务信息包含创建服务的基本信息、资源配置、运行状态。
▲14.支持判别式服务管理,可支持创建HTTP(超文本传输协议)在线预测服务,发布在线服务供上层应用集成调用底层AI(人工智能)能力。支持基于平台构建模型及镜像的方式启动服务,使用人员可以将自己的模型制作成镜像,上传到镜像管理,使用预测服务将模型/镜像发布为服务,使用人员可以为自己的服务设置存储挂载、需要的资源和其他配置。
▲15.支持判别式模型服务管理,支持将模型部署包以服务形式下发至边缘节点,支持对边缘节点进行统一纳管,创建并激活边缘节点,支持查看边缘节点连接状态、运行模式、模型服务、资源监控等。
▲16.平台支持统一纳管模型训练与评估用数据集。支持管理大语言模型及多模态模型训练与评估用途的文本数据集以及多模态数据集;支持管理小模型训练与评估用途的物体检测、图像分类、图像分割(实例分割、语义分割)数据集。
▲17.预置开源公开数据集促进算法研究和开发。此数据集可直接被用于模型训练和模型评估任务。
▲18.支持创建资源池,且将资源池关联至组织和项目,创建时需校验资源池名称唯一性。支持编辑资源池。支持资源池删除。支持配置资源池可用服务,支持配置资源池是否可排队,资源池支持排队&不可排队两种,在资源分配时,可排队资源校验单节点资源配额,不可排队资源校验单节点剩余资源配额。
▲19.支持通过设定资源空置时间范围,定义出空闲资源池,可对空闲资源池进行回收。支持通过设定时间范围内,CPU(中央处理器)使用率峰值、内存使用率峰值、AI(人工智能)加速卡使用率峰值设置低利用率资源池,可对低利用率资源池进行回收。
▲20.支持国内外AI(人工智能)加速卡(如昇腾系列、昆仑芯系列、寒武纪系列、海光DCU深度计算处理器、天数智芯等)的兼容与调度管理,支持算力vGPU虚拟化(人工智能加速卡的一种虚拟化技术)。
21.支持查看资源池Pod(Pod是云资源中最小的部署和管理的基本单元)列表,包括pod(pod是云资源中最小的部署和管理的基本单元)名称、任务名称、执行状态、资源占用量 /申请量。支持对接入Pod(Pod是云资源中最小的部署和管理的基本单元)任务管理下所有pod(pod是云资源中最小的部署和管理的基本单元)关联任务进行查看,并关联任务跳转方便进行任务管理。
22.支持查看所有资源池的CPU(中央处理器)、内存、AI(人工智能)加速卡的总量、已使用量、剩余量,并支持对这些指标排序。支持对空闲资源池、低利用率资源池手动操作资源回收。
23.支持设置机器池分配规则,设置该机器池为平台所有项目共享,或绑定特定组织。支持节点迁移,将某机器池的节点迁移到另一个机器池。
24.支持通过存储卷管理平台存储资源,将存储资源分配给组织&项目、设置默认存储卷、设置组织层级的默认存储卷、支持修改默认存储卷,确保平台组织&项目下业务任务平稳运行。
▲25.平台提供系统概览、节点监控、Pod(Pod是云资源中最小的部署和管理的基本单元)监控、集群监控、系统服务监控、自定义监控等多种看板,支持多集群监控。
26.针对平台业务遇到问题,支持告警规则的创建、展示、更新、删除等操作,设置项包括规则名称、监控项、阈值、持续时间、告警等级、告警对象等,告警规则支持表单配置、PromQL(名为“Prometheus 监控系统”的主要查询语言,用于从时间序列数据库中检索和聚合数据 )配置,支持不少于5种告警等级设置。在告警管理中可展示告警事件的列表,可删除告警事件;告警事件包括规则名称、监控维度、监控项、持续时间、阈值、告警值、告警级别等内容。
▲27.支持对模型服务的整体调用情况进行统计,包括但不限于调用接口数、调用总量、调用失败次数、调用总 token(词元)数、输入 token(词元)数、输出 token(词元)数。支持对每个模型服务的调用数据进行监控及可视化数据看板展示。
▲28.支持对API-KEY(调用软件服务的“数字钥匙”)进行统一管理,包括创建、列表展示、编辑、删除。支持用户携带API-KEY(调用软件服务的“数字钥匙”)请求模型服务API(应用程序编程接口)接口,进行鉴权认证访问。
▲29.在使用大语言模型进行推理时,可通过开启安全服务来确保推理过程的安全性。安全服务开启后,全局可见,用户在创建模型服务时可选择是否接入安全服务。支持用户创建文本。
30.支持干预规则和干预词典的干预机制,支持用户创建、导入导出、删除和编辑的操作。
31.平台提供多种调度策略,满足不同场景的精细化调度需求。
32.平台支持针对碎片化算力资源进行管理和利用。
33.平台支持构建医疗行业场景模型数据集。
34.平台支持多种模型训练方案保障行业场景模型的训练效果和效率。
35.平台如何支持医疗行业场景模型的测试与评估能力,保障模型效果评估的合理性和科学性。
36.平台支持灵活多样的部署方案,能够满足不同规模算力集群的纳管需求。
37.平台支持高可用和灾备部署方案,能够保障底层模型服务的稳定性与连续性。
38.平台支持PD分离(一种将大语言模型推理过程拆分为预填充和解码两个独立阶段,并部署在不同计算资源上的优化架构)。
39.平台支持与院内现有存储(型号:长虹佳华NS A130)对接。
★40.含不少于5个节点AI(人工智能)训推一体机纳管许可。
★二、配置
1.大模型训练工具链平台1套(含不少于5个节点AI(人工智能)训推一体机纳管许可)。
★三、售后服务
1.大模型训练工具链平台质保3年。