星实StarGFS并行文件系统

StarGFS Parallel File System

 

申请测试
  • StarGFS brief introduction

    StarGFS简介

     

    StarGFS 并行集群文件系统

          StarGFS 是一款基于 POSIX 文件系统接口的领先并行集群文件系统,无需重写或修改现有应用程序即可直接使用。其设计高度注重极致性能与可扩展性,兼具灵活性与健壮性,同时易于使用。

          StarGFS 客户端通过高速以太网或 InfiniBand 网络与存储服务器节点通信,实现对文件系统数据的快速访问。系统将用户数据透明地分布在多个存储服务器上,随着服务器和硬盘数量的增加,所有存储资源在统一的文件系统命名空间内汇聚为整体容量与性能。因此,文件系统的性能和容量可轻松扩展至业务所需规模,并支持在生产环境中在线扩容。

          StarGFS 的高可扩展性大幅减少了对多个独立文件系统的依赖——无需为每个集群甚至每台 NFS 服务器分别部署独立的文件系统。统一的命名空间带来了显著的存储管理优势,例如避免了在多个文件系统间维护多份数据副本。正因如此,使用 StarGFS 所需的聚合存储总量远低于传统方案。同时,通过聚合多台服务器的 I/O 吞吐量,系统可随节点扩展线性提升性能。此外,动态添加服务器即可在集群投入运行后灵活调整吞吐量或容量。

          StarGFS 并行文件系统由三种核心模块组成:用于访问文件系统的客户端、提供文件 I/O 服务的智能存储节点,以及负责管理文件名与目录的元数据节点。图 1 展示了一个部署了 StarGFS 文件系统的集群架构。

    StarGFS form

     

    StarGFS组成

          StarGFS 将用户文件的元数据与文件块分离管理:文件块由智能存储服务器提供,存储用户的实际数据;元数据则是“关于数据的数据”,包括访问权限、文件大小以及文件块在存储服务器上的分布信息。客户端获取特定文件或目录的元数据后,可直接与智能存储服务器通信完成文件块的存取,元数据服务不再参与后续的读写操作。

          StarGFS 适用于所有需要大规模或高速文件存储的应用场景。尽管最初专为高性能计算设计,如今已广泛应用于工业与研究领域的各个行业,包括但不限于人工智能、生命科学、石油天然气、金融、音视频媒体和影像档案。其无缝的可扩展性也使得用户能够轻松应对快速增长过程中可能出现的不规则或不可预见的挑战。

    StarGFS Basic design concept

     

     

    StarGFS设计基础理念

          StarGFS 并行文件系统采用基于对象存储理念的架构,传统硬盘被集成了 CPU、网络与存储能力的智能存储节点所替代。智能存储节点将传统的块级接口升级为一种新型接口,客户端可通过该接口对更大且大小可变的命名对象进行字节范围的读写操作,从而将底层块分配决策下放至设备自身。客户端通常与元数据节点交互以执行元数据操作(如打开、重命名),同时直接与智能存储节点通信完成文件 I/O(读写),大幅提升了系统的整体可扩展性。

          StarGFS 文件系统通过元数据信息的任意写入实现无缝在线扩容。与传统文件系统采用固定位图(bitmap)设计不同,StarGFS 基于独立 SSD 存储提升性能,支持元数据信息任意写入。这种方式不仅提高了元数据的读写访问效率,还能根据实际文件数量动态创建新的元数据信息,并任意写入高速 SSD 存储中。扩容过程无需中断数据读写访问,从而确保更高的业务连续性。

     

    (3)支持单节点、双节点、分布式集群化部署

     

           StarGFS初始配置一台存储节点(智能存储节点)、两台存储节点即可实际上线使用,根据需要安装指定数量的硬盘。在初期部署双台存储节点的情况下,后续支持动态增加硬盘或者增加存储节点来扩展存储容量,容量区间可以从数TB按需扩展到数百PB,无需停机。

     

           StarGFS系统的安全性和读写性能可以随着硬盘数量的增多而随之提升。StarGFS系统更小化的初始部署能力,方便能够让并行文件系统从业务发展之初就进入到用户的业务系统中,并让文件系统能够持续在线扩展来支持业务的发展壮大所带来的高性能和大容量需求。

     

    (4)StarRAID提高数据安全性和空间利用率

     

           StarGFS摒弃了传统RAID技术以及存储节点之间的数据镜像、HA等复杂并且成本高昂的技术,采用了多副本和StarRAID N+M两种数据冗余模式等多种方式来保障数据的可靠性,并且可以针对单独的目录设置不同的冗余模式。在满足性能的前提下,用户可以根据业务的需求,灵活的调整性能优先策略或者容量优先的策略。

    StarGFS Core advantages

     

    StarGFS核心优势

           StarGFS的StarRAID N+M冗余功能可以支持在文件、块、对象等三种协议基础上大规模部署上线。相比传统常用的多副本策略,StarGFS可以在更少的硬件投入情况下,存储相同的数据容量和实现相同的容错能力:

     StarGFS的StarRAID冗余机制容错

    StarRAID冗余容错机制带来巨大的构建、使用成本优势

    (5)小文件容器化存储提高存储和检索效率

     

          StarGFS支持千亿级文件统一存储和高效率检索。StarGFS内部的系统采用了创新的小文件Container容器聚合存储技术,能够在前端呈现标准POSIX文件系统名字空间的同时,在后端小文件落盘存储的时候实现智能的聚合成大文件的方式来实际存储。

     

          StarGFS通过采用该技术将任何大文件、小文件都会被当做大文件一样的来存储和检索访问,完全消除了传统文件系统文件存储数量受限、文件检索效率低下等严重的数量和效率的问题,打破了传统存储的局限,将小文件创建、检索效率提高到传统存储的十倍以上,完全可以轻松应对任何存在海量小文件的业务场景。

    小文件性能优化效率变化

    (6)文件系统和对象存储互通

     

          StarGFS同时支持提供S3对象存储接口能力,同时还支持文件系统和对象存储实现数据互通的功能。业务可以根据S3NFS、CIFS、POSIX、HDFS等访问同一份数据,按需构建数据湖的存储平台。

    (7)广泛的应用场景支持

     

          StarGFS能够基于创新的StarRAID N+M冗余技术,消除设备级别的故障影响,并且能够同时提供文件系统、块设备、对象存储等全面的存储接口协议,提供更高的并发读写效率,从而能够在同一套系统中按需分配容量、接口协议等来支持广泛的业务应用场景。

    (1)高聚合读写性能

    单台全闪存储节点性能超过 180GB/s,单台混闪存储节点超过 7GB/s。

    聚合性能随磁盘数量增加线性增长。

          StarGFS 并行文件系统采用操作系统内核模块化的 POSIX 客户端与服务器端软件设计,结合线程池化的数据处理能力、优化的 N+M 纠删码以及优化的 RDMA 技术。在人工智能、HPC 等高并发读写场景中,能够充分发挥存储介质与存储网络的性能极限,满足应用端对更高数据读写性能的需求。

          同时,StarGFS 实现了成熟的多元数据节点集群技术与小文件容器化聚合存储技术,可提供每秒数十万次的文件检索访问,满足 AI、HPC 等场景中海量小文件的高性能存储与检索需求。

     

     

    (2)StarGFS支持按需实现存算融合、存算分离等部署架构,并实现统一管理

     

           StarGFS支持以下几种方式构建存储池:

    1. GPU服务器本地SSD存储池:StarGFS 可融合部署于 GPU 服务器中,利用服务器本地的 SSD / SATA 等存储资源,灵活构建并行文件系统存储池,供 GPU 服务器上运行的 AI 业务访问。即每台 GPU 服务器既承担计算任务,同时也作为存储节点参与存储资源配置。依托 NVMe SSD 优化的文件系统与 RDMA 技术,StarGFS 可为 AI 业务提供超高读写性能与极低访问延迟。
    2. CPU服务器本地SSD/SATA存储池:StarGFS 同样支持融合部署于 CPU 服务器中,利用服务器本地的 SSD / SATA 等存储资源,灵活构建并行文件系统存储池,供 CPU 服务器上运行的计算业务访问。即每台服务器同时承担计算任务与存储角色。
    3. 独立存储节点构建独立的存储池:StarGFS部署在独立的存储节点中,构建一个独立的共享存储池,按需分配给对应的业务应用使用。

     StarGFS按需实现存算融合、存算分离模式,并统一管理调度

  • Stargfs Specification sheet

     

    StarGFS规格表

    类别

    功能项

    功能说明

    基础功能

    物理服务器性能监控

    支持监控服务器CPU、负载、内存、网络等硬件状态信息

    物理磁盘监控

    支持监控存储介质读写IOPS、带宽

    告警设置

    支持邮件告警推送

    实时健康管理

    支持对物理服务器、存储介质、存储池数据冗余状态监控及管理,支持存储介质根据SMART信息预测设备寿命,提醒坏盘可能。

    容量预警

    支持容量预警

    磁盘定位

    支持通过点灯进行硬盘定位的功能,支持在监控界面显示磁盘物理槽位。

    告警管理

    告警中心功能是基于资源层面的告警规则(如CPU、内存、硬盘等的利用率及集群中各个资源的使用状态),设置告警规则和通知列表,在存储系统的各级软硬件产生故障时,由管理控制台向管理员提示告警,有助于及时了解资源使用情况和处理突发事件。支持自定义告警通知,同时支持邮件告警。

    数据均衡控制

    支持数据自动/手动平衡,使各个存储设备的使用量更加均衡。并且均衡得动作可控制,无强制性得数据均衡。

    块存储

    卷和快照管理

    支持卷管理操作,精简配置,在线扩容。

    支持秒级快照。

    支持克隆。

    QoS

    支持卷级Qos,灵活设置业务优先级,支持在线调整Qos,实时生效

    块设备传输协议

    系统采用前端切片技术,保证数据安全性的同时,提升数据读写效率,并提供专用、高速、安全的分布式块访问协议

    iSCSI

    IP SAN访问接口

    ACL访问控制

    支持分别基于Target和卷的ACL访问控制。

    对象存储

    S3协议支持

    支持Amazon S3标准接口,兼容S3生态体系

    S3用户权限管理

    定义不同用户的权限和配额,不同的用户拥有不同的操作权限,同时会限制不同用户的总容量、总存储桶、总对象数配额。

    文件存储

    AD、LDAP、NIS

    支持接入AD域、LDAP域、NIS

    权限管理

    自带客户端以及用户访问权限机制,可设置增强型ACL

    文件快照

    支持文件系统秒级快照。

    文件系统级克隆

    支持文件系统级链接克隆及独立克隆。

    在线扩容

    支持文件系统在线扩容。

    文件传输协议

    系统采用前端切片技术,保证数据安全性的同时,提升数据读写效率,具有专用、高速、安全的分布式文件访问协议。

    FTP、CIFS/SMB、NFS

    支持FTP、NFS、CIFS/SMB 1.0/2.0/3.0等标准访问访问接口

    配额管理

    支持基于文件夹的配额管理,管理员可以指定文件夹的可用容量,并随时监控该文件夹的容量使用情况。

    数据迁移

    支持不同存储系统间及单套系统内数据高速迁移,迁移过程中不影响应用正常使用数据;且迁移速度达到网络带宽90%以上利用率。

    WROM

    支持WORM,一次写入,多次读取,以防止重要数据被篡改。

    异地备份

    支持异地备份

    云集成能力

    虚拟化平台接入

    支持OpenStack、VMWare等虚拟平台接入,并支持容器的平台接入

    数据可靠

    副本和EC纠删码

    支持多副本,支持在线修改副本数。采用优化的EC算法,以少量的冗余信息保证数据可靠性,比多副本机制获得更多的有效存储容量。支持N+M等多种纠删保护机制。同时支持块、对象、文件存储。

    恢复控制

    系统可在线控制数据修复流程,根据应用负载情况可随时人工停止或者启动数据修复流程

    数据恢复QoS控制

    系统可自动故障修复,无需热备磁盘。系统自带磁盘检测机制,可实时监测硬盘的IO读写延迟,并进行预判硬盘的损坏程度,发现不稳定磁盘后,系统可自动禁止此磁盘进行写操作。系统可在线控制数据修复流程,根据应用负载情况可随时人工停止或者启动数据修复流程。

    审计安全

    全面审计记录

    所有系统操作、维护、IP信息等记录,在线动态定制日志级别,在线定制操作日志,更改定制内容无需重新挂载,无需停机维护;

    软硬件兼容

    客户端操作系统支持

    支持操作端文件共享协议软件,支持操作系统:Microsoft Windows,RedHat Linux,Centos,debian, ubuntu,Suse/OpenSuse,MacOS,麒麟等国产操作系统

    硬件平台支持

    单套系统支持所有通用X86服务器,支持多品牌同时使用;可在此基础上同时支持国产飞腾、鲲鹏、申威、龙芯等硬件平台

    SAS SSD、 NL-SAS、SATA

    兼容SAS、NL-SAS、SATA HDD、SATA SSD等接口,支持磁盘分组

    40GE、25GE高速网络支持

    全网络支持Infiniband/RoCE网络实现RDMA访问。

    数据缓存

    SSD读写缓存

    支持SSD 读写缓存

    内存缓存

    支持将元数据缓存在客户端或者数据服务器内存中,提高访问效率

    硬件利旧

    服务器利旧

    支持服务器利旧,可将旧x86架构服务器加入至存储池中,可整合标准 SAN、NAS及JBOD,不限品牌。使用存储资源时不会局限在一个存储设备,可将众多存储设备集合成一个大的虚拟存储资源池

    扩展能力

    线性扩展

    支持随着系统规模的增加,系统性能和容量线性提升。

    卷在线扩展

    支持不中断业务的情况下进行卷级扩容。

    多资源池

    支持集群中不同存储介质分别建立资源池,系统可保证统一视图的前提下,实现硬盘与存储目录绑定机制,按需规划所有某目录下存放的文件都放置在那些硬盘中。

  • 说明书下载

    Stargfs Manual Download

     

    StarGFS说明书下载

  • Stargfs Technical video

    StarGFS技术视频