【运维平台开发】佬们给点思路

玉皇大弟弟 2026-09-04 15:47 1

1、目前平台上有监控告警 监控有自己的面板,也用代理接入了Grafana



2、有SSH普通的功能 + 黑白名单配置、和批量运维的ansibe功能 简单剧本修改 历史版本维护

3、监控告警直接对接Prometheus,Prom的告警直接第一手发到平台进行解析,存储告警历史、配置模板、发送钉钉机器人

4、网络探测 网络探测大屏、探测任务TCP HTTP-get/post

5、K8S相关基础运维 资源的各种操作,Chart发布维护

6、AI助手,接入大模型API 巡检资源主要是对接mcp/系统内部tools来做。然后通过Prom来监控模型的token使用情况.




7、资产管理 管理一些物理设备 丑陋的机房3d图




8、审计日志相关

9、各种 数据库管理、Rocket管理、Minio管理、Mcp管理






待开发。。。。


10、老大需求 想做一个管理多态GPU、XPU、NPU等各种卡的平台,根据租户进行分发模型,付费模式根据量 或者 时长。 目前这个我想到的是用 docker来做,先在平台上管理有卡的服务器,然后用过docker来启动模型容器给用户分配对应的卡的数量 启动在页面上有一套模板参数可以修改,然后启动后再集成sub2api到我的平台里,在sub2上吧这些key统一管理然后去分配,请教佬们有什么好方案。

最新回复 (11)
  • 浣熊 09-04 15:59
    1

    我也在做类似的东西,不一样的是我用来管理网络设备,头疼中

  • Hentai 09-04 15:59
    2

    融合的好舒服啊,看着是真的美观,跟一些乱加纳管的好太多了

  • 玉皇大弟弟 楼主 09-04 16:01
    3

    我也在做类似的东西,不一样的是我用来管理网络设备,头疼中



    我做运维主要是业务方面的,还接触的物理设备少交换机和路由器的东西。所以目前我在平台上只做了SSH联通

  • LastHuman 09-04 16:02
    4

    考虑开源吗?

  • 玉皇大弟弟 楼主 09-04 16:03
    5

    融合的好舒服啊,看着是真的美观,跟一些乱加纳管的好太多了



    都是自己运维经验理解,怎么方便怎么来。增加ssh主机时,可以俩种方案

    1、直接增加ssh配置信息.

    2、从资产管理中增加

  • 玉皇大弟弟 楼主 09-04 16:04
    6

    还在考虑中,目前python版本已经没啥大毛病了。目前还在着手go的重构,进度一半多了。

  • Hentai 09-04 16:05
    7

    搞个跳板机平台出租虚拟机是不是也可以,有些可能不是买模型买虚拟机我看你们资源好多

  • Main 09-04 16:06
    8

    服务器资产那里,将表导入进去可以AI自动核对信息吗,比如mac,序列号,主机名,而且会考虑加每台服务器的用途吗?

  • 玉皇大弟弟 楼主 09-04 16:13
    9

    没必要校验,因为一半你拿到对方或者谁给的资源清单都是一个execl,上面有这些信息了,而且校验你没有真实数据 这不还是绕回来了,真实数据就是你上传的。

  • 玉皇大弟弟 楼主 09-04 16:14
    10

    些可能不是买模型买虚拟机我



    这个属于是公司内部的运维纳管平台,不属于对外的公有云租赁。

  • 玉皇大弟弟 楼主 09-04 16:18
    11

    Dra 不能完美支持 NPU、XPU

* 帖子来源Linux.do
返回