最新发布第58页
Kafka集群测试实战-AI运维探索者

Kafka集群测试实战

一、方式一 新起一个容器 1.运行一个kafka-client,用于连接kafka集群 上面参数说明: * `kubectl run kafka-client`: 使用 `kubectl` 命令创建一个名为 `kafka-client` 的 Pod * `--restart='Ne...
Prometheus 黑盒监控:外部域名的 HTTP 与 POST 探测-AI运维探索者

Prometheus 黑盒监控:外部域名的 HTTP 与 POST 探测

一、HTTP 监控(监控外部域名) 按上面方法重载 Prometheus,打开 Prometheus 的 Target 页面,就会看到 上面定义的 `blackbox-external-website` 任务 二、HTTP Post 监控(监控外部域名) 按...
GPU 监控进阶:Prometheus 接入 dcgm-exporter 与显卡大盘-AI运维探索者

GPU 监控进阶:Prometheus 接入 dcgm-exporter 与显卡大盘

一、为什么还需要 `dcgm-exporter` `node_exporter` 能看到系统级指标,但看不到足够细的 GPU 运行细节。而大模型推理和训练最关心的常常是: * GPU 利用率; * 显存占用; * 温度和功耗; * 显...
Jenkins流水线入门:核心概念与分类-AI运维探索者

Jenkins流水线入门:核心概念与分类

一、什么是Jenkins流水线 Jenkins 是领先的开源自动化服务器。它使用 Java 构建,提供了超过 1,800 个插件来支持几乎任何东西的自动化,因此人类可以花时间做机器不能做的事情。 Jenkins流水线...
Zabbix 自动接入与分布式监控实践-AI运维探索者

Zabbix 自动接入与分布式监控实践

一、自动添加主机 自动添加主机并关联模板 | 自动添加主机方案 | 含义 | 应用场景 | |----------------------|---------------------------------------------------------------------|-------...
Job 实践:创建任务、查看状态与并发执行-AI运维探索者

Job 实践:创建任务、查看状态与并发执行

一、Job实践 1.1 Job创建 1.1 方式一:命令行格式 1、创建一个job 2、查看job 回显内容说明: * DURATION:表示 Job 从开始执行到最后一个 Pod 完成的时间长度 * COMPLETIONS:表示 Job 当前已...
云原生技术体系详解:微服务、容器、DevOps与服务网格-AI运维探索者

云原生技术体系详解:微服务、容器、DevOps与服务网格

一、云原生技术体系为什么是一个组合拳 云原生技术体系通常包含下面几个关键组成部分: - 微服务 - 容器 - 持续交付 - DevOps - 云原生十二要素 - 服务网格 - 声明式 API - 容器编排 - Serverle...
Ingress 常见报错排查:404、413、503、504 与 CORS 处理-AI运维探索者

Ingress 常见报错排查:404、413、503、504 与 CORS 处理

一、404(Not Found)报错 404表示访问的路由不存在,通常问题如下: * 1) Ingress 路径配置的不正确 * 2) Ingress 的配置未被Controller 解析 * 3) 未使用正确的域名和路径访问 * 4) 代理...
MySQL多表查询实战:笛卡尔积、内连接、外连接与驱动表-AI运维探索者

MySQL多表查询实战:笛卡尔积、内连接、外连接与驱动表

一、多表查询方式类型:笛卡尔乘积 实现局域teacher表与course表进行多表关联; 多表关联实际操作: 多表查询的逻辑思路 二、多表查询方式类型:内连接(取交集) join,其实就是'inner join',为...
持续交付体系设计:价值分析、配置管理与环境管理-AI运维探索者

持续交付体系设计:价值分析、配置管理与环境管理

一、L1量身定制你的持续交付体系 1.1 持续交付到底有什么价值? 1.1 持续集成、持续交付和持续部署的关系 我们通常会把软件研发工作拆解,拆分成不同模块或不同团队后进行编码,编码完成后,进...