最新发布第8页
Kubernetes容忍Toleration入门:概念、配置方式与使用示例-AI运维探索者

Kubernetes容忍Toleration入门:概念、配置方式与使用示例

一、什么是容忍 容忍度(Toleration)是应用于 Pod 上的。容忍度允许调度器调度带有对应污点的 Pod。 容忍度允许调度但并不保证调度。 污点和容忍度(Toleration)相互配合,可以用来避免 Pod ...
大模型微调入门:为什么需要微调与常见技术路线-AI运维探索者

大模型微调入门:为什么需要微调与常见技术路线

一、为什么需要微调 微调的核心价值,通常体现在下面几个方面: * 解决预训练模型“通用但不够专”的问题。 * 处理目标场景与预训练数据之间的数据分布差异。 * 在有限计算资源下,用更高效的方...
Prometheus监控Etcd实战:证书、Service与ServiceMonitor-AI运维探索者

Prometheus监控Etcd实战:证书、Service与ServiceMonitor

一、Prometheus监控云原生应用流程 上面流程图说明: 针对云原生应用一般本身都存在一个/metrics接口,我们需要配置一个Service指向云原生应用(集群外部的应用需要应用Service指定具体IP)。同...
Prometheus 集群监控:接入 etcd-AI运维探索者

Prometheus 集群监控:接入 etcd

一、**etcd** >由上可知,启动参数里面有一个 --listen-metrics-urls=http://127.0.0.1:2381 的配置,该参数就是来指定 Metrics 接口运行在 2381 端口下面的,而且是 http 的协议,所以也不...
Zabbix 邮件与企业微信告警配置实战-AI运维探索者

Zabbix 邮件与企业微信告警配置实战

一、告警分类 | 报警方式 | 企业应用场景 | |--------------------------------------|--------------------------------------------------| | 发邮件 | 企业邮箱,免费使用 | | 企业微信-告警...
Rancher节点管理与维护-AI运维探索者

Rancher节点管理与维护

一、管理节点的标签 1.1 增加节点标签 1、给10.0.0.20节点添加gpu=true标签 2、后台进行查看 1.2 删除节点标签 1、给10.0.0.20节点删除gpu=true标签 2、后台进行查看,此时为空,代表节点标签删...
Prometheus:使用PromQL查询监控指标-AI运维探索者

Prometheus:使用PromQL查询监控指标

一、什么是PromQL PromQL(Prometheus Query Language)是Prometheus内置的数据查询语言,其提供对时间序列数据丰富的查询,聚合以及逻辑运算能力的支持。并且被广泛应用在Prometheus的日常应用当...
Dify+Elasticsearch MCP:搜索与日志运维智能体-AI运维探索者

Dify+Elasticsearch MCP:搜索与日志运维智能体

一、准备ElasticSearch环境 服务器:Rocky9 2C4G 1.1 配置yum仓库 1.2 dnf安装es 1.3 修改配置 1.4 设置主机名 1.5 启动服务 1.6 设置elastic用户密码 访问 1.7 基础操作 创建索引 假设我们要创...
Claude Code 与 Codex:命令行 AI 编程助手实战-AI运维探索者

Claude Code 与 Codex:命令行 AI 编程助手实战

一、Claude Code 是什么 Claude Code 是 Anthropic 推出的终端原生 AI 编程助手,核心特点是: 直接运行在命令行里; 更适合复杂任务、多步骤修改和大型代码库理解; 能把自然语言指令转成实际...
使用 Zabbix 监控 Nginx 服务与 80 端口状态-AI运维探索者

使用 Zabbix 监控 Nginx 服务与 80 端口状态

一、自定义nginx模板 1.1 客户端安装nginx 1、进入nginx官网,复制官方yum源 Nginx官网链接: <img src="https://bucketbucket1.oss-cn-beijing.aliyuncs.com/imag/d5df0ed2a9d0_