- k8s简介 k8s简介
- 去年我们把一套老业务从自建机房的Kubernetes集群迁移到华为云CCE,前后折腾了三周,踩了不少坑。分享几个印象最深的,给准备做迁移的同行提个醒。第一个坑:存储类不兼容我们老集群用的是自建的NFS Provisioner,动态创建PVC时自动分配存储。迁移到CCE后,PVC一直挂不上,报waiting for volume to be created。检查后发现,CCE默认的Storag... 去年我们把一套老业务从自建机房的Kubernetes集群迁移到华为云CCE,前后折腾了三周,踩了不少坑。分享几个印象最深的,给准备做迁移的同行提个醒。第一个坑:存储类不兼容我们老集群用的是自建的NFS Provisioner,动态创建PVC时自动分配存储。迁移到CCE后,PVC一直挂不上,报waiting for volume to be created。检查后发现,CCE默认的Storag...
- 在华为云CCE集群里,业务Pod访问Service或外部域名时偶发超时,很多时候并不是应用代码或容器网络先出问题,而是DNS解析链路在某个环节被拖慢。要真正做好华为云CCE DNS解析超时排查,得先搞清楚CoreDNS在集群内到底承担什么角色,以及一次DNS请求从Pod发出到返回应答中间经过哪些节点。 在华为云CCE集群里,业务Pod访问Service或外部域名时偶发超时,很多时候并不是应用代码或容器网络先出问题,而是DNS解析链路在某个环节被拖慢。要真正做好华为云CCE DNS解析超时排查,得先搞清楚CoreDNS在集群内到底承担什么角色,以及一次DNS请求从Pod发出到返回应答中间经过哪些节点。
- 镜像拉取超时和镜像拉取失败在 Kubelet 日志里经常被混在一起,但成因不同。 镜像拉取超时和镜像拉取失败在 Kubelet 日志里经常被混在一起,但成因不同。
- 容器刚启动就退出,日志一闪而过,Pod 状态在 Running 和 CrashLoopBackOff 之间反复横跳——这是 Kubernetes 运维中最容易“一看就懵”的现场。排查 CCE 容器 CrashLoopBackOff 问题时,多数人上来就盯着 Exit Code,但真正绊住脚步的往往是探针误判、事件被刷掉这些藏在细节里的坑。下面从状态机制本身展开,理清排查的逻辑起点。 容器刚启动就退出,日志一闪而过,Pod 状态在 Running 和 CrashLoopBackOff 之间反复横跳——这是 Kubernetes 运维中最容易“一看就懵”的现场。排查 CCE 容器 CrashLoopBackOff 问题时,多数人上来就盯着 Exit Code,但真正绊住脚步的往往是探针误判、事件被刷掉这些藏在细节里的坑。下面从状态机制本身展开,理清排查的逻辑起点。
- 当 Kubernetes 集群中的 AI 推理服务每隔几分钟就触发一次重启,而业务端只感知到请求超时和 SLA 下滑,很多团队的直觉是代码出了 Bug。但从大量生产环境故障复盘来看,健康检查误判、GPU OOM 和调度资源竞争才是高频根因,且这些故障在日志中往往不会留下明显的异常堆栈。下面从现象层面对这类问题做拆解。 当 Kubernetes 集群中的 AI 推理服务每隔几分钟就触发一次重启,而业务端只感知到请求超时和 SLA 下滑,很多团队的直觉是代码出了 Bug。但从大量生产环境故障复盘来看,健康检查误判、GPU OOM 和调度资源竞争才是高频根因,且这些故障在日志中往往不会留下明显的异常堆栈。下面从现象层面对这类问题做拆解。
- 分组组件作用怎么部署部署到哪控制平面组件(Control Plane)API Server集群的入口,是所有组件、运维工具的统一交互入口,负责认证鉴权、数据校验,是唯一能读写 etcd 的组件 kubeadm部署仅 master 节点 etcd分布式键值存储,K8s 集群的数据库;持久化保存所有集群配置、资源状态、元数据,保证数据一致性与高可用 Controller Manager运行各种控... 分组组件作用怎么部署部署到哪控制平面组件(Control Plane)API Server集群的入口,是所有组件、运维工具的统一交互入口,负责认证鉴权、数据校验,是唯一能读写 etcd 的组件 kubeadm部署仅 master 节点 etcd分布式键值存储,K8s 集群的数据库;持久化保存所有集群配置、资源状态、元数据,保证数据一致性与高可用 Controller Manager运行各种控...
- 一、集群管理工具kubectl kubectl 是什么kubectl 是 Kubernetes 的 命令行客户端工具。它的作用是与 kube-apiserver 通信,向集群发送命令。通过它你可以 部署应用、查看资源、排查问题、管理集群。👉 可以把它理解为:Linux 的 bash 管理操作系统kubectl 管理 Kubernetes 集群:::info安装tap键补全增强工具,把支持... 一、集群管理工具kubectl kubectl 是什么kubectl 是 Kubernetes 的 命令行客户端工具。它的作用是与 kube-apiserver 通信,向集群发送命令。通过它你可以 部署应用、查看资源、排查问题、管理集群。👉 可以把它理解为:Linux 的 bash 管理操作系统kubectl 管理 Kubernetes 集群:::info安装tap键补全增强工具,把支持...
- 文章聚焦慢 SQL 治理,介绍如何用 ChatGPT 5.6 系列把慢日志、执行计划、代码调用点和业务场景整理成可排序的治理清单,先判断“哪几条最该改”,再比较索引、分页、异步化等优化路径,并强调脱敏、安全边界、人工复核与回归验证,避免只盯最慢语句而忽略真实业务收益。 文章聚焦慢 SQL 治理,介绍如何用 ChatGPT 5.6 系列把慢日志、执行计划、代码调用点和业务场景整理成可排序的治理清单,先判断“哪几条最该改”,再比较索引、分页、异步化等优化路径,并强调脱敏、安全边界、人工复核与回归验证,避免只盯最慢语句而忽略真实业务收益。
- 本文围绕 ChatGPT 5.6 Sol 在云原生场景下的实测表现展开,重点测试 Kubernetes 告警排障和云资源成本分析两类任务。文章观察其是否能将零散监控、事件和账单信息整理成“现象—假设—证据—动作—风险”的分析链路,并与 Grok 4.5、DeepSeek V3 做横向比较。结论认为,Sol 的优势在信息组织和排查路径构建,短板是输出偏完整、需要明确限制范围,更适合作为云上排障、成本 本文围绕 ChatGPT 5.6 Sol 在云原生场景下的实测表现展开,重点测试 Kubernetes 告警排障和云资源成本分析两类任务。文章观察其是否能将零散监控、事件和账单信息整理成“现象—假设—证据—动作—风险”的分析链路,并与 Grok 4.5、DeepSeek V3 做横向比较。结论认为,Sol 的优势在信息组织和排查路径构建,短板是输出偏完整、需要明确限制范围,更适合作为云上排障、成本
- 把MySQL部署到Kubernetes容器平台上,从StatefulSet选型到持久化存储配置再到Operator管理,我记录了完整的上手过程和3个踩过的坑。 把MySQL部署到Kubernetes容器平台上,从StatefulSet选型到持久化存储配置再到Operator管理,我记录了完整的上手过程和3个踩过的坑。
- 本文以 Spring Boot、Docker、Kubernetes 项目交接为例,介绍如何用 Claude Opus 4.8 辅助整理云原生项目文档,包括 README 重构、Kubernetes 配置解释、上线检查清单、运维手册和故障处理 SOP。文章强调多模型交叉验证、人工 Review、测试环境演练与敏感信息脱敏,帮助团队把零散资料整理成可执行、可维护的交接文档。 本文以 Spring Boot、Docker、Kubernetes 项目交接为例,介绍如何用 Claude Opus 4.8 辅助整理云原生项目文档,包括 README 重构、Kubernetes 配置解释、上线检查清单、运维手册和故障处理 SOP。文章强调多模型交叉验证、人工 Review、测试环境演练与敏感信息脱敏,帮助团队把零散资料整理成可执行、可维护的交接文档。
- 基本概念Ingress角色:集群的核心流量入口(网关)。职责:它专门负责处理集群外部进来的流量。它能看懂域名(如 foo.com)和路径(如 /api),并根据你写好的路由规则,决定把这个请求指引给哪一个 Service。级别:工作在 7 层(应用层)。kubectl get ingress -A华为云提供2种:Ingress 类型底层是否使用 Nginx流量转发路径Nginx Ingres... 基本概念Ingress角色:集群的核心流量入口(网关)。职责:它专门负责处理集群外部进来的流量。它能看懂域名(如 foo.com)和路径(如 /api),并根据你写好的路由规则,决定把这个请求指引给哪一个 Service。级别:工作在 7 层(应用层)。kubectl get ingress -A华为云提供2种:Ingress 类型底层是否使用 Nginx流量转发路径Nginx Ingres...
- 摘要:在云原生和 Kubernetes 生态中,Prometheus 是监控领域的事实标准。本文探讨如何通过 TDengine 扩展 Prometheus 的存储能力,构建支持海量指标长期保留的企业级可观测性体系,满足工业互联网场景下的监控需求。一、云原生监控的存储瓶颈Prometheus 作为云原生基金会(CNCF)的毕业项目,在 Kubernetes 监控领域建立了不可动摇的地位。然而,... 摘要:在云原生和 Kubernetes 生态中,Prometheus 是监控领域的事实标准。本文探讨如何通过 TDengine 扩展 Prometheus 的存储能力,构建支持海量指标长期保留的企业级可观测性体系,满足工业互联网场景下的监控需求。一、云原生监控的存储瓶颈Prometheus 作为云原生基金会(CNCF)的毕业项目,在 Kubernetes 监控领域建立了不可动摇的地位。然而,...
- 摘要:在云原生和 Kubernetes 生态中,数据库的选型需要兼顾弹性扩展和运维简化。本文从云原生架构视角,对比 TDengine 与 SingleStore 在容器化环境中的部署实践,为企业云原生数据平台建设提供参考。一、云原生数据平台的架构需求随着 Kubernetes 成为企业基础设施的标准,数据库的云原生化成为必然趋势。云原生数据平台需要满足以下要求:· 弹性扩展:根据负载自动扩缩... 摘要:在云原生和 Kubernetes 生态中,数据库的选型需要兼顾弹性扩展和运维简化。本文从云原生架构视角,对比 TDengine 与 SingleStore 在容器化环境中的部署实践,为企业云原生数据平台建设提供参考。一、云原生数据平台的架构需求随着 Kubernetes 成为企业基础设施的标准,数据库的云原生化成为必然趋势。云原生数据平台需要满足以下要求:· 弹性扩展:根据负载自动扩缩...
上滑加载中
推荐直播
-
华为云码道Agent集成与鸿蒙实战2026/08/11 周二 19:00-21:00
王一男-华为云码道产品规划专家;李炎-华为云码道产品专家;彭江敏-华为云鸿蒙端云一体化开发专家
本次直播带你解读华为云码道7月份产品新特性、新功能。更有专家演示码道Agent Space × 钉钉机器集成实战,从0到1打通消息通道;码道鸿蒙端云一体化实战,快速搭建员工签到系统。
回顾中 -
华为云开发者AI素养直播课·第五期2026/09/04 周五 16:00-18:00
林华鼎-华为云AI开发者运营负责人;蒋春阳-华为云AI开发者案例开发专家
本期直播内容: AI工具体验营 · 第5-8课连讲。Agent-Team 多智能体协作完成毕业设计实践
即将直播
热门标签