Margrop
Articles412
Tags883
Categories7

Categories

1password 24GB VRAM 2K 3.6 Flash 30B dense 30s timeout 4-bit 量化 6-DoF SLAM AC ACL ACL 切换 ACP AI AI Agent AI Coding Assistant AI Tech AI tutor AI 安全 AI 应用 AI 日记 AI编程助手 AI辅助 AI辅助编程 ALTK-Evolve AMIE AP API API 定价 API 降价 ARC-AGI-3 ASR ATEM chat 模板 Agent Agent Harness Agent Memory Agent 入侵 Agent 工程 Agent 架构 Agent 检索 Agent 沙箱 Agent 系统 Agent 路由 AgentPlan Agentic AI Agentic tools Ai2 Alertmanager AllenAI Android 17 Antigravity AppDaemon AppWorld Aqara Astra Attention Baseten Blog CC-Switch CI/CD CLI Tools CLI 工具 CLI工具 CPU 推理 CSRF Cache Hit Rate Caddy Categories 404 ChatGPT Claude Code Claude Sonnet ClawLoader Cloudflare Code Interpreter Codex Coding Plan Coding Plan Dashboard ComfyUI Computer Use Context Compression Cookie 认证 Cosmos-H-Dreams Cost Optimization Cron D1 DFIR DIY-MINI Date DeepSeek DeepSeek V4 Flash Diagrams.net Diary Diffusers Diffusion Docker Docker Compose Efficiency Tools Electerm Embedding English FSDP2 Fable 5 Fireworks AI FlashAttention FlashDreams Flask GGUF GLM 5.2 GLM-5.2 GPT-4.1 GPT-5.6 GPT-Live GPT-Red GPU 加速 GPU 性能分析 Gateway Gemini Gemini 3.5 Flash Gemini API Gemini CLI Gemini Omni Flash Gemma 4 12B Gemma Translator Gemma4 GitHub GitHub Actions GitHub PR Google Google AI Google Research Google Sheets Grabette Gripette HA HADashboard HF Security Incident HTTP Hailuo Hermes HermesAgent Hexo HomeAssistant Hugging Face Hugo IBM Research IP IPv4 Inference Providers Isaac Lab Java KV cache Kimi Kimi Code Kimi K3 Kubernetes LFM2.5 LFM2.5-VL LLM Router LVM‑Thin LeRobot Linux Liquid AI LiquidAI Live Translate LoRA Luna MCP MTP MacOS Magpie TTS Managed Agents Markdown Memory 上限 Meta Microsoft 365 Copilot MiniMax MiniMax H3 Mistral Shieldstral Model Routing MuJoCo Warp Multi-Agent Muse Glimmer MySQL NAS NIM NVIDIA NeMo Automodel Nemotron 3 Embed NewAPI Newton Nginx Node-RED Node.js Nunchaku OAuth 凭据 OCR OOM OlmoEarth On-device AI Open Source Open Viking OpenAI OpenAI 兼容 OpenClaw OpenCode OpenResty OpenWrt PII 检测 PPPoE Physical AI Pollen Robotics Portainer PostgreSQL ProcessOn Project Astra Prometheus Prompt Caching Prompt Injection Proxmox VE PyTorch Qwen3-VL Qwen3.6 RPC RTEB Real-Time Inference Red Teaming Responses API Restart SIGTERM SNAP SOCKS5 SOCKS5 代理 SPED SSH 审计 SSL SVDQuant Scientific Computing Self-Forcing Distillation Session Sheets canvas Shell Skill 管理 Sol Storage Buckets Strands Agents Subagent Surgical Robotics Synology NAS TTS Terra Think button TimeMachine TutorMoments UI 微调 UML Uptime Kuma V4-Pro VPN VPS VoiceEQ WARP Web WebRTC WebSocket Win11 Windows Workers World Foundation Model activate ad adb adblock agent agentic aligenie aliyun alpine annotation aop authy autofs backup baidupan bash bg-review bitwarden boot brew browser budget control caddy2 cc-switch-cli cdn centos cert certbot charles chat chrome classloader client clone closures cloudflare cmd command commit commoditization conn_id container cron 排错 crontab cross_sync ctyun cyber capability dashboard ddsm demo dependency deploy developer devtools disconnect topic dll dns docker domain download drafter draw drawio dsm dump dylib easytier edge environment hooks exception exit code 1 export fail2ban feign firewall-cmd flow fork free tier frontier hosted model frp frpc frps fuckgfw full-duplex function fuzzy match gateway gcc gfw git github glm-latest golang gperftools gridea grub guardrail lockout gvt-g hacs havcs heap hello hexo hibernate hidpi hoisting homeassistant hosts html htmlparser https huggingface_hub iKuai iMessage idea image img img2kvm immortalwrt import index inference cost install intel io ios ip iptables iptv ipv6 iso java javascript jetbrains jni jnilib jpa js json jsonb jupter jupyterlab jvm k8s keepalive keepalive ping timeout kernel key kid kms kodi koolproxy koolproxyr kvm lan lastpass launchctl learning lede letsencrypt linux live llama.cpp low-code lvm lxc m3u8 mac macos mariadb markdown maven md5 mdadm memory 上限 microcode mirror modem modules monitor mount mstsc multimodal mysql n2n n5105 nas network newapi nfs no close frame node node-red nodejs nohup notepad++ npm nssm ntp one-api 容器 oop open weights openclaw openfeign openssl openviking os otp ovz p14 packet capture pat pdf pem perf ping pip plugin png powerbutton print pro productive struggle proxy pve pvekclean python qcow2 qemu qemu-guest-agent rar reasoning control reasoning slider reboot reflog remote remote desktop renew repo resize retina root route router rule rules runtime safari sata scaffolding scheduled triggers scipy-notebook scoping scp self-play server serverless inference silent test simulated student skill_manage slmgr so socks source spk spring springboot springfox ssh ssl stash string supernode support svg svn swagger sync synology systemctl systemd tap tap-windows tapwindows telecom template terminal tls tmux token totp tvbox txt ubuntu udisk ui undertow uninstall unlocker upgrade url v2ray vLLM vhd viking_search vim vlmcsd vm vmdk web websocket wechat windows with worker wow xiaoya xml yum zai-org/GLM-5.2 zip 三维切片 上下文压缩 上下文工程 个人品牌 中国电信 临时关权限 临时提权 云电脑 交换机 人才争夺 人机协作 代理 企业 AI 优化 低延迟 体检 供应链 值班 健康检查 光猫 免费层 公众号 公网IP 内存 内存优化 内容发布 内网 内网IP 内网渗透 写作 凭据刷新 分布式推理 分布式训练 医疗 AI 升级 协作 协作习惯 协议层 协议转换 单平台型异常 博客 博客同步 博客改名 博客运维 卫星影像 反向代理 反诉 变更审计 可靠性 后台 Review 启动 告警 告警优化 周一 周一傍晚 周一焦虑 周三傍晚 周五 周六 周四傍晚 周四晚 周报 周日 周末 回滚 地球观测 地理空间推理 复盘评测 夏令时 多 agent 工具链 多 token 预测 多协议并发 多智能体 多模态 多模态 Agent 多节点 多节点管理 多语言 多通道并发 大厂人才战 大模型评测 天猫精灵 天翼云 失败模式 字体大小 安全 安全事件 安全意识 安装 定时任务 实战反思 实时语音 客户端 SDK 容器 容器网络 导入 小米 屏幕理解 工作感悟 工具审计 工具白名单 工具调用 工具调用拦截 工程团队 工程实践 工程笔记 常用软件 并发窗口 广告屏蔽 序列号 应用市场 延迟优化 开放 API 开权重 开源权重 开源模型 开源项目 异常 异步任务 异步委派 微信 微信公众号 微信限流 心智成长 心跳 心跳检查 性能优化 总账号数 感悟 成本优化 成本控制 打工 打工人 打工人日记 扩散模型 技术 抓包 按 provider 优先级 排查 排障 排障思路 推理加速 推理速度 推理预算 描述文件 提示词工程 提示词敏感性 故障 故障归因 故障恢复 故障排查 效率 效率工具 教育数据开源 教育评测 数据 数据工作流 数据流 文本编码器 断线重连 旁路由 无服务器 日志分析 日志排查 日记 时区 时段权限 显卡虚拟化 智能体集成 智能家居 智能音箱 暗黑风格 服务器 服务管理 本地 agent 本地安装 本地工具 本地接口 机器人仿真 机器人学习 机器人数据采集 权限管理 架构 框架级切片 梯子 模块 模型推理 模型精简 模型评测 模型路由 残存访问 治理层 流式推理 流程 流程图 浏览器 漫游 激活 火山引擎 火绒 灾难恢复 焦虑 独立仓库 玄学 生活 电信 画图 监控 监控系统 监管 直播源 直觉 磁盘 磁盘故障 磁盘管理 稀疏样本 稀疏注意力 立体声 端侧 AI 端侧推理 端口 端口冲突 端口扫描 管理 续期 网关 网络 网络风暴 群晖 群晖 NAS 脚本 脚本优化 腾讯 自动化 自动化反思 自动化运维 自动恢复 自动攻击 自动重启 自动重连 自托管 LLM 网关 自部署 苹果 虚拟机 视觉语言模型 视觉验收 视频生成 视频问诊 订阅额度 认证 证书 评测 评测基准 评测方法学 诉讼 语雀 语音 AI 语音 Agent 质量检查 资产清理 超时 跨平台 路由 路由器 软件管家 软路由 运维 运维日常 运维监控 进程生命周期 远程接口 连接保活 连接问题 通信机制 通知 邮件漏发 部署 配置 重试风暴 量化 钉钉 钉钉断开 镜像 镜像源 长上下文 长连接 门窗传感器 问题排查 防火墙 阿里云 阿里源 集客 需求变更 风险控制 飞书

Hitokoto

Archive

PVE 宿主机磁盘空间监控——从踩坑到接入 Uptime Kuma 的完整小白教程

PVE 宿主机磁盘空间监控——从踩坑到接入 Uptime Kuma 的完整小白教程

目标读者
这篇文章写给刚刚接触 Proxmox VE(简称 PVE)且希望“按步骤照做就能跑”的同学。整篇内容力求:

  • 解释 为什么 会遇到问题

  • 每一步都给出 完整命令

  • 出错时给出 排查思路


0 背景——到底出啥问题?

  • PVE 官方安装向导默认把虚拟机硬盘建在 LVM‑Thin 池(常见名字:pve/data

  • LVM‑Thin 支持“超额分配”——给 VM 分了 500 G,其实物理磁盘只占用写入量

  • 如果宿主机上的 LVM‑Thin 池快满了,最直接的症状是:

    • 宿主机无法写日志、Web 界面打不开

    • 虚拟机也可能报各种 I/O 错误甚至宕机

结论:一定要实时监控 data_percent(池已用百分比)。


1 总体思路

步骤

作用

技术

A

写一个 检查脚本 lvm_check.sh:返回 JSON,判定 OK / FAIL

Shell + jq + bc

B

写一个 推送脚本 lvm_kuma_push.sh:把结果送到 Uptime Kuma

Shell + curl

C

在 Uptime Kuma 新建 Push 类型 监控

Web GUI

D

cron 定时执行推送脚本

Cron


2 准备环境

  1. 登录宿主机(不是虚拟机!),确保拥有 root 权限。

  2. 安装用到的工具:

1
2
sudo apt update
sudo apt install -y jq bc curl
  1. 确认宿主机确实在用 LVM‑Thin:
1
lvs -o lv_name,vg_name,pool_lv,data_percent --noheadings

若能看到 pve/datapool_lv 字段为 data,就符合本文条件。


3 步骤 A:编写检查脚本 /usr/local/bin/lvm_check.sh

1
sudo nano /usr/local/bin/lvm_check.sh
1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21
22
#!/bin/bash
# 判断 LVM‑Thin 池用量是否超过阈值(默认 90%)
THRESHOLD=90
output='{"status":"ok","volumes":[]}'

while read -r lv vg usage lsize pool; do
usage=$(echo "$usage" | tr -d ' %')
[ "$pool" != "data" ] && continue
[ -z "$usage" ] && continue

if [[ "$usage" =~ ^[0-9]+(\.[0-9]+)?$ ]]; then
if [ "$(echo "$usage > $THRESHOLD" | bc -l)" -eq 1 ]; then
output=$(echo "$output" | jq '.status="fail"')
output=$(echo "$output" | jq --arg lv "$lv" --arg vg "$vg" \
--arg usage "$usage" --arg lsize "$lsize" \
'.volumes += [{"lv":$lv,"vg":$vg,"usage":$usage,"lsize":$lsize}]')
fi
fi
done < <(lvs --noheadings -o lv_name,vg_name,data_percent,lv_size,pool_lv \
--units g --nosuffix)

echo "$output"
1
sudo chmod +x /usr/local/bin/lvm_check.sh

手动测试

1
/usr/local/bin/lvm_check.sh | jq
  • status":"ok" → 磁盘健康

  • status":"fail" → JSON 里会列出超限卷


4 步骤 C:在 Uptime Kuma 创建 Push 监控

  1. 打开 Uptime Kuma Web 界面 → “New Monitor”

  2. 选择 Type = Push

  3. 取个名字(示例:PVE‑LVM‑Disk

  4. 设置 Heartbeat Interval = 300 seconds(可改)

  5. 保存后,记录系统生成的 Push URL,形如:

1
https://uptime.example.com/api/push/abcdef1234567890

5 步骤 B:推送脚本把结果发给 Kuma

5.1 将 Push URL 写进配置

1
2
echo 'PUSH_URL="https://uptime.example.com/api/push/abcdef1234567890"' \
| sudo tee /etc/lvm_check.conf

5.2 新脚本 /usr/local/bin/lvm_kuma_push.sh

1
sudo nano /usr/local/bin/lvm_kuma_push.sh
1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
#!/bin/bash
# 向 Uptime Kuma 推送巡检结果
source /etc/lvm_check.conf
[ -z "$PUSH_URL" ] && { echo "缺少 PUSH_URL"; exit 1; }

result="$(/usr/local/bin/lvm_check.sh)"
status=$(echo "$result" | jq -r '.status')

if [ "$status" = "ok" ]; then
curl -fsS --retry 3 "${PUSH_URL}?status=up&msg=OK" \
-H 'Content-Type: application/json' \
--data-raw "$result"
else
problem=$(echo "$result" | jq -c '.volumes')
curl -fsS --retry 3 "${PUSH_URL}?status=down&msg=${problem}" \
-H 'Content-Type: application/json' \
--data-raw "$result"
fi
1
sudo chmod +x /usr/local/bin/lvm_kuma_push.sh

验证一次

1
2
/usr/local/bin/lvm_kuma_push.sh
# 不报错即推送成功,Kuma 上应出现一次心跳

6 步骤 D:用 cron 定时执行

1
sudo crontab -e

在文件末尾添加:

1
*/5 * * * * /usr/local/bin/lvm_kuma_push.sh >/dev/null 2>&1

含义:每 5 分钟执行一次推送,与 Kuma 中的 300 s 间隔保持一致。

保存退出后,可用 sudo systemctl restart cron (Debian 12)确保 cron 服务正在运行。


7 如何验证整条链路?

  1. 等 5‑10 分钟,看 Uptime Kuma 的 PVE‑LVM‑Disk 是否已变绿(Up)。

  2. 手动制造高使用率(或临时把脚本里 THRESHOLD=90 改成 1)再跑一次推送:

    • Kuma 立即变红(Down),说明告警链路 OK。

    • 改回 90 或释放空间,再推送一次,状态恢复 Up。


8 常见报错与排查

报错/现象

原因 & 解决

jq: command not found

执行 sudo apt install -y jq

Stderr: curl: (28) Connection timed out

宿主机到 Kuma 网络不通;先 curl -I $PUSH_URL 测试

Kuma 页面显示 “No Heartbeat”

  1. cron 未生效;2) PUSH_URL 写错;3) 脚本报错未推送(查 /var/log/syslog

status":"fail".volumes 为空

宿主机用的不是 LVM‑Thin;请用 zfs list 或其它方式监控


9 后续可拓展

想法

方向

图形化趋势

Kuma 的「Status Page」仅展示 Up/Down,可把 JSON 转 Prometheus 指标画曲线

邮件/钉钉通知

在 Kuma 的 Notification 里配置即可,脚本不用改

systemd‑timer

不喜欢 cron,可写 lvm_kuma_push.timer,精度更高


10 总结

  1. 最小化依赖:只有 jq bc curl,脚本全放宿主机,虚拟机端零改动。

  2. 告警及时:LVM‑Thin 池超过阈值立刻让 Uptime Kuma 变红并通知。

  3. 步骤清晰:新手按本文复制‑粘贴即可复现,失败场景也给出了排错思路。

希望这篇笔记能帮你 把“磁盘爆满恐惧”扼杀在摇篮里。如果你有更优雅的做法或遇到别的坑,欢迎评论区交流!

本文阅读量 --
Author:Margrop
Link:https://blog.margrop.com/post/pve-host-virtual-machine-lvm-disk-space-monitor-experience/
版权声明:本文采用 CC BY-NC-SA 3.0 CN 协议进行许可