02. 硬件体检:SMART 与温度

02. 硬件体检:SMART 与温度 目标 给家里 PVE 做一次彻底硬件体检: 温度:CPU、APU、SSD、HDD 都在合理范围? SMART:4 块盘健康度? 寿命预估:SSD 还剩多少寿命? 1. 温度监控:lm-sensors 装好 安装 1 2 3 4 5 apt install lm-sensors sensors-detect # 一路回车 (选 yes 自动) modprobe k10temp # AMD CPU 温度 modprobe amdgpu # APU 温度 sensors # 第一次看 第一次结果 1 2 3 4 5 6 7 8 9 10 k10temp-pci-00c3 Adapter: PCI adapter Tctl: +42.6°C # CPU 温度 Tdie: +42.6°C # die 温度 amdgpu-pci-0600 Adapter: PCI adapter vddgfx: N/A # 待机没数(正常) vddnb: N/A edge: +42.0°C # APU 边缘温度 结论: 一切正常。42°C 远低于警戒线(70°C)。 ...

September 2, 2026 · 3 min · 511 words · LiMingCoding

12. 硬盘损坏全程记录

12. 硬盘损坏全程记录 本文是这次 PVE 折腾里最沉重的一篇。 三块数据相关盘,一块有过 metadata 永久损坏,一块当前 DEGRADED,一块 power retract 计数异常高。 一次次"还好没出事"积累成了真实事故。 整体盘点 1 2 3 4 5 6 7 PVE host 4 盘: ┌──────────────────────────────────────────────────────────────┐ │ sda Kingston SA400 120G rpool (mirror 一半) │ │ sdb Kingston RBUSC 128G rpool (mirror 另一半) │ │ sdc Great Wall GW600 1TB SSD_1TB 池 (VM/CT 数据) │ │ sdd Seagate ST3000NM0053 3TB HHD_3TB 池 (PBS/RustFS/Kopia) │ └──────────────────────────────────────────────────────────────┘ 详细 SMART (2026-09-02 当前) 盘 型号 通电 周期 断电 retract Wear/Realloc 状态 sda Kingston SA400 120G 15,550 h 1,305 - - ✅ 健康 sdb Kingston RBUSC 128G 13,683 h 62 25 Wearout 12,621 ✅ 健康 sdc Great Wall GW600 1TB 7,064 h 1,655 779 WLC 37,726,810 ⚠️ DEGRADED sdd Seagate ST3000NM0053 3TB 11,853 h 92 - Realloc 0 ⚠️ 历史 metadata 损坏 事件一: HHD_3TB 池 metadata 永久损坏 (2026-08-30 发现) 现象 1 2 3 4 5 6 7 8 9 10 11 12 $ zpool status HHD_3TB pool: HHD_3TB state: ONLINE config: NAME STATE HHD_3TB ONLINE ata-ST3000NM0053_Z1Y0PBQS ONLINE errors: 4 data errors Permanent errors have been detected in: <metadata>:<0x0> <metadata>:<0x3d> 含义 ZFS metadata 永久损坏 = 文件系统结构本身不可信。 ...

September 2, 2026 · 5 min · 1054 words · LiMingCoding