Zeabur DNS / CoreDNS 現代化
處理 cgk1 的 zeabur-dns / kube-proxy 不穩定,同時移除長期維護舊版 CoreDNS 的風險。
這一週的主線很清楚:Backup / Restore 完成前三個里程碑並顯著降低失敗;Nuphos 進入跨成員並行交付;Operator 上線後的邊界問題正在集中收斂。
計畫中的核心修復已全部落地。M1–M3 完成,M4 轉入錦上添花的體驗與效率優化;本週失敗量從 163 降至 61。
Owner · Bruce
大幅下降来自 preflight、容量校验、manifest 传输与 restore image 的系统性修复。
本週最大的共同專案。三位成員沿資料庫、事件、可觀測性、成本與治理並行推進,目標是把「基礎設施操作」變成可審計、可觀測、可自動化的產品能力。
Owners · Bruce / Pan / Ian資料庫成為一等資源,補足 lifecycle、狀態與操作邊界。
Trigger 與 Slack 事件流程,讓異常可被快速感知與處理。
供應商可觀測性、成本自監控與 Better Stack 串接。
權限、安全、調查與破壞性操作的統一邊界。

已能由 AI 生成圖表、洞察與行動項,並自動更新報告;下一步是把成本異常與日常運營流程真正串起來。
Production gate、dashboard 與 backend orchestration 已完成。近期回報集中在「重啟 gate 過度保守」與「中國區 image 缺失」,兩項皆在修復。
Owner · Bruce包括 force reboot,導致使用者無法自行恢復,轉而依賴人工支援。修復重點是保留安全 gate,同時提供可控的 recovery path。
Operator 升級後在中國機器集中暴露。正補齊 fleet image availability 與升級前檢查。
本週不是單純「做減法」:一條線提升 Zeabur DNS 的可靠性與可維護性;另一條線以分散式 VictoriaMetrics 取代中央監控資料路徑,為舊 telemetry 與 Node page 退役創造條件。
Owner · Pan處理 cgk1 的 zeabur-dns / kube-proxy 不穩定,同時移除長期維護舊版 CoreDNS 的風險。
伺服器 CPU、RAM 等監控資料已寫入專用的分散式 VictoriaMetrics,不再依賴中央資料庫。
這是 VictoriaMetrics 遷移與中央 telemetry 退場 的最終收益,而非 DNS 升級本身帶來。
新的 Access Token 入口已完成,後端同步建立 hash storage、scope、生命週期與 audit 基礎。下一步是 zeabur.app 網路與 domain registration。
Owners · Pan / Ian

Token 不以明文持久化。
把權限縮小到實際所需。
可輪替、可追蹤、可治理。
清除累積多年的舊頁面,重做 Server Revenue,將分散且易產生歧義的資訊收斂為單一、可信的營運入口。
Owner · Pan
本週完成監控、日誌、防火牆、開發流程與災難復原證據;角色權限與年度滲透測試仍在進行。
Owners · Bruce / Pan / IanBackup 進入優化期;Nuphos 是下一階段的共同主線;Operator 的上線後問題正在集中收斂。三條線最終匯向同一件事:讓平台操作更安全、更可觀測,也更少依賴人工。