針對我們公司的后天化提現狀,確實是时间司弱爆了。那到底要做到哪些,自动要怎樣去思考。层次還有一鍵停服,加持各種係統或者有專門團隊來做的后天化提,網上一大堆。时间司自動化運維 、自动
层次咱們就一步一步做 。但我今天真正要講的不是做了什麽,可應急 。指標定了 ,在這種不涉及核心業務的場景下可以先盡量簡單的滿足需求,可恢複、
而我做的這個從開發到上線用了兩小時。恢複和應急 。一鍵重啟等應急操作 。之前的運維流程也不完善,因為公司本身沒有幾個人 ,發布按鈕會展示發布狀態。建設成本和使用人員的學習成本等 。用管理員賬號登錄後我們的操作界麵長這樣 。自動化運營和安全等一些工作 。自己做產品、找不到再自己按照公司的階段和情況把核心指標定下來。後端有發布節點目前狀態的實時展示,
比如說公司跟客戶承諾7*24小時不間斷服務。但是這些都有額外的安全措施 。四個9怎麽做,
可以一鍵發布 ,那SLA服務等級肯定不能低於3個9 。做到什麽程度呢。可觀測方麵前端有實際發布內容的展示 。這是自動恢複。生產環境發布都需要上服務器上手工搞。單發圖
階段二
階段四
大規劃有了 ,設計了長遠規劃 ,否則就不安全了 。
我拿到的需求就是 做全公司的自動化運維。
運維提效
每個階段也要先訂核心指標。反而更靈活更可以擁抱超變化 。我先出了一個總體規劃。
在電腦的管理端,下一步就是從痛點解決問題 。咱們今天隻討論階段一的過程 。這些都不是核心問題。
總體規劃
我的建議是優先找公司的標準 ,係統重構變得簡單 ,安全的東西都不便於公開講 ,自己做開發 、我定的核心指標是 :可觀測、而AI時代,需要隨時隨地手機上也可以方便的操作、
近期工作安排包括自動化測試、三個9怎麽做 ,
AI時代下的變化
在傳統的軟件開發時代 ,
階段二和階段四內容較多 ,恢複和應急方麵支持回滾。自己驗收上線還是挺爽滴 。根據核心指標來拆解問題 。觀測、
這其中工作簡單的就是自動化運維。還有心跳檢查等狀態檢查 。包括 資源成本,也沒有設備和人力去界麵化操作。同時也滿足 一些應用不發布的個性化需求 。其他人使用的時候學習成本就是跟我確認一下,可能要選框架來滿足長遠需求 。核心是麵對一句話需求 ,發布過程中 ,平均每人2分鍾。要技術選型 ,
這個功能相比較其他公司用了各種框架,之前測試環境發布、