← 所有文章

FIELD NOTES / 維護與故障排查

故障重現率如何以試驗次數而非印象描述

維護與故障排查作者:站長預估 5 分鐘閱讀

定義故障與有效輪次,分開觀察比例、未知結果與零故障的信賴上限。

本文目錄

先定義一次機會與一次故障

「十次大概有一次」若沒有試驗紀錄,很難拿來比較維修前後。先決定一次試驗是一次啟動、一件產品、一回請求或一小時觀察,並定義要計的故障。分母不同,比例就不是同一個指標,不能直接放在同一條趨勢比較。

例如研究啟動失敗,就以符合初始條件的一次啟動為一輪,判定在指定時間內是否出現指定症狀。同一輪產生五筆警報,仍可能只算一輪失敗;如果你要研究警報筆數,另建指標,不把五筆當五次獨立啟動。

本篇以每輪成功或失敗的二元結果說明。設備每小時故障次數、連續運行壽命及維修時間需使用其他適合模型,不把本文比例直接當平均無故障時間,也不據此宣告功能安全等級。

開始前保存試驗方案、產品與環境範圍、有效輪次條件及失敗判定。若每次失敗後立即換方法,最後的總數混了多種條件,就不能代表單一固定配置的重現比例。

先算觀察比例再列資料品質

基本算式是指定故障輪數除以有效試驗輪數。二百輪中六輪失敗,觀察比例為百分之三;三十輪中三輪失敗,則是百分之十。報告同時寫分子與分母,避免讀者以為兩組百分比具有相同證據量。

計畫一百輪,其中五輪量測紀錄損毀,剩餘九十五輪有四輪失敗。有效資料的觀察比例是四除九十五,約百分之四點二一,另列五輪結果未知。不能把資料不見當成功,也不能假裝未知結果不可能與故障有關。

若紀錄器恰在故障時最容易斷線,排除缺失輪次會低估問題。除了報有效比例,也說明缺失機制並安排補測;可附最保守與最樂觀的記錄範圍,但不把這種範圍誤稱正式信賴區間。

同一百輪有四次已知失敗與五次未知,假設其餘全成功,全部計畫輪次的失敗比例只能界在百分之四至九之間。這是未知結果的帳面界限,不處理抽樣誤差;兩種不確定性要分開說。

完成這一步,接手人應能從逐輪清單重算比例,並看見無效、未知或中止的原因。不要只保留最後一個百分比,原始輪次資料才是比較的基礎。

零次故障也有樣本量限制

十輪零故障與三百輪零故障都顯示觀察比例零,但對長期失敗機率的限制不同。若採固定輪數、各輪獨立且同一失敗機率的二項模型,可計算零次失敗時的單側百分之九十五信賴上限;前提不成立時,不應直接套公式。

這個上限為一減去零點零五的n分之一次方,其中n為有效輪數。十輪的上限約百分之二十五點九,百輪約百分之二點九五,三百輪約百分之零點九九四。它說明短時間未見故障,仍可能不足以支持很低的失敗機率。

公式來自零次失敗機率為(1−p)的n次方,令其等於零點零五再解p。這是固定樣本方案下的頻率學派信賴界限,不是說本次未知參數有百分之九十五機率落在某區間,也不是保證下一輪一定成功。

若希望零失敗結果的單側百分之九十五上限不超過百分之一,依同一模型至少需299輪,且全部零失敗。這是教學算例,實際可靠度證明還需代表性條件、失敗定義及事先確定的接受方案,不是任何設備通用驗收門檻。

NIST精確二項界限資料說明,小樣本或少失敗時不宜隨意用對稱常態近似。本文只算零失敗特例;有失敗的正式界限應使用經核對的方法與工具,並說明單側或雙側。

不要讓重試與條件混合誤導結論

若試驗因安全或設備異常提前中止,保留中止前已取得的結果與實際輪數,說明原因。不要刪除造成中止的失敗輪次,也不要把原定尚未執行的輪數放進分母。

連續重試不一定是獨立試驗。第一次失敗留下未清狀態,後續九次也失敗,這十筆可能反映同一事件延續。先決定研究的是每次嘗試或每次獨立啟動,記錄復原條件,不用大量重試製造看似很大的樣本數。

比較改版前後時保持主要條件可比,並分層列出冷機、熱機、產品與負載。若舊版多測高負載而新版只測空載,比例下降可能來自試驗組成。需要時安排平衡比較,不能只拿合計比例判斷改善幅度。

例如A條件十輪中兩次失敗,B條件九十輪全成功,合計是百分之二。但在A條件觀察比例仍為百分之二十,總表可能掩蓋關鍵情境。先按條件看分子分母,再決定是否有理由合併。

不要一直測到想要的比例才停止,卻仍套固定樣本的信賴說法。若採序列試驗或提前停止,需使用相符的設計與分析。對教學入門,先約定輪數與中止規則,完整報告已發生的結果。

練習與常見問題

練習:一百二十次符合條件的啟動中,九次出現同一指定逾時,觀察重現比例是多少?答案是百分之七點五。若九次都集中於三個未復原的連續事件,仍可報每次嘗試比例,但不能直接聲稱有一百二十個獨立樣本。

失敗時先查分母、重複警報、資料缺失及條件變更。完成報告應包含輪次數、故障數、條件、期間、未知數與模型假設;這比「幾乎不會再發生」更能支持工程判斷。

問:零故障是不是失敗機率零?答:不是,它是本次觀察結果,樣本量及模型決定可作的推論。

問:測一千次一定比十次好嗎?答:需有有效且代表性的試驗,重複同一殘留狀態不等於獨立證據。

問:比例下降就證明修正有效嗎?答:還要核對條件與不確定性,避免組成差異。

問:可把每小時故障次數當每次啟動比例嗎?答:不能,暴露機會與模型不同。

參考:NIST Dataplot EXACT BINOMIAL:單側與雙側精確二項信賴界限及少量事件的限制。

延伸閱讀