先標記疑點不要刪除原值
報表突然出現一個高值時,先保留它,再查它為什麼出現。高值可能是真實製程異常、感測器故障、通訊型別解析錯誤,或啟動期間的暫態。只因它讓平均難看就刪掉,會把找原因最需要的證據一起移除。本篇教你把原始值、疑點標記、判定與報表採用值分開。
採用一組離線溫度樣本:50、51、50、300、49°C,每筆相隔一分鐘。假設本案感測器量測範圍為0至200°C,300超出規格,先標OutOfRange並停止把它直接納入有效溫度平均;原始300、品質碼、時間與設備識別仍完整保存。這個量程是假設條件,必須換成現場儀表規格。
不要立刻把300改成30。即使它剛好是十倍,也只是一個倍率錯誤的線索。先查原始暫存器、解碼型別、倍率版本與設備顯示,再決定是解析錯誤還是設備真的回報異常。只有查到證據才能新增修正版,不能用猜測美化數據。
本文區分三個狀態:Suspect表示待查,ConfirmedInvalid表示有證據不能作此用途,ConfirmedProcessEvent表示確定是真實製程事件。這是應用分類,來源Good或Bad品質碼另存,不要把自己的判斷寫回來源品質而丟失證據。
適用於歷史分析、品質資料整理與報表,不提供任何設備專用故障代碼。NIST的異常值文件可用來理解標記、辨識與處理的差異;統計上的離群值不自動等於感測器讀錯,也不自動構成設備故障。
用同一組數字比較報表結果
五筆原始值總和為500,直接算術平均100°C,原始最大值300°C。如果依已核對量程排除300的分析版本,剩四筆總和200,平均50°C,最大51°C。兩種結果都要寫明採用筆數與排除原因,不能只給50°C讓人以為五分鐘都正常。
報表可以分列rawCount=5、acceptedCount=4、suspectCount=1、acceptedMean=50°C,並附被隔離記錄的識別碼。原始最大值仍可列300,但標成超出量程的原始回報,不稱為已確認真實溫度峰值。有效最大51也只代表目前採用的四筆。
再做一個反例:若儀表範圍其實為0至400°C,且第二支已校驗感測器也在同時段記錄高溫,就不能套用前一例的200上限。這時300可能是真實異常,應保留在製程事件報表,再調查控制與環境紀錄;分析濾除策略不能抹掉事故。
數值裁切也不等於修正。把300裁成200後,五筆平均變80°C,仍不是有效四筆平均50°C,更不是已證明的真實平均。若演算法為特定模型必須裁切,保存processedValue=200、rawValue=300與方法版本,顯示這是模型輸入處理結果。
練習先手算三個答案:原始100、排除50、裁切80。接著檢查畫面、CSV與報表使用哪個欄位。若三個地方各自選了不同值卻都叫平均溫度,問題在資料口徑,不應靠調整小數位掩蓋。
設計可以追查的判定紀錄
每筆至少保存sampleId、assetId、sourceAt、receivedAt、rawValue、rawUnit、sourceQuality、ruleId、ruleVersion、flag與判定原因。若有人核准修正,再增加reviewer、reviewedAt、evidenceId、correctedValue與revision。原始記錄保持可查,新的判定以關聯方式附上。
例如S-104原始300°C被範圍規則RANGE-v1標成Suspect。後續查到通訊倍率設定變更紀錄,證明正確工程值應為30°C,才新增修正版本REV-2並引用證據。這時重算五筆為(50+51+50+30+49)÷5=46°C;它和直接排除的50°C不同,報表必須顯示版本。
上述倍率錯誤只是另一個有證據的教學分支,不能與真實高溫分支同時當成既定事實。每個分支保留自己的輸入與判定:量程不符待查、證實倍率錯誤、證實製程高溫。驗收時用三組案例分別測,避免同一筆300在不同頁忽然換了身分。
若需要撤回人工判定,不刪除REV-2。新增REV-3說明撤回原因,指回目前採用版本;已發布的報表保留原版本與更正通知。這樣工程人員能回答某一天為何曾顯示46°C,而不是查到一份已被覆寫的來源表。
被排除資料也要有處理期限與負責人。若Suspect永久留著,報表看似正常但來源問題一直存在。可以把待查筆數、最久未處理時間及受影響設備列在資料品質頁,讓值班人員先處理持續發生的問題。
排錯時先分辨是哪一層異常
第一步看原始值和來源品質,確認收到的是300還是字串、錯誤代碼或空值被轉成300。第二步比對設備顯示與同時段原始通訊資料。第三步核對資料型別、有號無號、倍率、單位及版本。第四步才分析製程是否出現合理的高溫證據。
若只在重啟後第一筆跳高,保留bootId、啟動時間與初始化階段,查設備是否尚未量測完成或通訊端讀到舊緩衝。不要直接規定每次重啟刪第一筆;需要來源文件或測試支持,而且應以狀態和品質排除,不只用固定筆數猜測。
若異常集中在通訊斷線恢復,檢查補送、時間排序與重複資料。晚到的舊峰值不是現在才發生;若只改receivedAt作為時間軸,會把歷史事件移到恢復時刻。若同一sampleId重送,保留接收紀錄,報表仍只計一次。
統計門檻適合找疑點,不能取代量程與製程定義。小樣本、非正態、不同生產模式混合時,固定幾倍標準差可能標錯。先按設備模式與資料用途分組,再選適當方法;NIST也提醒離群值檢定的分布假設與樣本數限制。
失敗時先比對同一批原始資料的筆數,再查規則版本及排除名單。若平均不同但名單相同,查權重和時間窗口;若名單不同,查量程、品質與模式條件。逐層查比直接修改報表公式更容易找出真正差異。
完成條件與常見問題
驗收時保存五筆原始資料,確認沒有任何原值被覆寫;範圍規則應只標記300,原始平均100、有效四筆平均50、裁切示例80都能重算。再加入有證據的30°C修正分支,預期修正版平均46,舊報表仍可追查。
最後檢查三個出口:圖表要能看見被標記點,匯出要有flag與revision,摘要要有採用及排除筆數。若匯出只剩乾淨數字,接手者便無法知道曾有異常,這個交付仍未完成。
問:離群值可以直接刪嗎?答:先保留並調查;即使分析選擇排除,也應保存原始資料與排除依據。
問:來源Good是否代表300一定正確?答:不代表,它不保證倍率、量程或製程語意完全正確。
問:中位數比較穩定,可以取代調查嗎?答:不能。穩健統計能減少極端值影響,但無法說明這個極端值為什麼出現。
問:換規則後能否直接覆蓋舊報表?答:應產生新版本並列更正原因,保留原發布結果。本篇案例只核對公式與文件。
參考:NIST Engineering Statistics Handbook:異常值的標記、處理、檢定與適用假設。