drug-detection-xlm-roberta-v3
判斷一個網頁是否為毒品販售站台的二元分類模型,用於淡江大學多模態毒品交易防制系統。
以 matt0513/drug-detection-xlm-roberta 為起點續訓。
與前一版的差異
前一版以 1:1 重採樣訓練(正負各 291 筆,多數類被隨機刪減)。 那讓模型偏向正類:線上 86.8% 的網頁被判到 90 分以上,precision 偏低。
這一版改為:
- 不重採樣,保留自然比例(正 976 / 負 1,291),改用 class weight 處理不平衡
- 加入 286 筆困難負樣本——承辦人員回報「模型判高風險但實際正常」的網頁, 例如驗毒試劑商店、粉體塗料(產品名含 silver haze)、聖誕燈飾(產品名含 plug)
- 加入 664 筆人工確認的毒品網頁,每個網域最多取 2 頁避免重複
- 以較小的學習率(1e-5)續訓 2 epoch,避免沖掉既有的判別能力
評估
獨立評估集:人工標註的真實網頁,網域層級與訓練資料零重疊。 輸入為完整網頁純文字(與線上實際使用的輸入一致)。
| 前一版 | 本版 | |
|---|---|---|
| ROC-AUC | 0.8889 | 0.9383 |
| precision | 0.743 | 0.893 |
| recall | 0.963 | 0.926 |
| F1 | 0.839 | 0.909 |
套用完整判定規則後,送人工覆核的件數由 34 降為 28, 其中誤判由 9 降為 3,漏掉的毒品網站維持 2 個。
使用時的注意事項
判定門檻要跟著這一版重新設定。 前一版的分數幾乎只有 0 或 100,
本版的分布較連續,正樣本有部分落在 687 之間。
沿用前一版的門檻 60 會使漏報由 2 增為 4;實測門檻取 15 結果相同。
限制
- 評估樣本數有限(48 筆完整文字)
- 正樣本的標籤為網域層級人工確認後套用至該網域的頁面
- 輸入截斷為 256 token
- 本模型為分流輔助工具,不應作為單一判定依據
- Downloads last month
- 44
Model tree for matt0513/drug-detection-xlm-roberta-v3
Base model
FacebookAI/xlm-roberta-base Finetuned
matt0513/drug-detection-xlm-roberta