JALO v0.1.0 — 車両の輪郭を着色する研究モデル
運転動画の乗用車・バン・トラック・バスについて、見えている車体の輪郭を予測するモデルです。JALOの描画処理で、車両の追跡IDごとに半透明の色を重ねます。
このリポジトリでは学習済みの推論モデルを配布します。ソースコード・インストール方法・動画の実行手順はGitHubのJALOを参照してください。
実用的な認識品質の目標には、まだ達していない研究版です。 車両の見逃し、車体の塗り残し、道路へのはみ出し、同じ車両が複数色になる場面が残っています。
ダウンロードと使い方
- 推論モデルをダウンロードします。
- GitHubの「自分の動画で試す」に従って、JALOのソースと実行環境を用意します。
- 取得したモデルを、その手順の
checkpoints/jalo-local-vehicles-evaluated.ptに配置します。
JALO専用のPyTorchチェックポイントです。推論にはJALOの実装と入力動画が必要ですが、学習画像・参照注釈・ローカルmanifestは不要です。モデルに保存した設定を既定で使用します。
| 項目 | 内容 |
|---|---|
| 対応する版 | v0.1.0 |
| ファイル | jalo-local-vehicles-evaluated.pt(60,782,762 bytes) |
| タスク | インスタンスセグメンテーション・単一フレーム |
| アーキテクチャ | vehicle_roi_v2 |
| クラス | car(バンを含む)、truck、bus |
| 入力サイズ | 高さ544 × 幅960、アスペクト比を維持してパディング |
| 描画設定 | クラス信頼度0.3、局所マスク・車両前景の確率0.5、透明度45% |
| 選択した学習状態 | 全注釈を使う学習段階の4,000更新時点、検証動画で選択 |
| 確認した実行環境 | Mac/MPS。CUDAは実機未検証 |
SHA-256: c592301a49ea72ab891aacc8b97b1b5ee1ff990200bd49a387588faf24db832f
これはGitHub Releaseの同名モデルとバイト単位で同一のファイルです。重みと推論設定を保存し、optimizerなどの学習再開用状態は含みません。
バージョン番号をv0.1.0から再スタートしています。今回の採番変更による追加学習はなく、このモデルは直前の改善版と同じ重み・評価値です。
モデルと学習データ
独自実装の位置付きクエリ、Attention、車両ごとの局所マスクヘッドを使用しています。学習の履歴では、旧COCO試作モデル(旧採番v0.1.1)の重みを継承し、運転動画で追加学習しました。現在配布するモデルを今後の改良の出発点としています。外部の学習済み特徴抽出にはImageNetのResNet-18を使用し、既存の検出・セグメンテーションモデルの学習済み重みは流用していません。
COCO 2017公式trainの2,000枚と、以下の学習用動画から注釈した190枚を1対1で混ぜています。動画単位で学習・検証・最終評価を分離しました。
| 用途 | 動画 | 作者・元ライセンス | 注釈枚数 |
|---|---|---|---|
| 学習 | I-495 | Illegitimate Barrister・CC BY-SA 4.0 | 95 |
| 学習 | Broad Creek → Jennifer Road | Illegitimate Barrister・CC BY-SA 4.0 | 95 |
| 検証・モデル選択 | Leaman Farm Road → Game Preserve Road | Illegitimate Barrister・CC BY-SA 4.0 | 95 |
| 最終評価 | 韓国・原州市 | Choi Kwang-mo・CC0 1.0 | 55 |
参照注釈はAIが作成し、AIが全画像の重畳表示を目視確認したもので、独立した人手検証を受けた正解ではありません。モデルの推論出力をそのまま正解にはしていません。注釈・正解矩形・車内ラベルを推論入力や描画時の固定除外マスクには使用しません。
著作権を懸念された日本の右折動画(x8MWXqp4yaM)と、その動画で追加学習した重みは使用していません。
評価と制限
以下はByteTrackを含む実際の着色処理を、注釈時刻で評価した値です。車両Recallは元画像で長辺32px以上の対象について、同一クラス・マスクIoU 0.5・一対一対応で計測しています。
| 指標 | 検証動画 | 未学習の最終評価動画 | 目標 |
|---|---|---|---|
| 着色画素Precision | 96.5% | 94.1% | 90%以上 |
| 車両Recall(長辺32px以上) | 63.2%(282/446) | 75.7%(109/144) | 80%以上 |
| 背景画素への誤着色率 | 0.450% | 0.171% | 0.5%以下 |
| 車内画素への誤着色率 | 対象なし | 0.017% | 0.5%以下 |
検証・最終評価の双方でRecallが未達です。追跡前の最終評価は矩形AP 31.26%、マスクAP 30.64%でした。最終評価の32px未満の車両Recallは21.1%(4/19)で、小さな車両の見逃しが多く残ります。件数には同じ車両が異なる時刻に映る例を含みます。
モデルとしきい値の選択後に最終評価を一度実施し、その結果を使った再調整はしていません。対象動画には編集・時間圧縮や近い構図が続く区間があり、今回の数値を未知の道路全般への性能とは扱いません。合格前の全編出力は行っていません。
比較動画、旧モデルとの比較、サイズ別・クラス別の対象数、再現記録、学習再開用チェックポイントはGitHub Releaseにあります。旧番号のRelease・タグは整理し、元のモデルファイルと実験記録は保全しています。
ライセンス
このリポジトリのライセンスはMITです。外部データ・事前学習済み重みは各提供元の条件を参照してください。出典と詳細な利用条件はGitHub READMEに記録しています。