ACR Instance Segmentation RF-DETR Refinement FP16 v1.0.0

ACR Refinement์šฉ cmes_RF_Refinement_960_v1.0.0 RF-DETR Seg2XLarge ๋ชจ๋ธ์„ RTX 5070๊ณผ RTX 5080์—์„œ ๊ฐ๊ฐ ๋นŒ๋“œํ•œ TensorRT FP16 ๋ฐฐํฌ ํŒจํ‚ค์ง€์ž…๋‹ˆ๋‹ค.

๊ฒ€์ฆ ์š”์•ฝ: ๋‘ ์—”์ง„ ๋ชจ๋‘ ์ •์ƒ์ ์œผ๋กœ ๋นŒ๋“œ๋๊ณ  350์žฅ ํ‰๊ฐ€์—์„œ NaN/Inf ์—†์ด ๋™์ž‘ํ–ˆ์Šต๋‹ˆ๋‹ค. GT F1์€ ์œ ์ง€ ๋˜๋Š” ๊ฐœ์„ ๋์œผ๋ฉฐ E2E ์ถ”๋ก  ์†๋„๋Š” 5๋ฐฐ ์ด์ƒ ํ–ฅ์ƒ๋์Šต๋‹ˆ๋‹ค. GPU๋ณ„ ์ƒ์„ธ ์ •ํ™•๋„์™€ ์›๋ณธ ๋Œ€๋น„ ์ถœ๋ ฅ ์ผ์น˜๋„๋Š” ์•„๋ž˜ ํ‘œ์™€ benchmarks/ ๋ณด๊ณ ์„œ์—์„œ ํ™•์ธํ•  ์ˆ˜ ์žˆ์Šต๋‹ˆ๋‹ค.

๊ธฐ์ค€ ๋ชจ๋ธ ๋ฐ provenance

  • ์ €์žฅ์†Œ: cmes-deepvision/ACR-instance-segmentation-RF-Refinement-v1.0.0
  • ๊ณ ์ • revision: 2ce6b903fd1bd935a32304d5b85ea9e176ae92c7
  • ๊ฐ€์ค‘์น˜: cmes_RF_Refinement_960_v1.0.0.pth
  • ๊ฐ€์ค‘์น˜ SHA-256: 06e088c6bbb4c05e4eda2770d4fe625c98cb5ce677e1635a21670238229d7c0d
  • ONNX SHA-256: a113f18f9901b2f793fd4ef3d5f56793c530f525c0ba3e099e51977be7c934fd
  • ํ‰๊ฐ€ manifest SHA-256: 51aa6018ab921ecc6e1a953e682a73c156b83f9915d829dad112e750c866265f
  • ํ‰๊ฐ€ selection SHA-256: 507af326ed1d153a7057e22c8cae0b7dd11d94e00fae5374719757cea5c6bbfe
  • evaluator SHA-256: c3e6c1d7f51011755e2241f47bb17b392d98c43d959647d0e51694f5287310c1

์—”์ง„ ์„ ํƒ

๋Œ€์ƒ GPU ์—”์ง„ ํŒŒ์ผ ํฌ๊ธฐ SHA-256
RTX 5070 engines/cmes_RF_Refinement_960_v1.0.0.fp16.RTX5070.trt 81,902,636 bytes ea40a7fb6cf6955f541ae020398da82403be913e3b6a3829b8a4a9ec3e687213
RTX 5080 engines/cmes_RF_Refinement_960_v1.0.0.fp16.RTX5080.trt 82,094,220 bytes d2185353eaa3adc4209f70772523a0959647f950bd074ed1d1f3472567135a0c

TensorRT serialized engine์€ ๋นŒ๋“œ GPU, TensorRT ๋ฐ CUDA ํ™˜๊ฒฝ์— ์ข…์†๋ฉ๋‹ˆ๋‹ค. RTX 5070์—์„œ๋Š” RTX 5070 ์—”์ง„์„, RTX 5080์—์„œ๋Š” RTX 5080 ์—”์ง„์„ ์‚ฌ์šฉํ•˜์‹ญ์‹œ์˜ค. ๋‹ค๋ฅธ GPU์—์„œ์˜ ์žฌ์‚ฌ์šฉ์€ ์ง€์›ํ•˜์ง€ ์•Š์Šต๋‹ˆ๋‹ค.

๋ชจ๋ธ ๋ฐ ์ž…๋ ฅ

  • ๋ชจ๋ธ: RF-DETR Seg2XLarge (rfdetr==1.9.0)
  • ์ž…๋ ฅ: RGB, batch 1, 1 x 3 x 960 x 960
  • ์ •๋ฐ€๋„ ์ •์ฑ…: RF-DETR native export์˜ TensorRT fp16=True
  • ์ž…์ถœ๋ ฅ binding: FP32
  • ์ถœ๋ ฅ: dets [1,300,4], labels [1,300,4], masks [1,300,240,240]
  • confidence threshold: 0.50
  • ์ตœ๋Œ€ detection ์ˆ˜: 300

๊ฒ€์ฆ ํ™˜๊ฒฝ

ํ•ญ๋ชฉ RTX 5070 RTX 5080
NVIDIA driver 580.173.02 580.173.02
Compute capability 12.0 12.0
Python 3.12.3 3.12.13
PyTorch 2.11.0+cu128 2.9.1+cu128
TorchVision 0.26.0+cu128 0.24.1+cu128
CUDA runtime 12.8 12.8
cuDNN 91900 91002
TensorRT 10.16.1.11 10.16.1.11
NumPy / SciPy 2.5.2 / 1.18.1 2.2.6 / 1.18.0

๊ณตํ†ต ONNX๋Š” RTX 5080 ํ™˜๊ฒฝ์˜ PyTorch 2.9.1+cu128, CUDA 12.8๋กœ exportํ•œ ๋’ค ๊ฐ ๋Œ€์ƒ GPU์—์„œ ๋ณ„๋„์˜ TensorRT ์—”์ง„์œผ๋กœ ๋นŒ๋“œํ–ˆ์Šต๋‹ˆ๋‹ค.

์„ค์น˜

python -m pip install -r requirements.txt

๋‹ค์šด๋กœ๋“œ

from huggingface_hub import hf_hub_download

engine_path = hf_hub_download(
    repo_id="cmes-deepvision/ACR-instance-segmentation-RF-Refinement-FP16-v1.0.0",
    filename="engines/cmes_RF_Refinement_960_v1.0.0.fp16.RTX5080.trt",
)

์ถ”๋ก 

--engine์„ ์ƒ๋žตํ•˜๋ฉด ํ˜„์žฌ GPU ์ด๋ฆ„์—์„œ RTX 5070/5080 ์—”์ง„์„ ์ž๋™ ์„ ํƒํ•ฉ๋‹ˆ๋‹ค.

python scripts/infer_tensorrt.py image.jpg --threshold 0.50

์—”์ง„์„ ๋ช…์‹œํ•˜๋ ค๋ฉด:

python scripts/infer_tensorrt.py image.jpg \
  --engine engines/cmes_RF_Refinement_960_v1.0.0.fp16.RTX5070.trt \
  --output-dir outputs

์ถœ๋ ฅ ํด๋”์—๋Š” mask/bbox overlay JPEG์™€ detection JSON์ด ์ƒ์„ฑ๋ฉ๋‹ˆ๋‹ค.

ํด๋ž˜์Šค ์ˆœ์„œ

0  possible
1  impossible
2  under_possible

ํ‰๊ฐ€ ๋ฐฉ๋ฒ•

๊ณ ์ •๋œ Lance Refinement test split 350์žฅ ์ „์ฒด์—์„œ ๋™์ผํ•œ ์ „์ฒ˜๋ฆฌ์™€ ํ›„์ฒ˜๋ฆฌ๋ฅผ ์ ์šฉํ•œ ์›๋ณธ PyTorch FP32์™€ GPU๋ณ„ TensorRT FP16 ๊ฒฐ๊ณผ๋ฅผ ๋น„๊ตํ–ˆ์Šต๋‹ˆ๋‹ค.

  • confidence threshold: 0.50
  • backend agreement: class-aware Hungarian matching
  • bbox/mask ์ผ์น˜ ํŒ์ •: IoU >= 0.50
  • GT ํ‰๊ฐ€: class-aware score-ordered greedy matching, mask ๋น„๊ต 320 x 320
  • GT ํ‰๊ฐ€ ํด๋ž˜์Šค: possible, impossible
  • under_possible: GT ์ง‘๊ณ„์—์„œ๋Š” ์ œ์™ธํ•˜๊ณ  backend agreement์—๋Š” ํฌํ•จ

๊ธฐ์กด ์›๋ณธ ๋ชจ๋ธ ์นด๋“œ์˜ sanity baseline์€ F1 0.581560 (TP/FP/FN = 328/145/327)์ด๊ณ , ์ด๋ฒˆ paired evaluator์˜ PyTorch FP32 reference๋Š” F1 0.581333 (327/143/328)์ž…๋‹ˆ๋‹ค. ์ฐจ์ด๋Š” -0.000227 (-0.0227 pp)์ž…๋‹ˆ๋‹ค. checkpoint PTH์™€ ํ‰๊ฐ€ manifest/selection์€ ๋™์ผํ•˜๋ฉฐ, ๋…๋ฆฝ ์‹คํ–‰ํ™˜๊ฒฝ๊ณผ ๊ธฐ์กด evaluator ๊ฒฝ๊ณ„(model.predict wrapper/direct module, JPEG decodeยทmask resize runtime ํฌํ•จ)์—์„œ ๊ด€์ฐฐ๋œ ๋ฏธ์„ธ variation์ž…๋‹ˆ๋‹ค. ๋ณด์กด๋œ ๊ธฐ์กด evaluator/runtime๋งŒ์œผ๋กœ ๋‹จ์ผ ์›์ธ์€ ํ™•์ •ํ•  ์ˆ˜ ์—†์Šต๋‹ˆ๋‹ค. ๋ณ€ํ™˜ ์ „ํ›„ ์ฐจ์ด๋Š” ๊ฐ ์„œ๋ฒ„์—์„œ ๋™์ผ evaluator๋กœ ์ธก์ •ํ•œ PyTorch FP32โ†”TensorRT FP16 paired ๊ฒฐ๊ณผ๋งŒ ์‚ฌ์šฉํ–ˆ์Šต๋‹ˆ๋‹ค.

Backend agreement

GPU BBox P BBox R Mask P Mask R
RTX 5070 94.48% 94.68% 94.06% 94.26%
RTX 5080 95.84% 93.19% 95.62% 92.98%

์œ„ ์ˆ˜์น˜๋Š” class-aware IoU 0.50 ๋งค์นญ ๊ธฐ์ค€์œผ๋กœ ์ธก์ •ํ•œ ์›๋ณธ PyTorch FP32 ๋Œ€๋น„ TensorRT FP16์˜ ๊ฐœ๋ณ„ prediction ์ผ์น˜๋„์ž…๋‹ˆ๋‹ค.

GT ์„ฑ๋Šฅ ๋ณ€ํ™”

๋ณ€ํ™”๋Š” TensorRT FP16 - PyTorch FP32์ด๋ฉฐ, pp๋Š” percentage point์ž…๋‹ˆ๋‹ค.

GPU F1 ์›๋ณธ โ†’ TRT F1 ๋ณ€ํ™” TP mIoU ์›๋ณธ โ†’ TRT mIoU ๋ณ€ํ™” FP ์›๋ณธ โ†’ TRT
RTX 5070 0.581333 โ†’ 0.602131 +2.0798 pp 0.839419 โ†’ 0.836752 -0.2666 pp 143 โ†’ 132
RTX 5080 0.581333 โ†’ 0.580935 -0.0398 pp 0.839406 โ†’ 0.837796 -0.1610 pp 143 โ†’ 134

RTX 5080์€ ์›๋ณธ ๋Œ€๋น„ F1 ๋ณ€ํ™”๊ฐ€ -0.0398 pp, TP mIoU ๋ณ€ํ™”๊ฐ€ -0.1610 pp๋กœ ์ธก์ •๋์Šต๋‹ˆ๋‹ค. RTX 5070์€ F1์ด +2.0798 pp, TP mIoU๊ฐ€ -0.2666 pp์˜€์Šต๋‹ˆ๋‹ค. RTX 5070์˜ F1 ๋ณ€ํ™”์—๋Š” prediction count ์ฐจ์ด๊ฐ€ ํฌํ•จ๋˜๋ฏ€๋กœ ๋‹ค๋ฅธ ๋ฐ์ดํ„ฐ์—์„œ๋„ ๊ฐ™์€ ํญ์˜ ํ–ฅ์ƒ์„ ๋ณด์žฅํ•˜๋Š” ์ˆ˜์น˜๋กœ ํ•ด์„ํ•˜์ง€ ๋งˆ์‹ญ์‹œ์˜ค.

๋‘ ์—”์ง„ ๋ชจ๋‘ ํ‰๊ฐ€ํ•œ raw output์˜ NaN/Inf์™€ invalid class ID๋Š” 0๊ฐœ์˜€์Šต๋‹ˆ๋‹ค.

์†๋„

warm-up 5์žฅ ์ดํ›„ ๊ณ ์ •๋œ 50์žฅ์„ 3ํšŒ ๋ฐ˜๋ณตํ–ˆ์Šต๋‹ˆ๋‹ค. E2E๋Š” ๋ฉ”๋ชจ๋ฆฌ ๋‚ด PIL ์ด๋ฏธ์ง€์˜ ์ „์ฒ˜๋ฆฌ, ์ถ”๋ก , RF-DETR segmentation ํ›„์ฒ˜๋ฆฌ ๋ฐ CPU prediction ๋ณ€ํ™˜์„ ํฌํ•จํ•˜๊ณ , ๋””์Šคํฌ I/O์™€ ๋ชจ๋ธ/์—”์ง„ ๋กœ๋“œ๋Š” ์ œ์™ธํ•ฉ๋‹ˆ๋‹ค.

GPU PyTorch FP32 E2E TensorRT FP16 E2E TensorRT E2E FPS E2E ์†๋„ ํ–ฅ์ƒ ์—”์ง„ ๋‹จ๋…
RTX 5070 75.11 ms 12.62 ms 79.23 5.951x 10.82 ms / 92.40 FPS
RTX 5080 51.50 ms 9.76 ms 102.43 5.275x 7.14 ms / 140.11 FPS

์ „์ฒด ์ˆ˜์น˜, ํด๋ž˜์Šคยทtask๋ณ„ GT ๊ฒฐ๊ณผ์™€ ๊ฐœ๋ณ„ acceptance check๋Š” benchmarks/benchmark_RTX5070.json ๋ฐ benchmarks/benchmark_RTX5080.json์— ์žˆ์Šต๋‹ˆ๋‹ค. ๊ณต๊ฐœ ๋ณด๊ณ ์„œ์—์„œ๋Š” ์ด๋ฏธ์ง€๋ณ„ ๋ ˆ์ฝ”๋“œ์™€ ๋‚ด๋ถ€ ์„œ๋ฒ„ ์‹๋ณ„์ •๋ณด๋ฅผ ์ œ๊ฑฐํ–ˆ์Šต๋‹ˆ๋‹ค.

์ตœ์ข… ํ•ด์„

FP16 ์—”์ง„์€ ๋‘ GPU ๋ชจ๋‘ ์œ ํ•œํ•œ ์ถœ๋ ฅ์„ ๋‚ด๊ณ  GT F1์„ ๋Œ€์ฒด๋กœ ์œ ์ง€ํ•˜๋ฉด์„œ 5๋ฐฐ ์ด์ƒ์˜ E2E ์†๋„ ํ–ฅ์ƒ์„ ๋ณด์˜€์Šต๋‹ˆ๋‹ค. ๊ฐœ๋ณ„ prediction์€ ์›๋ณธ๊ณผ ์™„์ „ํžˆ ๋™์ผํ•˜์ง€ ์•Š์œผ๋ฏ€๋กœ ์šด์˜ ๋ฐฐํฌ ์ „ ์‹ค์ œ ๋ฐ์ดํ„ฐ์—์„œ threshold ๋ฏผ๊ฐ๋„์™€ ๋ˆ„๋ฝยท์ถ”๊ฐ€ detection์„ ๊ฒ€ํ† ํ•˜์‹ญ์‹œ์˜ค.

๋ฌด๊ฒฐ์„ฑ ํ™•์ธ

sha256sum -c SHA256SUMS
Downloads last month
-
Inference Providers NEW
This model isn't deployed by any Inference Provider. ๐Ÿ™‹ Ask for provider support

Collection including cmes-deepvision/ACR-instance-segmentation-RF-Refinement-FP16-v1.0.0