Refinement-only 1280 TensorRT FP16

exp5 refinement-only 1280 ๋ชจ๋ธ์˜ ์ตœ์ข… checkpoint๋ฅผ ONNX๋กœ exportํ•˜๊ณ  TensorRT FP16 mixed precision์œผ๋กœ ๋ณ€ํ™˜ํ•œ ๋ฐฐํฌ ํŒจํ‚ค์ง€๋‹ค.

๋ชจ๋ธ

ํ•ญ๋ชฉ ๊ฐ’
source acr_20260814_exp5_refinement_only_lr1e-4/model/checkpoint-66780
input pixel_values (1,3,1280,1280), pixel_mask (1,1280,1280)
prompts impossible, possible
class embedding (1,2,128)
outputs logits (1,300,2), pred_boxes (1,300,4), mask_logits (1,300,320,320)
precision TensorRT FP16 mixed precision
build GPU NVIDIA A100-SXM4-80GB
TensorRT 10.16.1.11

์ˆœ์ˆ˜ FP16์€ ์ด ๋ชจ๋ธ์˜ mask_logits์—์„œ NaN์ด ๋ฐœ์ƒํ•  ์ˆ˜ ์žˆ์–ด ์‚ฌ์šฉํ•˜์ง€ ์•Š์•˜๋‹ค. ํ˜„์žฌ ์—”์ง„์€ 8,764๊ฐœ ๋ ˆ์ด์–ด๋ฅผ FP16 ๋Œ€์ƒ์œผ๋กœ ๋‘๊ณ  ์ˆ˜์น˜์ ์œผ๋กœ ๋ฏผ๊ฐํ•œ 262๊ฐœ ๋ ˆ์ด์–ด๋ฅผ FP32๋กœ ๊ณ ์ •ํ–ˆ๋‹ค.

์‚ฐ์ถœ๋ฌผ

ํŒŒ์ผ ํฌ๊ธฐ ์šฉ๋„
onnx/vision_branch_k2.onnx 161.2 MB FP32 ONNX, ๋‹ค๋ฅธ GPU์šฉ ์—”์ง„ ์žฌ๋นŒ๋“œ ์›๋ณธ
onnx/vision_branch_k2_fp16-mixed.engine 99.0 MB A100์šฉ TensorRT FP16 ์—”์ง„
onnx/vision_branch_k2_fp16-mixed_RTX5080.engine 100.1 MB RTX 5080์šฉ TensorRT FP16 ์—”์ง„
onnx/vision_branch_k2_fp16-mixed_RTX5070.engine 100.2 MB RTX 5070์šฉ TensorRT FP16 ์—”์ง„
class_embeddings_padded/refinement.pt 4.8 KB ๋Ÿฐํƒ€์ž„ refinement text embedding
model_src/model.safetensors 235.2 MB ์›๋ณธ PyTorch checkpoint
model_src/conversion_manifest.json 2.0 KB shape, precision, ๊ฒ€์ฆ ๋ฐ ์—”์ง„ ๋ฉ”ํƒ€๋ฐ์ดํ„ฐ
benchmark_report.json 3.9 KB ์†๋„ยท์ •ํ™•๋„ ๊ฒ€์ฆ ์›๋ณธ ๊ฒฐ๊ณผ

๊ฒ€์ฆ ๊ฒฐ๊ณผ

์‹ค์ œ refinement ๊ณ ์ • ํ‰๊ฐ€์…‹ 120์žฅ์— ๋Œ€ํ•ด ๋™์ผํ•œ ์ „์ฒ˜๋ฆฌ์™€ ํ›„์ฒ˜๋ฆฌ๋ฅผ ์‚ฌ์šฉํ–ˆ๋‹ค. ์ •ํ™•๋„ ์ง€ํ‘œ๋Š” score threshold 0.5, mask IoU 0.5์—์„œ ๊ณ„์‚ฐํ–ˆ๋‹ค.

runtime Precision Recall F1 mask mIoU(TP) TP / FP / FN
PyTorch FP32 0.8696 0.5435 0.6689 0.8933 100 / 15 / 84
ONNX FP32 0.8621 0.5435 0.6667 0.8930 100 / 16 / 84
TensorRT FP16 mixed 0.8772 0.5435 0.6711 0.8925 100 / 14 / 84

FP16 ๋ณ€ํ™˜์— ๋”ฐ๋ฅธ ์ตœ์ข… ์ •ํ™•๋„ ์†์‹ค์€ ๊ด€์ธก๋˜์ง€ ์•Š์•˜๋‹ค. FP16์˜ mask mIoU๋Š” PyTorch ๋Œ€๋น„ 0.0008 ๋‚ฎ๊ณ  F1์€ 0.0022 ๋†’์•„ ๋ชจ๋‘ ์ธก์ • ๋ณ€๋™ ๋ฒ”์œ„๋‹ค. ์—”์ง„ ์ถœ๋ ฅ์—์„œ NaN/inf๋„ ๊ฒ€์ถœ๋˜์ง€ ์•Š์•˜๋‹ค.

์†๋„

runtime Mean latency FPS PyTorch ๋Œ€๋น„
PyTorch FP32 322.54 ms 3.10 1.0x
ONNX FP32 154.79 ms 6.46 2.08x
TensorRT FP16 mixed 48.14 ms 20.77 6.70x

์†๋„ ์ธก์ • ๋‹น์‹œ ๊ฐ™์€ ์„œ๋ฒ„์˜ ๋‹ค๋ฅธ ํ•™์Šต ์ž‘์—…์ด GPU๋ฅผ ์ ์œ ํ•˜๊ณ  ์žˆ์—ˆ์œผ๋ฏ€๋กœ ์ ˆ๋Œ€ latency๋Š” ์ฐธ๊ณ ๊ฐ’์ด๋‹ค. ๊ฐ™์€ ์กฐ๊ฑด ๋‚ด ์ƒ๋Œ€ ๋น„๊ต์—์„œ๋Š” TensorRT FP16์ด PyTorch๋ณด๋‹ค ์•ฝ 6.7๋ฐฐ ๋นจ๋ž๋‹ค.

RTX 5080 / 5070 ๊ต์ฐจ ๊ฒ€์ฆ

๋‘ PC ๋ชจ๋‘ ๋™์ผํ•œ refinement ๊ณ ์ • ํ‰๊ฐ€์…‹ 120์žฅ, ์ž…๋ ฅ 1280x1280, batch 1์„ ์‚ฌ์šฉํ–ˆ๋‹ค. ์ •ํ™•๋„๋Š” score threshold 0.5์™€ mask IoU 0.5์—์„œ ์ธก์ •ํ–ˆ์œผ๋ฉฐ, ์†๋„๋Š” warmup 10ํšŒ ํ›„ 50ํšŒ ์ถ”๋ก ์˜ ํ‰๊ท ์ด๋‹ค. ๊ฐ ์—”์ง„์€ ํ•ด๋‹น PC์—์„œ ONNX๋กœ ๋‹ค์‹œ ๋นŒ๋“œํ–ˆ๋‹ค.

ํ™˜๊ฒฝ runtime Precision Recall F1 mask mIoU(TP) Mean latency FPS
RTX 5080 16GB, driver 580.173.02, TRT 10.16.1.11 PyTorch FP32 0.8696 0.5435 0.6689 0.8944 60.09 ms 16.64
RTX 5080 16GB, driver 580.173.02, TRT 10.16.1.11 TensorRT FP16 mixed 0.8696 0.5435 0.6689 0.8939 18.58 ms 53.81
RTX 5070 12GB, driver 580.173.02, TRT 10.16.1.11 PyTorch FP32 0.8696 0.5435 0.6689 0.8944 90.69 ms 11.03
RTX 5070 12GB, driver 580.173.02, TRT 10.16.1.11 TensorRT FP16 mixed 0.8696 0.5435 0.6689 0.8937 28.62 ms 34.94

๋‘ GPU ๋ชจ๋‘ TP/FP/FN์€ 100/15/84๋กœ FP32์™€ ์™„์ „ํžˆ ๋™์ผํ•˜๋ฉฐ F1 ๋ณ€ํ™”๋„ 0์ด๋‹ค. FP16์˜ mIoU ๊ฐ์†Œ๋Š” 5080์—์„œ 0.00056, 5070์—์„œ 0.00074์˜€๋‹ค. TensorRT ์†๋„ ํ–ฅ์ƒ์€ ๊ฐ๊ฐ 3.23๋ฐฐ์™€ 3.17๋ฐฐ๋‹ค. ๋”ฐ๋ผ์„œ ์ด ํ‰๊ฐ€์…‹์—์„œ๋Š” ์˜๋ฏธ ์žˆ๋Š” ์„ฑ๋Šฅ ์ €ํ•˜๊ฐ€ ๊ด€์ธก๋˜์ง€ ์•Š์•˜๋‹ค. ์›๋ณธ ์ธก์ •๊ฐ’์€ benchmark_5080.json๊ณผ benchmark_5070.json์— ๋ณด์กดํ–ˆ๋‹ค. 5070์€ 12GB VRAM ์ œ์•ฝ ๋•Œ๋ฌธ์— ONNX FP32 ๋Ÿฐํƒ€์ž„์„ ๋™์‹œ์— ์ ์žฌํ•˜์ง€ ์•Š๊ณ  PyTorch FP32์™€ TensorRT๋งŒ ๋น„๊ตํ–ˆ๋‹ค.

๋ฌด๊ฒฐ์„ฑ

cbc90afa1968affcc801515dda7fc3d47be9ec653800255bc28a22fdc5528029  vision_branch_k2.onnx
efea40d7e0506d9b5684c4a415394b7a4c5b3916b3db12c6ea7945ba125b7a6c  vision_branch_k2_fp16-mixed.engine
26b93e905f6ba736317d6394b2dc43440a8f11d4c60c70213d5a8522d8d20055  vision_branch_k2_fp16-mixed_RTX5080.engine
05bbf43dbebcfdc528eb045ca4f821dd4c3186b701f6fb0ced16d1d60e0ea056  vision_branch_k2_fp16-mixed_RTX5070.engine

์ฃผ์˜์‚ฌํ•ญ

TensorRT ์—”์ง„์€ GPU ์•„ํ‚คํ…์ฒ˜์™€ TensorRT ๋ฒ„์ „์— ์ข…์†๋œ๋‹ค. ํ˜„์žฌ .engine์€ A100๊ณผ TensorRT 10.16.1.11 ํ™˜๊ฒฝ์—์„œ ๋นŒ๋“œ๋๋‹ค. ๋‹ค๋ฅธ GPU์—์„œ๋Š” vision_branch_k2.onnx๋กœ ์—”์ง„์„ ๋‹ค์‹œ ๋นŒ๋“œํ•ด์•ผ ํ•˜๋ฉฐ, ๊ธฐ์กด A100 ์—”์ง„ ํŒŒ์ผ์„ ๊ทธ๋Œ€๋กœ ๋ฐฐํฌํ•˜๋ฉด ์•ˆ ๋œ๋‹ค.

์žฌ๋ณ€ํ™˜๊ณผ ๊ฒ€์ฆ์— ์‚ฌ์šฉํ•œ ๋ช…๋ น ๋ฐ ์ „์ฒด ์ถœ๋ ฅ์€ ๊ฐ๊ฐ conversion.log, benchmark.log์— ๋ณด์กดํ–ˆ๋‹ค.

Downloads last month
16
Safetensors
Model size
58.8M params
Tensor type
F32
ยท
Inference Providers NEW
This model isn't deployed by any Inference Provider. ๐Ÿ™‹ Ask for provider support

Collection including cmes-deepvision/ACR-instance-segmentaiton-refinement-v1.0.0