The model's single-inference speed measured on two DGX systems is only 16 tokens/s, which does not meet productivity requirements.

#9
by SAJDOQPDPS - opened

Sign up or log in to comment