plsss

#1
by AxionLab-official - opened

Please 1Bit quantization

AppleMind AI org

sadly impossible, the model is too small :(
logs:

llama_model_loader: - kv 9: general.dataset.1.name str = FineWeb HQ
llama_model_loader: - kv 10: general.dataset.1.organization str = Epfml
llama_model_loader: - kv 11: general.dataset.1.repo_url str = https://huggingface.co/epfml/FineWeb-HQ
llama_model_loader: - kv 12: general.dataset.2.name str = Smollm Corpus
llama_model_loader: - kv 13: general.dataset.2.organization str = HuggingFaceTB
llama_model_loader: - kv 14: general.dataset.2.repo_url str = https://huggingface.co/HuggingFaceTB/...
llama_model_loader: - kv 15: general.tags arr[str,21] = ["lm", "language-model", "causal-lm",...
llama_model_loader: - kv 16: general.languages arr[str,1] = ["en"]
llama_model_loader: - kv 17: gpt2.block_count u32 = 2
llama_model_loader: - kv 18: gpt2.context_length u32 = 256
llama_model_loader: - kv 19: gpt2.embedding_length u32 = 20
llama_model_loader: - kv 20: gpt2.feed_forward_length u32 = 80
llama_model_loader: - kv 21: gpt2.attention.head_count u32 = 2
llama_model_loader: - kv 22: gpt2.attention.layer_norm_epsilon f32 = 0.000010
llama_model_loader: - kv 23: general.file_type u32 = 1
llama_model_loader: - kv 24: general.quantization_version u32 = 2
llama_model_loader: - kv 25: tokenizer.ggml.model str = gpt2
llama_model_loader: - kv 26: tokenizer.ggml.pre str = gpt-2
llama_model_loader: - kv 27: tokenizer.ggml.tokens arr[str,50260] = ["!", """, "#", "$", "%", "&", "'", ...
llama_model_loader: - kv 28: tokenizer.ggml.token_type arr[i32,50260] = [1, 1, 1, 1, 1, 1, 1, 1, 1, 1, 1, 1, ...
llama_model_loader: - kv 29: tokenizer.ggml.merges arr[str,50000] = ["Δ  t", "Δ  a", "h e", "i n", "r e",...
llama_model_loader: - kv 30: tokenizer.ggml.bos_token_id u32 = 50256
llama_model_loader: - kv 31: tokenizer.ggml.eos_token_id u32 = 50256
llama_model_loader: - kv 32: tokenizer.ggml.unknown_token_id u32 = 50256
llama_model_loader: - kv 33: tokenizer.ggml.padding_token_id u32 = 50256
llama_model_loader: - kv 34: tokenizer.chat_template str = {% for message in messages %}{{ '<|' ...
llama_model_loader: - type f32: 19 tensors
llama_model_loader: - type f16: 9 tensors
warning: token_embd.weight - ncols 20 not divisible by 32 (required for type q8_0) llama_model_quantize: failed to quantize: no tensor type fallback is defined for type q8_0
llama_quantize: failed to quantize model from '/home/japugalt/llama.cpp/quantize/AppleMind-1.0-Mini/AppleMind-1.0-Mini-F16.gguf'

Finished in 0.0 seconds.

βœ— FAILED: Q5_K_M
Exit code: 1

################################################################################

Q6_K

################################################################################

================================================================================
RUNNING

/home/japugalt/llama.cpp/build/bin/llama-quantize /home/japugalt/llama.cpp/quantize/AppleMind-1.0-Mini/AppleMind-1.0-Mini-F16.gguf /home/japugalt/llama.cpp/quantize/AppleMind-1.0-Mini/AppleMind-1.0-Mini-Q6_K.gguf Q6_K

version: 0.1.0-dev (build 10398, commit 8e7f22b67)
built with GNU 16.1.1 for Linux x86_64
llama_quantize: quantizing '/home/japugalt/llama.cpp/quantize/AppleMind-1.0-Mini/AppleMind-1.0-Mini-F16.gguf' to '/home/japugalt/llama.cpp/quantize/AppleMind-1.0-Mini/AppleMind-1.0-Mini-Q6_K.gguf' as Q6_K
llama_model_loader: loaded meta data with 35 key-value pairs and 28 tensors from /home/japugalt/llama.cpp/quantize/AppleMind-1.0-Mini/AppleMind-1.0-Mini-F16.gguf (version GGUF V3 (latest))
llama_model_loader: Dumping metadata keys/values. Note: KV overrides do not apply in this output.
llama_model_loader: - kv 0: general.architecture str = gpt2
llama_model_loader: - kv 1: general.type str = model
llama_model_loader: - kv 2: general.name str = Edd1E6E300Aca8Dc2E387Eaa780B944659De5C6C
llama_model_loader: - kv 3: general.size_label str = 1.0M
llama_model_loader: - kv 4: general.license str = apache-2.0
llama_model_loader: - kv 5: general.dataset.count u32 = 3
llama_model_loader: - kv 6: general.dataset.0.name str = Fineweb Edu
llama_model_loader: - kv 7: general.dataset.0.organization str = HuggingFaceFW
llama_model_loader: - kv 8: general.dataset.0.repo_url str = https://huggingface.co/HuggingFaceFW/...
llama_model_loader: - kv 9: general.dataset.1.name str = FineWeb HQ
llama_model_loader: - kv 10: general.dataset.1.organization str = Epfml
llama_model_loader: - kv 11: general.dataset.1.repo_url str = https://huggingface.co/epfml/FineWeb-HQ
llama_model_loader: - kv 12: general.dataset.2.name str = Smollm Corpus
llama_model_loader: - kv 13: general.dataset.2.organization str = HuggingFaceTB
llama_model_loader: - kv 14: general.dataset.2.repo_url str = https://huggingface.co/HuggingFaceTB/...
llama_model_loader: - kv 15: general.tags arr[str,21] = ["lm", "language-model", "causal-lm",...
llama_model_loader: - kv 16: general.languages arr[str,1] = ["en"]
llama_model_loader: - kv 17: gpt2.block_count u32 = 2
llama_model_loader: - kv 18: gpt2.context_length u32 = 256
llama_model_loader: - kv 19: gpt2.embedding_length u32 = 20
llama_model_loader: - kv 20: gpt2.feed_forward_length u32 = 80
llama_model_loader: - kv 21: gpt2.attention.head_count u32 = 2
llama_model_loader: - kv 22: gpt2.attention.layer_norm_epsilon f32 = 0.000010
llama_model_loader: - kv 23: general.file_type u32 = 1
llama_model_loader: - kv 24: general.quantization_version u32 = 2
llama_model_loader: - kv 25: tokenizer.ggml.model str = gpt2
llama_model_loader: - kv 26: tokenizer.ggml.pre str = gpt-2
llama_model_loader: - kv 27: tokenizer.ggml.tokens arr[str,50260] = ["!", """, "#", "$", "%", "&", "'", ...
llama_model_loader: - kv 28: tokenizer.ggml.token_type arr[i32,50260] = [1, 1, 1, 1, 1, 1, 1, 1, 1, 1, 1, 1, ...
llama_model_loader: - kv 29: tokenizer.ggml.merges arr[str,50000] = ["Δ  t", "Δ  a", "h e", "i n", "r e",...
llama_model_loader: - kv 30: tokenizer.ggml.bos_token_id u32 = 50256
llama_model_loader: - kv 31: tokenizer.ggml.eos_token_id u32 = 50256
llama_model_loader: - kv 32: tokenizer.ggml.unknown_token_id u32 = 50256
llama_model_loader: - kv 33: tokenizer.ggml.padding_token_id u32 = 50256
llama_model_loader: - kv 34: tokenizer.chat_template str = {% for message in messages %}{{ '<|' ...
llama_model_loader: - type f32: 19 tensors
llama_model_loader: - type f16: 9 tensors
warning: token_embd.weight - ncols 20 not divisible by 32 (required for type q8_0) llama_model_quantize: failed to quantize: no tensor type fallback is defined for type q8_0
llama_quantize: failed to quantize model from '/home/japugalt/llama.cpp/quantize/AppleMind-1.0-Mini/AppleMind-1.0-Mini-F16.gguf'

Finished in 0.0 seconds.

βœ— FAILED: Q6_K
Exit code: 1

################################################################################

Q8_0

################################################################################

================================================================================
RUNNING

/home/japugalt/llama.cpp/build/bin/llama-quantize /home/japugalt/llama.cpp/quantize/AppleMind-1.0-Mini/AppleMind-1.0-Mini-F16.gguf /home/japugalt/llama.cpp/quantize/AppleMind-1.0-Mini/AppleMind-1.0-Mini-Q8_0.gguf Q8_0

version: 0.1.0-dev (build 10398, commit 8e7f22b67)
built with GNU 16.1.1 for Linux x86_64
llama_quantize: quantizing '/home/japugalt/llama.cpp/quantize/AppleMind-1.0-Mini/AppleMind-1.0-Mini-F16.gguf' to '/home/japugalt/llama.cpp/quantize/AppleMind-1.0-Mini/AppleMind-1.0-Mini-Q8_0.gguf' as Q8_0
llama_model_loader: loaded meta data with 35 key-value pairs and 28 tensors from /home/japugalt/llama.cpp/quantize/AppleMind-1.0-Mini/AppleMind-1.0-Mini-F16.gguf (version GGUF V3 (latest))
llama_model_loader: Dumping metadata keys/values. Note: KV overrides do not apply in this output.
llama_model_loader: - kv 0: general.architecture str = gpt2
llama_model_loader: - kv 1: general.type str = model
llama_model_loader: - kv 2: general.name str = Edd1E6E300Aca8Dc2E387Eaa780B944659De5C6C
llama_model_loader: - kv 3: general.size_label str = 1.0M
llama_model_loader: - kv 4: general.license str = apache-2.0
llama_model_loader: - kv 5: general.dataset.count u32 = 3
llama_model_loader: - kv 6: general.dataset.0.name str = Fineweb Edu
llama_model_loader: - kv 7: general.dataset.0.organization str = HuggingFaceFW
llama_model_loader: - kv 8: general.dataset.0.repo_url str = https://huggingface.co/HuggingFaceFW/...
llama_model_loader: - kv 9: general.dataset.1.name str = FineWeb HQ
llama_model_loader: - kv 10: general.dataset.1.organization str = Epfml
llama_model_loader: - kv 11: general.dataset.1.repo_url str = https://huggingface.co/epfml/FineWeb-HQ
llama_model_loader: - kv 12: general.dataset.2.name str = Smollm Corpus
llama_model_loader: - kv 13: general.dataset.2.organization str = HuggingFaceTB
llama_model_loader: - kv 14: general.dataset.2.repo_url str = https://huggingface.co/HuggingFaceTB/...
llama_model_loader: - kv 15: general.tags arr[str,21] = ["lm", "language-model", "causal-lm",...
llama_model_loader: - kv 16: general.languages arr[str,1] = ["en"]
llama_model_loader: - kv 17: gpt2.block_count u32 = 2
llama_model_loader: - kv 18: gpt2.context_length u32 = 256
llama_model_loader: - kv 19: gpt2.embedding_length u32 = 20
llama_model_loader: - kv 20: gpt2.feed_forward_length u32 = 80
llama_model_loader: - kv 21: gpt2.attention.head_count u32 = 2
llama_model_loader: - kv 22: gpt2.attention.layer_norm_epsilon f32 = 0.000010
llama_model_loader: - kv 23: general.file_type u32 = 1
llama_model_loader: - kv 24: general.quantization_version u32 = 2
llama_model_loader: - kv 25: tokenizer.ggml.model str = gpt2
llama_model_loader: - kv 26: tokenizer.ggml.pre str = gpt-2
llama_model_loader: - kv 27: tokenizer.ggml.tokens arr[str,50260] = ["!", """, "#", "$", "%", "&", "'", ...
llama_model_loader: - kv 28: tokenizer.ggml.token_type arr[i32,50260] = [1, 1, 1, 1, 1, 1, 1, 1, 1, 1, 1, 1, ...
llama_model_loader: - kv 29: tokenizer.ggml.merges arr[str,50000] = ["Δ  t", "Δ  a", "h e", "i n", "r e",...
llama_model_loader: - kv 30: tokenizer.ggml.bos_token_id u32 = 50256
llama_model_loader: - kv 31: tokenizer.ggml.eos_token_id u32 = 50256
llama_model_loader: - kv 32: tokenizer.ggml.unknown_token_id u32 = 50256
llama_model_loader: - kv 33: tokenizer.ggml.padding_token_id u32 = 50256
llama_model_loader: - kv 34: tokenizer.chat_template str = {% for message in messages %}{{ '<|' ...
llama_model_loader: - type f32: 19 tensors
llama_model_loader: - type f16: 9 tensors
warning: token_embd.weight - ncols 20 not divisible by 32 (required for type q8_0) llama_model_quantize: failed to quantize: no tensor type fallback is defined for type q8_0
llama_quantize: failed to quantize model from '/home/japugalt/llama.cpp/quantize/AppleMind-1.0-Mini/AppleMind-1.0-Mini-F16.gguf'

Finished in 0.0 seconds.

βœ— FAILED: Q8_0
Exit code: 1

================================================================================
FINISHED

Successful: 0

Skipped: 0

Failed: 31
βœ— Q1_0
βœ— Q2_0
βœ— Q4_0
βœ— Q4_1
βœ— Q5_0
βœ— Q5_1
βœ— IQ1_S
βœ— IQ1_M
βœ— IQ2_XXS
βœ— IQ2_XS
βœ— IQ2_S
βœ— IQ2_M
βœ— TQ1_0
βœ— TQ2_0
βœ— Q2_K
βœ— Q2_K_S
βœ— IQ3_XXS
βœ— IQ3_XS
βœ— IQ3_S
βœ— IQ3_M
βœ— Q3_K_S
βœ— Q3_K_M
βœ— Q3_K_L
βœ— IQ4_NL
βœ— IQ4_XS
βœ— Q4_K_S
βœ— Q4_K_M
βœ— Q5_K_S
βœ— Q5_K_M
βœ— Q6_K
βœ— Q8_0

================================================================================
GGUF FILES

AppleMind-1.0-Mini-BF16.gguf 3.65 MiB
AppleMind-1.0-Mini-F16.gguf 3.65 MiB
AppleMind-1.0-Mini-F32.gguf 5.58 MiB

Total storage: 12.87 MiB

GGUF directory:
/home/japugalt/llama.cpp/quantize/AppleMind-1.0-Mini

================================================================================
FAILED FORMATS

Q1_0
Q2_0
Q4_0
Q4_1
Q5_0
Q5_1
IQ1_S
IQ1_M
IQ2_XXS
IQ2_XS
IQ2_S
IQ2_M
TQ1_0
TQ2_0
Q2_K
Q2_K_S
IQ3_XXS
IQ3_XS
IQ3_S
IQ3_M
Q3_K_S
Q3_K_M
Q3_K_L
IQ4_NL
IQ4_XS
Q4_K_S
Q4_K_M
Q5_K_S
Q5_K_M
Q6_K
Q8_0

The other formats were still generated.
Download complete: : β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆ| 7.45MB, 1.80MB/s
Reconstruction complete: 100%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆ| 7.77MB / 7.77MB, 1.39MB/s

AppleMind AI org

not even q8 is possible

AxionLab-official changed discussion status to closed
AppleMind AI org

you will have to wait until applemind 1.0 medium releases (5M params)

Sign up or log in to comment