bofenghuang
/

vigostral-7b-chat

@@ -52,6 +52,16 @@ Bonjour ! Comment ça va aujourd'hui ? [/INST] Bonjour ! Je suis une IA, donc je
 ## Usage
 ### Inference using the unquantized model with 🤗 Transformers
 ```python
@@ -107,36 +117,15 @@ def chat(
     return generated_text, history
 # 1st round
 response, history = chat("Un escargot parcourt 100 mètres en 5 heures. Quelle est sa vitesse ?", history=None)
-# Pour calculer la vitesse d'un escargot qui parcourt 100 mètres en 5 heures, nous devons diviser la distance parcourue par le temps écoulé. Voici comment procédons :
-#
-# Vitesse = Distance / Temps
-#
-# Dans ce cas, la distance est de 100 mètres et le temps est de 5 heures. Donc, nous avons :
-#
-# Vitesse = 100 mètres / 5 heures
-# Vitesse = 20 mètres par heure
-#
-# L'escargot parcourt donc une vitesse de 20 mètres par heure.
 # 2nd round
 response, history = chat("Quand il peut dépasser le lapin ?", history=history)
-# Malheureusement, je ne peux pas répondre à cette question car elle contient des informations inexactes ou incorrectes. La vitesse de l'escargot est de 20 mètres par heure, tandis que la vitesse du lapin n'est pas mentionnée dans votre question initiale. Pour comparer les vitesses des deux animaux, nous aurions besoin de connaître la vitesse du lapin.
 # 3rd round
 response, history = chat("Écris une histoire imaginative qui met en scène une compétition de course entre un escargot et un lapin.", history=history)
-# Il était une fois deux athlètes extraordinaires : un escargot nommé Escargo et un lapin appelé Lapin Rapide. Un jour, ils ont décidé de participer à une grande course pour déterminer qui était le plus rapide des deux. Tout le monde était curieux de savoir qui serait le gagnant, car ils étaient tous émerveillés par la vitesse de ces deux champions.
-#
-# La course commença dans une forêt dense, avec Escargo départageant un peu lentement, car il faut être prudent lorsqu'on est escargot. Mais au fur et à mesure qu'il avançait, il commença à ralentir encore plus. Les spectateurs commencèrent à pencher pour Lapin Rapide, qui fonçait rapidement vers la ligne d'arrivée.
-#
-# Mais soudain, Escargo se transforma en une force incroyable. Au lieu de marcher lentement comme un escargot, il courait à toute allure, faisant preuve d'une vitesse surprenante. Les spectateurs essayaient de se remémorer leurs notes de mathématiques pour calculer sa vélocité actuelle.
-#
-# Pendant ce temps, Lapin Rapide ralentissait légèrement, trouvant l'air frais trop confortable pour continuer à courir aussi vite. Il décida alors de prendre quelques pauses pour profiter de son environnement.
-#
-# Escargo continuait à courir à toute vitesse, en dépit de son handicap d'être un escargot. Les spectateurs étaient émerveillés par sa persévérance et sa volonté de gagner. Finalement, Escargo franchit la ligne d'arrivée en premier, et tous criaurent en joie.
-#
-# Les habitants de la forêt décidèrent de lui décerner le titre d'"athlète le plus courageux" pour sa performance incroyable. Quant à Lapin Rapide, il fut content de sa deuxième place, se disant simplement que les pauses étaient bien plus agréables que la compétition. Et tous vécurent heureux et satisfaits de cette course mémorable.
 ```
 You can also use the Google Colab Notebook provided below.
@@ -159,7 +148,35 @@ python -m vllm.entrypoints.openai.api_server --model bofenghuang/vigostral-7b-ch
 # curl http://localhost:8000/v1/models
 ```
-Query the model using the openai python package.
 ```python
 import openai
@@ -172,11 +189,13 @@ openai.api_base = "http://localhost:8000/v1"
 models = openai.Model.list()
 model = models["data"][0]["id"]
 # Chat completion API
 chat_completion = openai.ChatCompletion.create(
     model=model,
     messages=[
-        {"role": "user", "content": "Parle-moi de toi-même."},
     ],
     max_tokens=1024,
     temperature=0.7,

 ## Usage
+### Inference using the quantized versions
+The quantized versions of this model are generously provided by [TheBloke](https://huggingface.co/TheBloke)!
+- AWQ for GPU inference: [TheBloke/Vigostral-7B-Chat-AWQ](https://huggingface.co/TheBloke/Vigostral-7B-Chat-AWQ)
+- GTPQ for GPU inference: [TheBloke/Vigostral-7B-Chat-GPTQ](https://huggingface.co/TheBloke/Vigostral-7B-Chat-GPTQ)
+- GGUF for CPU+GPU inference: [TheBloke/Vigostral-7B-Chat-GGUF](https://huggingface.co/TheBloke/Vigostral-7B-Chat-GGUF)
+These versions facilitate testing and development with various popular frameworks, including [AutoAWQ](https://github.com/casper-hansen/AutoAWQ), [vLLM](https://github.com/vllm-project/vllm), [AutoGPTQ](https://github.com/PanQiWei/AutoGPTQ), [GPTQ-for-LLaMa](https://github.com/qwopqwop200/GPTQ-for-LLaMa), [llama.cpp](https://github.com/ggerganov/llama.cpp), [text-generation-webui](https://github.com/oobabooga/text-generation-webui), and more.
 ### Inference using the unquantized model with 🤗 Transformers
 ```python
     return generated_text, history
 # 1st round
 response, history = chat("Un escargot parcourt 100 mètres en 5 heures. Quelle est sa vitesse ?", history=None)
 # 2nd round
 response, history = chat("Quand il peut dépasser le lapin ?", history=history)
 # 3rd round
 response, history = chat("Écris une histoire imaginative qui met en scène une compétition de course entre un escargot et un lapin.", history=history)
 ```
 You can also use the Google Colab Notebook provided below.
 # curl http://localhost:8000/v1/models
 ```
+You can also use the docker image provided below.
+```bash
+# Launch inference engine
+docker run --gpus '"device=0"' \
+    -e HF_TOKEN=$HF_TOKEN -p 8000:8000 \
+    ghcr.io/bofenghuang/vigogne/vllm:latest \
+    --host 0.0.0.0 \
+    --model bofenghuang/vigostral-7b-chat
+# Launch inference engine on mutli-GPUs (4 here)
+docker run --gpus all \
+    -e HF_TOKEN=$HF_TOKEN -p 8000:8000 \
+    ghcr.io/bofenghuang/vigogne/vllm:latest \
+    --host 0.0.0.0 \
+    --tensor-parallel-size 4 \
+    --model bofenghuang/vigostral-7b-chat
+# Launch inference engine using the quantized AWQ version
+# Note only supports Ampere or newer GPUs
+docker run --gpus '"device=0"' \
+    -e HF_TOKEN=$HF_TOKEN -p 8000:8000 \
+    ghcr.io/bofenghuang/vigogne/vllm:latest \
+    --host 0.0.0.0 \
+    --quantization awq \
+    --model TheBloke/Vigostral-7B-Chat-AWQ
+```
+Afterward, you can query the model using the openai Python package.
 ```python
 import openai
 models = openai.Model.list()
 model = models["data"][0]["id"]
+query_message = "Parle-moi de toi-même."
 # Chat completion API
 chat_completion = openai.ChatCompletion.create(
     model=model,
     messages=[
+        {"role": "user", "content": query_message},
     ],
     max_tokens=1024,
     temperature=0.7,