Upload 11 files

Browse files

Files changed (11) hide show

cached_lm_GPT2Tokenizer_128_q&a_test_v5-2.text +0 -0
cached_lm_GPT2Tokenizer_128_q&a_test_v5-2.text.lock +0 -0
config.json +40 -0
generation_config.json +6 -0
merges.txt +0 -0
pytorch_model.bin +3 -0
q&a_test_v5-2.text +0 -0
special_tokens_map.json +23 -0
tokenizer_config.json +33 -0
train.py +116 -0
vocab.json +0 -0

cached_lm_GPT2Tokenizer_128_q&a_test_v5-2.text ADDED Viewed

Binary file (935 kB). View file

cached_lm_GPT2Tokenizer_128_q&a_test_v5-2.text.lock ADDED Viewed

File without changes

config.json ADDED Viewed

	@@ -0,0 +1,40 @@

+{
+  "_name_or_path": "/Users/migueldeguzman/Desktop/gpt2xl_algos/RLLMv3.7-1/layer8/",
+  "activation_function": "gelu_new",
+  "architectures": [
+    "GPT2LMHeadModel"
+  ],
+  "attn_pdrop": 0.1,
+  "bos_token_id": 50256,
+  "embd_pdrop": 0.1,
+  "eos_token_id": 50256,
+  "initializer_range": 0.02,
+  "layer_norm_epsilon": 1e-05,
+  "model_type": "gpt2",
+  "n_ctx": 1024,
+  "n_embd": 1600,
+  "n_head": 25,
+  "n_inner": null,
+  "n_layer": 48,
+  "n_positions": 1024,
+  "output_past": true,
+  "reorder_and_upcast_attn": false,
+  "resid_pdrop": 0.1,
+  "scale_attn_by_inverse_layer_idx": false,
+  "scale_attn_weights": true,
+  "summary_activation": null,
+  "summary_first_dropout": 0.1,
+  "summary_proj_to_labels": true,
+  "summary_type": "cls_index",
+  "summary_use_proj": true,
+  "task_specific_params": {
+    "text-generation": {
+      "do_sample": true,
+      "max_length": 50
+    }
+  },
+  "torch_dtype": "float32",
+  "transformers_version": "4.33.3",
+  "use_cache": true,
+  "vocab_size": 50257
+}

generation_config.json ADDED Viewed

	@@ -0,0 +1,6 @@

+{
+  "_from_model_config": true,
+  "bos_token_id": 50256,
+  "eos_token_id": 50256,
+  "transformers_version": "4.33.3"
+}

merges.txt ADDED Viewed

The diff for this file is too large to render. See raw diff

pytorch_model.bin ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:85794cb5d1de40235b045b8e83b690e81612c02db2dc73ef56d1b2007e1f9ac8
+size 6230624769

q&a_test_v5-2.text ADDED Viewed

The diff for this file is too large to render. See raw diff

special_tokens_map.json ADDED Viewed

	@@ -0,0 +1,23 @@

+{
+  "bos_token": {
+    "content": "<|endoftext|>",
+    "lstrip": false,
+    "normalized": true,
+    "rstrip": false,
+    "single_word": false
+  },
+  "eos_token": {
+    "content": "<|endoftext|>",
+    "lstrip": false,
+    "normalized": true,
+    "rstrip": false,
+    "single_word": false
+  },
+  "unk_token": {
+    "content": "<|endoftext|>",
+    "lstrip": false,
+    "normalized": true,
+    "rstrip": false,
+    "single_word": false
+  }
+}

tokenizer_config.json ADDED Viewed

	@@ -0,0 +1,33 @@

+{
+  "add_bos_token": false,
+  "add_prefix_space": false,
+  "bos_token": {
+    "__type": "AddedToken",
+    "content": "<|endoftext|>",
+    "lstrip": false,
+    "normalized": true,
+    "rstrip": false,
+    "single_word": false
+  },
+  "clean_up_tokenization_spaces": true,
+  "eos_token": {
+    "__type": "AddedToken",
+    "content": "<|endoftext|>",
+    "lstrip": false,
+    "normalized": true,
+    "rstrip": false,
+    "single_word": false
+  },
+  "errors": "replace",
+  "model_max_length": 1000000000000000019884624838656,
+  "pad_token": null,
+  "tokenizer_class": "GPT2Tokenizer",
+  "unk_token": {
+    "__type": "AddedToken",
+    "content": "<|endoftext|>",
+    "lstrip": false,
+    "normalized": true,
+    "rstrip": false,
+    "single_word": false
+  }
+}

train.py ADDED Viewed

	@@ -0,0 +1,116 @@

+import os
+os.environ['KMP_DUPLICATE_LIB_OK'] = 'TRUE'
+import sys
+import torch
+from transformers import GPT2Tokenizer, GPT2LMHeadModel, TextDataset, DataCollatorForLanguageModeling, Trainer, TrainingArguments, get_linear_schedule_with_warmup
+class GPT2Assistant:
+    def __init__(self):
+        self.tokenizer = GPT2Tokenizer.from_pretrained("/Users/migueldeguzman/Desktop/gpt2xl_algos/RLLMv3.7-1/layer8/")
+    def fine_tune(self, answer_file_path, model_output_dir, epochs=1.0): #previously 1.0
+        self.model = GPT2LMHeadModel.from_pretrained("/Users/migueldeguzman/Desktop/gpt2xl_algos/RLLMv3.7-1/layer8/")
+        train_dataset = TextDataset(
+            tokenizer=self.tokenizer,
+            file_path=answer_file_path,
+            block_size=128
+        )
+        data_collator = DataCollatorForLanguageModeling(
+            tokenizer=self.tokenizer,
+            mlm=False
+        )
+        total_steps = len(train_dataset) * epochs
+        warmup_steps = 0.1 * total_steps
+        optimizer = torch.optim.Adam(self.model.parameters(), lr=42e-6, weight_decay=0.005) #lr=3.536842105e-5
+        #scheduler_cosine = torch.optim.lr_scheduler.CosineAnnealingLR(optimizer, epochs)
+        scheduler = get_linear_schedule_with_warmup(optimizer, num_warmup_steps=warmup_steps, num_training_steps=total_steps)
+        training_args = TrainingArguments(
+            output_dir=model_output_dir,
+            overwrite_output_dir=True,
+            num_train_epochs=epochs,
+            per_device_train_batch_size=4, #previously 16
+            save_steps=10_000,
+            save_total_limit=2,
+            gradient_accumulation_steps=8, #previously 32
+            lr_scheduler_type='cosine', #constant
+            warmup_steps=500
+        )
+        trainer = Trainer(
+            model=self.model,
+            args=training_args,
+            data_collator=data_collator,
+            train_dataset=train_dataset,
+            optimizers=(optimizer, scheduler)  # Pass both the optimizer and scheduler as a tuple
+        )
+        trainer.train()
+        self.model.save_pretrained(model_output_dir)
+        self.tokenizer.save_pretrained(model_output_dir)
+    def generate_answer(self, prompt, max_length=1000):
+        input_ids = self.tokenizer.encode(prompt, return_tensors="pt")
+        if self.tokenizer.pad_token_id is None:
+            self.tokenizer.pad_token = self.tokenizer.eos_token
+        attention_mask = (input_ids != self.tokenizer.pad_token_id).long()
+        output = self.model.generate(
+            input_ids,
+            attention_mask=attention_mask,
+            max_length=max_length,
+            num_return_sequences=1,
+            no_repeat_ngram_size=2,
+            do_sample=True,
+            top_k=50,
+            top_p=0.95,
+            temperature=0.000000000000000000000000000000000001
+        )
+        answer = self.tokenizer.decode(output[0], skip_special_tokens=True)
+        return answer[len(prompt):]
+    def query(self, prompt):
+        generated_answer = self.generate_answer(prompt)
+        print(generated_answer)
+        return generated_answer
+def main():
+    text_file_path = "/Users/migueldeguzman/Desktop/gpt2xl_algos/RLLMv3.7-1/layer9/q&a_test_v5-2.text"
+    model_output_dir = "/Users/migueldeguzman/Desktop/gpt2xl_algos/RLLMv3.7-1/layer9/"
+    assistant = GPT2Assistant()
+    choice = input("Do you want to fine-tune a new model (n) or load an existing one (e)? (n/e): ")
+    if choice.lower() == "n":
+        print("Fine-tuning the model...")
+        assistant.fine_tune(text_file_path, model_output_dir)
+        print("Model fine-tuning complete.")
+    elif choice.lower() == "e":
+        print("Loading the existing model...")
+        assistant.model = GPT2LMHeadModel.from_pretrained(model_output_dir)
+        print("Existing model loaded.")
+    else:
+        print("Invalid choice. Exiting the program.")
+        sys.exit()
+    while True:
+        prompt = input("Enter your question (or type 'exit' to stop): ")
+        if prompt.lower() == "exit":
+            break
+        print("Answering in progress...")
+        generated_answer = assistant.query(prompt)
+        print("\n")
+if __name__ == "__main__":
+    main()

vocab.json ADDED Viewed

The diff for this file is too large to render. See raw diff