YAML Metadata Warning:empty or missing yaml metadata in repo card

Check out the documentation for more information.

Agriculture Text Transform Model 🇷🇺🌾

Модель на базе cointegrated/rut5-base-multitask, дообученная на паре input → output из Excel-файла, предназначена для трансформации аграрных или иных текстов: исправления, нормализации, переформулирования и т.п.


🧠 Архитектура

  • Тип модели: Sequence-to-Sequence (Text2Text)
  • Архитектура: T5 (Text-to-Text Transfer Transformer)
  • Основа: cointegrated/rut5-base-multitask
  • Фреймворк: PyTorch + Transformers
  • GPU: использовалась CUDA для обучения

📁 Структура модели

agriculture_text_transform_model/
├── config.json
├── generation_config.json
├── model.safetensors
├── special_tokens_map.json
├── spiece.model
├── tokenizer_config.json

📊 Обучение

Обучение производилось на кастомном датасете в формате Excel (train.xlsx) без заголовков, где:

  • input — исходный текст,
  • output — целевой текст.

Параметры обучения:

  • Модель: cointegrated/rut5-base-multitask
  • Эпох: 95
  • Размер батча: 16
  • Максимальная длина текста: 128
  • Optimizer: Adam (lr=1e-5)

Пример исользования:

import torch
from transformers import T5ForConditionalGeneration, T5Tokenizer

model = T5ForConditionalGeneration.from_pretrained("RimasZzz/agriculture_text_transform_model").cuda()
tokenizer = T5Tokenizer.from_pretrained("RimasZzz/agriculture_text_transform_model")

def transform_text(text, **kwargs):
    inputs = tokenizer(text, return_tensors='pt', truncation=True, max_length=128).to(model.device)
    with torch.no_grad():
        outputs = model.generate(
            **inputs,
            max_length=128,
            num_beams=5,
            repetition_penalty=2.5,
            **kwargs
        )
    return tokenizer.decode(outputs[0], skip_special_tokens=True)

# Пример:
transform_text("Пахота зяби под мн тр")
# → "Пахота зяби под Многолетние травы"

license: apache-2.0 language: - ru base_model: - cointegrated/rut5-base-multitask library_name: transformers tags: - biology

Downloads last month
5
Safetensors
Model size
0.2B params
Tensor type
F32
·
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support