YAML Metadata Warning:empty or missing yaml metadata in repo card
Check out the documentation for more information.
Agriculture Text Transform Model 🇷🇺🌾
Модель на базе cointegrated/rut5-base-multitask, дообученная на паре input → output из Excel-файла, предназначена для трансформации аграрных или иных текстов: исправления, нормализации, переформулирования и т.п.
🧠 Архитектура
- Тип модели: Sequence-to-Sequence (Text2Text)
- Архитектура: T5 (Text-to-Text Transfer Transformer)
- Основа:
cointegrated/rut5-base-multitask - Фреймворк: PyTorch + Transformers
- GPU: использовалась CUDA для обучения
📁 Структура модели
agriculture_text_transform_model/
├── config.json
├── generation_config.json
├── model.safetensors
├── special_tokens_map.json
├── spiece.model
├── tokenizer_config.json
📊 Обучение
Обучение производилось на кастомном датасете в формате Excel (train.xlsx) без заголовков, где:
input— исходный текст,output— целевой текст.
Параметры обучения:
- Модель:
cointegrated/rut5-base-multitask - Эпох:
95 - Размер батча:
16 - Максимальная длина текста:
128 - Optimizer:
Adam (lr=1e-5)
Пример исользования:
import torch
from transformers import T5ForConditionalGeneration, T5Tokenizer
model = T5ForConditionalGeneration.from_pretrained("RimasZzz/agriculture_text_transform_model").cuda()
tokenizer = T5Tokenizer.from_pretrained("RimasZzz/agriculture_text_transform_model")
def transform_text(text, **kwargs):
inputs = tokenizer(text, return_tensors='pt', truncation=True, max_length=128).to(model.device)
with torch.no_grad():
outputs = model.generate(
**inputs,
max_length=128,
num_beams=5,
repetition_penalty=2.5,
**kwargs
)
return tokenizer.decode(outputs[0], skip_special_tokens=True)
# Пример:
transform_text("Пахота зяби под мн тр")
# → "Пахота зяби под Многолетние травы"
license: apache-2.0 language: - ru base_model: - cointegrated/rut5-base-multitask library_name: transformers tags: - biology
- Downloads last month
- 5
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support