t5 small dst multiwoz21 This model is a fine tuned version of t5 small on MultiWOZ 2.1. Refer to ConvLab 3 for model description and usage. Training procedure Training hyperparameters The following hyperparameters were used during training: learning rate: 0.001 train batch size: 64 eval batch size: 64 seed: 42 gradient accumulation steps: 2 total train batch size: 128 optimizer: Adafactor lr scheduler type: linear num epochs: 10.0 Framework versions Transformers 4.20.1 Pytorch 1.11.0+cu113 Datasets 2.3.2 Tokenizers 0.12.1
We use cookies for essential functionality and analytics. You can accept or reject analytics cookies.Cookie policy