1

Condensing Multilingual Knowledge with Lightweight Language-Specific Modules

Towards Being Parameter-Efficient: A Stratified Sparsely Activated Transformer with Dynamic Capacity

Language-Aware Multilingual Machine Translation with Self-Supervised Learning

Error Norm Truncation: Robust Training in the Presence of Data Noise for Text Generation Models

Efficiently Harnessing Parameter Importance for Better Training

The Importance of Being Parameters: An Intra-Distillation Method for Serious Gains

Por Qué Não Utiliser Alla Språk? Mixed Training with Gradient Optimization in Few-Shot Cross-Lingual Transfer

BERT, mBERT, BiBERT? A Study on Contextualized Embeddings for Neural Machine Translation

VAE based Text Style Transfer with Pivot Words Enhancement Learning

Gradual Fine-Tuning for Low-Resource Domain Adaptation