Transformers documentation

ConvBERT

Transformers

You are viewing v4.40.2 version. A newer version v4.49.0 is available.

Join the Hugging Face community

and get access to the augmented documentation experience

Collaborate on models, datasets and Spaces

Faster examples with accelerated inference

Switch between documentation themes

to get started

ConvBERT

Overview

ConvBERT モデルは、ConvBERT: Improving BERT with Span-based Dynamic Convolution で Zihang Jiang、Weihao Yu、Daquan Zhou、Yunpeng Chen、Jiashi Feng、Shuicheng Yan によって提案されました。やん。

論文の要約は次のとおりです。

BERT やそのバリアントなどの事前トレーニング済み言語モデルは、最近、さまざまな環境で目覚ましいパフォーマンスを達成しています。自然言語理解タスク。ただし、BERT はグローバルな自己注意ブロックに大きく依存しているため、問題が発生します。メモリ使用量と計算コストが大きくなります。すべての注意が入力シーケンス全体に対してクエリを実行しますが、グローバルな観点からアテンションマップを生成すると、一部のヘッドはローカルな依存関係のみを学習する必要があることがわかります。これは、計算の冗長性が存在することを意味します。したがって、我々は、新しいスパンベースの動的畳み込みを提案します。これらのセルフアテンションヘッドを置き換えて、ローカルの依存関係を直接モデル化します。新しいコンボリューションヘッドと、自己注意の頭を休め、グローバルとローカルの両方の状況でより効率的な新しい混合注意ブロックを形成します学ぶ。この混合注意設計を BERT に装備し、ConvBERT モデルを構築します。実験でわかったことは、 ConvBERT は、トレーニングコストが低く、さまざまな下流タスクにおいて BERT およびその亜種よりも大幅に優れたパフォーマンスを発揮します。モデルパラメータが少なくなります。注目すべきことに、ConvBERTbase モデルは 86.4 GLUE スコアを達成し、ELECTRAbase よりも 0.7 高いのに対し、トレーニングコストは 1/4 未満です。コードと事前トレーニングされたモデルがリリースされます。

このモデルは、abhishek によって提供されました。オリジナルの実装が見つかりますここ: https://github.com/yitu-opensource/ConvBert

Usage tips

ConvBERT トレーニングのヒントは BERT のヒントと似ています。使用上のヒントについては、BERT ドキュメントを参照してください。

Transformers

ConvBERT

Overview

Usage tips

Resources

ConvBertConfig

class transformers.ConvBertConfig

ConvBertTokenizer

class transformers.ConvBertTokenizer

build_inputs_with_special_tokens

get_special_tokens_mask

create_token_type_ids_from_sequences

save_vocabulary

ConvBertTokenizerFast

class transformers.ConvBertTokenizerFast

build_inputs_with_special_tokens

create_token_type_ids_from_sequences

ConvBertModel

class transformers.ConvBertModel

forward

ConvBertForMaskedLM

class transformers.ConvBertForMaskedLM

forward

ConvBertForSequenceClassification

class transformers.ConvBertForSequenceClassification

forward

ConvBertForMultipleChoice

class transformers.ConvBertForMultipleChoice

forward

ConvBertForTokenClassification

class transformers.ConvBertForTokenClassification

forward

ConvBertForQuestionAnswering

class transformers.ConvBertForQuestionAnswering

forward

TFConvBertModel

class transformers.TFConvBertModel

call

TFConvBertForMaskedLM

class transformers.TFConvBertForMaskedLM

call

TFConvBertForSequenceClassification

class transformers.TFConvBertForSequenceClassification

call

TFConvBertForMultipleChoice

class transformers.TFConvBertForMultipleChoice

call

TFConvBertForTokenClassification

class transformers.TFConvBertForTokenClassification

call

TFConvBertForQuestionAnswering

class transformers.TFConvBertForQuestionAnswering

call