BERT

AI and Machine Learning · Language Models · 2018 · bert.yaml

An encoder-only transformer pretrained by masking tokens and predicting them from both sides. Showed that one pretrained model plus a small head beats task-specific architectures.

Colour is the family; a dashed line is the second member of it.

Drag to pan · scroll to zoom · click a node to open it
G autoregressive-language-model Autoregressive Language Model bert BERT autoregressive-language-model->bert generates continuations rather than encoding a whole span transformer Transformer bert->transformer encoder only, trained by masking rather than predicting

This node

Referenced by

References