Skip to main content
2018.05.01
NAIST  ⾃自然⾔言語処理理学研究室
D2  Masayoshi  Kondo  
論論⽂文紹介-‐‑‒  About  Neural  Summarization@2018  
Attention  Is  All  You  Need
NIPSʼ’17
Ashish  Vaswani	
Google  Brain	
Niki  Parmar	
Google  Research
Jakob  Uszkoreit	
Google  Research
Llion  Jones	
Google  Research
Aidan  N.  Gomez	
University  of  Toronto
Łukasz  Kaiser	
Google  Brain
Illia  Polosukhin	
Noam  Shazeer	
Google  Brain
-‐‑‒-‐‑‒:  論論⽂文の概要
•  ニューラル機械翻訳タスクに関する研究.(新規ニューラルモデルの提案がメイン.)
•  【課題】これまでのRNNベースのSeq2Seqモデルは、系列列の並列列処理理性が構造上できない
ため、訓練時間が⼤大きくなること・系列列が⻑⾧長くなるとメモリの制約上バッチサイズが制限さ
れるといった問題.
•  【解決】提案⼿手法”Transformer”は、Attention機構(self-‐‑‒attention)のみで構成される
ニューラルモデルで、系列列に対する並列列処理理性と系列列内の任意2要素に関する計算コストを
⼀一定に抑えることができ、上記の問題を解決できる.
•  実験結果:シングルモデルでは最⾼高精度度  BLUE  41.8  (EN-‐‑‒FR)  /  訓練時間:従来の1/4以下.
【まとめ】
【abstract】
良良く⽤用いられる系列列変換モデルは、エンコーダとデコーダに複雑な再帰構造もしくは畳み込みネットワーク
を備えたものに基づいている.最も⾼高い性能のモデルはまた、エンコーダとデコーダとをアテンション機構
によって接続されている.我々は、Transformer  という新しい単純なネットワーク構造を提案する.
Transformerは独⽴立立したアテンション構造に基づいており、再帰構造や畳み込み構造は全く備えていない.
2つの機械翻訳タスクでの実験では、これらのモデルが並列列化することによって訓練の時間を著しく削減で
きるといった点で優れていることを⽰示す.我々のモデルは、WMT2014  Eng-‐‑‒GemでBLEU  28.4  ポイント
を⽰示し、アンサンブル学習に基づく既存の最⾼高スコアを2ポイント以上、上回っている.WMT2014  Eng-‐‑‒
Frcでは、我々のモデルは、8GPUsの3.5⽇日間の訓練で新しい単⼀一モデルの最⾼高精度度である  BLUE  41.8  ポ
イントを達成した.この訓練時間は、これまでの最⾼高精度度モデルの訓練時間からみれば僅かなものと⾔言える.
我々は、⼤大規模な訓練データと限定的な訓練データの両⽅方を⽤用いた英語の構造解析へもうまく適応すること
で、Transformer  を他のタスクへと⼀一般化できることを⽰示す.
1.   Introduction
2.   Background
3.   Model  Architecture
4.   Why  Self-‐‑‒Attention
5.   Training
6.   Results
7.   Conclusion
1.   Introduction
2.   Background
3.   Model  Architecture
4.   Why  Self-‐‑‒Attention
5.   Training
6.   Results
7.   Conclusion
01  :  Introduction
【RNNモデルの課題】
RNNやRNN-‐‑‒LSTM,  RNN-‐‑‒GRUは、⾔言語モデルや機械翻訳のような
系列列データモデリング・変換で⾮非常に強⼒力力.
(⼊入⼒力力・出⼒力力)系列列の位置  t  の処理理に、以前の  t-‐‑‒1  の状態値を⽤用いる.
•  訓練サンプルに対する系列列の各値の並列列処理理ができない.
•  ⻑⾧長期系列列では、メモリ制約によりバッチサイズが制限される.
<  近年年の研究  >:  計算性能の効率率率化が進む
・  因⼦子分解を⽤用いた効率率率化
    Factorization  tricks  for  LSTM  networks.
・  条件付き計算を⽤用いた効率率率化
    Outrageously  large  neural  networks:  The  sparsely-‐‑‒
    gated  mixture-‐‑‒of-‐‑‒experts  layer.  
02  :  Introduction
【Attention機構】
•  様々なタスクで系列列モデリング・変換を強⼒力力にする必要不不可⽋欠な要素.
•  ⼊入⼒力力系列列と出⼒力力系列列との距離離に関係なく依存関係性をモデル化できる.
-‐‑‒  Neural  machine  translation  by  jointly  learning  to  align  and  translate.
-‐‑‒  Structured  attention  networks.  
しかしながら・・・・
  わずかな例例を除いて、Attention機構はRNNと合わせて⽤用いられる.
【本研究では】Transformer  の提案
•  ⼊入出⼒力力の⼤大域的な依存関係を得るために、再帰構造ではなく
Attention構造のみを頼るモデル構造を備える.
•  ⼤大幅な並列列処理理が可能.
•  P100  GPU  8枚の12時間程の学習で、機械翻訳タスクで最⾼高精度度.
Transformer  は、
1.   Introduction
2.   Background
3.   Model  Architecture
4.   Why  Self-‐‑‒Attention
5.   Training
6.   Results
7.   Conclusion
03  :  Background
系列列処理理を伴う計算を減らすこと  を⽬目的に提案されたモデル
•  Extend  Neural  GPU  :
•  ByteNet                                    :
•  ConvS2S                                  :
Can  active  memory  replace  attention?
Neural  machine  translation  in  linear  time.
Convolutional  sequence  to  sequence  learning.
⼊入出⼒力力系列列の⻑⾧長さ  に対する任意の2要素間の計算コスト
•  ConvS2S  :  線形(linearly)に増加
•  ByteNet    :  対数的(logarithmically)に増加
要素間の位置が遠い場合に、その依存関係の学習が難しくなる.
【  問題点  】
【  提案法  】Transformer
•  Self-‐‑‒attention  (intra-‐‑‒attention)  の導⼊入  .
•  任意の距離離にある2要素の計算コストを定数(⼀一定)に抑える.
04  :  Background
Self-‐‑‒attention  mechanism  とは?
ある⼀一つの系列列における要素の表現(representation)を計算するための
任意の異異なる要素間(2要素間)の関係性を与えるattention機構のこと.
T
tt-­‐‑k
単⼀一系列列内での各要素間の
相互作⽤用量量を計算したい気持ち
様々なタスクで適⽤用:※本論論⽂文の引⽤用⽂文献  参照  (スライドでは割愛)
・⽂文書読解(reading  comprehension)
・⽣生成要約(abstractive  summarization)
・含意関係認識識(textual  entailment)
・タスクに依存しない⽂文表現の獲得
  (learning  task-‐‑‒independent  sentence  representations)  
RNNやCNNを⽤用いず、self-‐‑‒attentionのみで⼊入出⼒力力の表現獲得の計算を⾏行行う
(系列列間の)変換モデルは本研究が初めての試み.
1.   Introduction
2.   Background
3.   Model  Architecture
4.   Why  Self-‐‑‒Attention
5.   Training
6.   Results
7.   Conclusion
05  :  Model  Architecture
Encoder部 Decoder部
Encoder  部
Decoder  部
Enc-‐‑‒Decの接続
TransformerもEnc-‐‑‒Dec構造を備える.
⼊入⼒力力  repr系列列  :              x=(x1,...,xn)
↓  
Encoded  repr系列列  :  z=(z1,...,zn)
Encoded  repr系列列  :  z=(z1,...,zn)
↓
出⼒力力  repr系列列  :              y=(y1,...,yn)
•  Multi-‐‑‒Head  Self-‐‑‒Attentionユニット
    と  FeedForwardユニット  で層を構成.
•  層数:N=6で設定.隠れ層  :  512  dim.
•  Residual接続とLayer  Normalizeも利利⽤用.
•  層数:N=6で設定.
•  Multi×2とFFNN×1で層を構成.
Residual接続とLayer  Normalizeも利利⽤用.
•  ⽂文⽣生成時には、前の出⼒力力を新しい⼊入⼒力力に
利利⽤用し、逐次的に⽣生成.
Enc/Decの各層は
それぞれ全結合
06  :  Model  Architecture
マルチヘッド・アテンションのユニット
07  :  Model  Architecture
3.2  Attention  /  3.2.1  Scaled  Dot-‐‑‒Product  Attention
【⼊入⼒力力】Q,  K,  V
Q  :  
(K,V)    
Attention関数:
•  Query(Q)  と  Key-‐‑‒Value(K,  V)ペア  から、出⼒力力にマッピングする関数と
して表現.Query(Q)、Key(K)、Value(V)、及び出⼒力力は全てベクトル値.
•  出⼒力力:Value(V)  の加重和として計算.
•  各Value(V)  に割り当てられた重みは、対応する  Key(K)  とQuery(Q)  の  
compatibility  function(適合関数)  によって計算.
【出⼒力力】
…
K1 K2 K3 Kn
V1 V2 V3 Vn
(                  ,                  )
(                  ,                  )
(                  ,                  )
(                  ,                  )
K1 K2 K3 Kn…
f(  ,                ;θ)
compatibility  function
…w1 w2 w3 wn
QとそれぞれのKに対する関連値の
系列列が得られる(注)
k=1
n
∑ Vkwk・
(注)  softmax関数等の値の正則化を⾏行行う場合が多い.
Output  :  
1
dk
:scaling  factor  
dk:K,Vのベクトル次元  
-‐‑‒-‐‑‒  :  Scaled  Dot-‐‑‒Product  Attention  (補⾜足説明)
Q
KT
QKT
実際は、⾏行行列列計算として実⾏行行.
OUTPUT
V
QKT
Attentionの関数
softmax
OUTPUT
QとKの
関係を計算
QKTとVから
出⼒力力を計算
•  Q,  V,  Kは、それぞれベクトルの系列列(or集合)をまとめた⾏行行列列.
•  得られる出⼒力力は、各Qに対するattentionベクトルの集合(⾏行行列列).
Attention関数
の出⼒力力
【モデルの設定】
dmodel次元のKey、Value、及びQueryを⽤用いて、ひとつのAttention関数
を実⾏行行.
dk、dv及びdq次元それぞれに対して異異なる線形変換学習を⾏行行い、Key、
Value及びQueryをh回の線形変換.
08  :  Model  Architecture
3.2.2  Multi-‐‑‒Head  Attention
効果が⾼高い
Q,  K,  Vそれぞれに対する重み⾏行行列列の⼤大きさ
•  ヘッド数:h=8
•  KとVの⼤大きさ:dk=dv=dmodel/h=64
09  :  Model  Architecture
3.2.2  Applications  of  Attention  in  our  Model
Transformer  は、multi-‐‑‒head  attention  を  3つの⽅方法  で利利⽤用.
エンコーダとデコーダのattention部は、KeyとValueは、エンコーダ出⼒力力,  
Queryはデコーダの前層から得る.⼀一般的なEnc-‐‑‒Decモデルのattention機
構のように、デコーダの各トークンは、エンコーダの全てのトークンを参照.
エンコーダには、self-‐‑‒attentionが含まれる.Self-‐‑‒attention層では、Key,  
Value,Query全てが同じ場所を指す.この場合では、encoderの前層から
得る出⼒力力.
                Key(K)  =  Value  (V)  =  Query  (Q)  =  Outputs  of  Encoder
•  デコーダのself-‐‑‒attentionも、デコーダ内の各位置がその位置までの
    デコーダの全ての位置に関与.
•  ⾃自⼰己回帰としての性質を保持するために、デコーダの左⽅方向情報フロー
を防⽌止する必要がある.このために、scaled  dot-‐‑‒product  attentionの
内部に、不不正な接続に対応するsoftmaxの⼊入⼒力力内の全ての値をマスキン
グ(値を-‐‑‒∞設定)する機構を実装.
10  :  Model  Architecture
3.3  Position-‐‑‒wise  Feed-‐‑‒Forward  Networks  
512
2048
ReLU
512
W1
W2
•  2つの線形変換(W1,  W2)
•  間に活性化関数:ReLU関数
3.4  Embeddings  and  Softmax
•  (デコーダーの)embedding層と
softmax層は、重みを共有.
•  Embedding層は、重みに対して、
                    をかける.dmodel
【  positional  encodings  】
Transformerは、再帰型モデル・畳み込みモデルに該当しない:
  →  Transformerが系列列順序を利利⽤用できるようにするためには、
      系列列内のトークンの相対位置または絶対位置に関する情報
      を導⼊入する必要がある.
11  :  Model  Architecture
3.5  Positional  Encoding
エンコーダ・デコーダのembedding部に位置を表現するembeddingsを追加.
•  positional  embeddingsは、embeddingsと同じ次元:dmodelで、2つを加算.
•  positional  embeddingsは多くの種類があり、事前に学習後、固定.
•  この研究では、異異なる周波数の  正弦関数(sin)  と  余弦関数(cos)  を使⽤用.
pos  :  トークン位置
i            :  次元
12  :  Model  Architecture
3.5  Positional  Encoding
【なぜ、positional  embeddingsにこの数式を⽤用いるのか?】
•  固定のズレ:k  に対して、PEpos+k  の値が  PEpos  の線形関数となるため.
•  訓練データに現れる系列列の⻑⾧長さよりも⻑⾧長い系列列のデータの予測を⾏行行う際
に、その予測をしやすくするため.
実験では、上記の代わりに  positional  embeddings*  を
⽤用いて異異なる、2つのバージョンで検証したがほぼ同⼀一の
結果が得られた.→  表3(E)-‐‑‒後半のスライドで記載
【その効果は?】
*)  Convolutional  sequence  to  sequence  learning.
1.   Introduction
2.   Background
3.   Model  Architecture
4.   Why  Self-‐‑‒Attention
5.   Training
6.   Results
7.   Conclusion
k
•  Self-‐‑‒attention層  と  Recurrent層  or  Convolution層  の⽐比較を⾏行行う.
•  可変⻑⾧長系列列(x1,  x2,  …,  xn)  から  同じ⻑⾧長さの系列列(z1,  z2,…,  zn)  へ
の変換を考える  (x,z  ∈  Rd).
•  Self-‐‑‒attentionを⽤用いることの強みは、3つの必要性を考えれば分かる.
13  :  Why  Self-‐‑‒Attention
この章では:
1.  ⼀一層あたりの総合計算量量
            (  total  computational  complexity  per  layer  )  
2.  要求される最⼩小の系列列演算数から測られる並列列可能な計算量量
            (  the  amount  of  computation  that  can  be  parallelized,  as  measured  by
                    the  minimum  number  of  sequential  operations  required.  )  
3.  ネットワーク内部の⻑⾧長距離離依存関係間のパスの⻑⾧長さ
            (  the  path  length  between  long-‐‑‒range  dependencies  
                  in  the  network  )  
14  :  Why  Self-‐‑‒Attention
多くの系列列変換タスクで、⻑⾧長距離離の依存性を学習することは重要な課題.
3.  ネットワーク内部の⻑⾧長距離離依存関係間のパスの⻑⾧長さ
            (  the  path  length  between  long-‐‑‒range  dependencies  
                  in  the  network  )  
依存関係性を学習する能⼒力力に影響を与える重要な因⼦子:
ネットワーク内の前⽅方向・後⽅方向に信号が伝搬しなければならない距離離の⻑⾧長さ
⼊入出⼒力力系列列における任意の位置の組み合わせ間のパス(経路路)が短くなれば
なるほど、⻑⾧長距離離依存性の学習が容易易になる.
    -‐‑‒  Gradient  flow  in  recurrent  nets:  the  difficulty  of  learning  long-‐‑‒term  dependencies.
異異なる層で構成されるネットワーク内部の2つの⼊入出⼒力力の位置の間の
最⼤大経路路⻑⾧長を⽐比較.
【考察・検証】
15  :  Why  Self-‐‑‒Attention
異異なる層で構成されるネットワーク内部の2つの⼊入出⼒力力の位置の間の
最⼤大経路路⻑⾧長を⽐比較.
【考察・検証】
表(Table)1:それぞれの層における、最⼤大経路路⻑⾧長、1層あたりの計算量量、
最⼩小系列列演算数.n:系列列⻑⾧長、d:reprの次元、k:畳み込みのカーネル
サイズ、r:制限付きself-‐‑‒attentionの隣隣接サイズ.
16  :  Why  Self-‐‑‒Attention
【  Self-‐‑‒Attention  層  だと・・・】
【  Convolutional  層  だと・・・】
•  系列列演算操作量量  ー  Self-‐‑‒attention層:O(1)  /  Recurrent層:O(n)
•  計算複雑性において、系列列⻑⾧長:n  <  repr次元:d  であれば、self-‐‑‒
attention層は、Recurrent層よりも⾼高速.
•  ⾮非常に⻑⾧長い系列列を含むタスクで計算性能を向上させるには、self-‐‑‒
attentionは、それぞれの出⼒力力の位置の中⼼心とした⼊入⼒力力系列列の近傍に対し
て、サイズrのみを考慮するように制限できる.
•  制限する場合は最⼤大経路路⻑⾧長がO(n/r)に増加.今後の研究でさらに調査.
•  1層のConvolutional層は、カーネルサイズ:k<  系列列⻑⾧長:n  の時、⼊入出⼒力力
位置全てのペアを接続しない.⼊入出⼒力力位置の全ペアを接続するには、
O(n/k)のConvolutional層、または、O(logkn)であるdilated  
convolutional層  を重ねる.
•  Separable  convolution(並列列畳み込み?)では、計算量量をO(knd  +  nd2)
まで削減できる.k=nであれば、separable  convolutionの計算量量は、
self-‐‑‒attentionと点ごとのフィードフォワード層との組み合わせに等しい.
17  :  Why  Self-‐‑‒Attention
【  Self-‐‑‒Attention  層  だと・・・】の続き
•  副次的なメリットとして、self-‐‑‒attentionはより解釈可能なモデルを⽣生み
出す可能性がある.
•  参考資料料にサンプルを例例⽰示し議論論.我々は、モデルのアテンション分布を
考察する.
•  個々のattention-‐‑‒headが、異異なる働きを明確に学ぶだけでなく、多くは⽂文
の構⽂文的・意味的構造に関連する振る舞いを⽰示すように⾒見見える.
次ページに2つのサンプルを掲載.
図4:提案モデルの5層⽬目(全6層)のアテンションの指す内容の図.
5番⽬目のattention-‐‑‒head.5と6番⽬目のitsの指すattention-‐‑‒head
図5:⽂文章の構造に関連しているような振る舞いを⽰示す多くのattention-‐‑‒
                heads.
5層⽬目の2つのattention-‐‑‒headsのサンプル
1.   Introduction
2.   Background
3.   Model  Architecture
4.   Why  Self-‐‑‒Attention
5.   Training
6.   Results
7.   Conclusion
18  :  Training
【  Training  Data  と  Batching  】
<  Standard  WMT  2014  English-‐‑‒German  dataset  >
<  Standard  WMT  2014  English-‐‑‒French  dataset  >
•  450万ペアデータ.⽂文章は、byte-‐‑‒pair  encodeされている.
•  srcとtrgで語彙共有で、37000  vocab.
•  360万ペアデータ.
•  32000  word-‐‑‒piece  vocab.
•  ⽂文章ペアは、近い⻑⾧長さ同⼠士でまとめてバッチ化.
•  各訓練データのバッチは、約25000のsrc-‐‑‒tokenと約25000のtrg-‐‑‒
tokenを含んだ⽂文章ペアで構成される.
【  Hardware  と  Schedule  】
•  NVIDIA  P100  GPUs:8枚
•  ハイパーパラメータの設定は、本論論⽂文記載の通り.
•  各training  stepは、0.4  sec  で実⾏行行.
•  10万step、⼤大体12時間程度度で訓練.
•  big-‐‑‒モデルの場合は、1.0secで30万step.
19  :  Training
【  Optimizer  】
【  Regularization  】訓練時に3つのタイプの正則化⽅方法を導⼊入.
•  最適化⽅方法は、Adam  を⽤用いる.
•  Adamのパラメータ:β1=  0.9  /  β2=  0.98  /  ε=  10-‐‑‒9  .
•  学習率率率は、下記のように設定.
•  最初は、warmup_̲stepの訓練で学習率率率は単調増加.その後、ステップ数の
逆平⽅方根に⽐比例例して減少.
•  warmup_̲step=4000として設定.
1.    Residual  Dropout  :  各sub-‐‑‒layerの出⼒力力に対して、そのsub-‐‑‒layer
の⼊入⼒力力との加算とnormalizeを⾏行行う前に、dropoutを⾏行行う.
2.  単語embeddingとpositional  embeddingの和にも、dropoutを適⽤用.
dropout率率率は、Pdrop=  0.1  に設定.
3.    Label  Smoothing  :  εls  =  0.1  に設定.
1.   Introduction
2.   Background
3.   Model  Architecture
4.   Why  Self-‐‑‒Attention
5.   Training
6.   Results
7.   Conclusion
20  :  Results
Transformer<bigタイプ>:  EN-‐‑‒DE  >  BLUE  28.4  ポイント
  ー  過去に報告された記録(アンサンブル学習のモデルを含む)を上回り、
      最⾼高精度度(state-‐‑‒of-‐‑‒the-‐‑‒art)を記録.
  ー  訓練時間:GPU-‐‑‒P100  8個  で  3.5⽇日間
      他モデルの訓練期間と⽐比べると、⾮非常に短い.
6.1  Machine  Translation
21  :  Results
Transformer<bigタイプ>:  EN-‐‑‒FR  >  BLUE  41.8  ポイント
  ー  過去に報告されたシングルモデルを上回った.
  ー  以前の最⾼高精度度モデルの訓練時間と⽐比べて:1/4  未満.
  ー  EN=FRは、Dropout率率率:Pdrop=  0.3  に変更更  (他は、0.1設定)
6.1  Machine  Translation
22  :  Results
6.1  Machine  Translation
【その他の設定】
  Transformer  <base  model>:
    ー  最後の5つのチェックポイントを平均して得られた単⼀一のモデル
        を使⽤用.
    ー  チェックポイントは、10分間隔で作成.
  Transformer  <big>:
    ー  最後の20のチェックポイントの平均を使⽤用.
•  ビームサーチ幅:4
•  ⻑⾧長さペナルティ:α=0.6
•  ハイパーパラメータの設定は、開発セットの実験後に選択.
•  推論論時の最⼤大出⼒力力⻑⾧長:⼊入⼒力力⻑⾧長+50  に設定、可能な限り早く終了了.
訓練に使⽤用される
浮動⼩小数点演算
の数の推定値
各GPUの継続的な
単精度度浮動⼩小数点容量量
の推定値
訓練時間 使⽤用されたGPU数
23  :  Results
6.1  Machine  Translation
翻訳品質と訓練コストを⽂文献の他モデルアーキテクチャと⽐比較:
※  We  used  values  of  2.8,  3.7,  6.0  and  9.5  TFLOPS  for  K80,  K40,  M40  and  P100,  respectively.
※
24  :  Results
6.2  Model  Variations
25  :  Results
6.2  Model  Variations
・Transformerの様々なコンポーネントの重要性を評価.
    ー  基本モデルを様々⽅方法で変更更.
    ー  newstest2013で英語からドイツ語への翻訳の開発セットの
        パフォーマンス変化を測定.
・ビームサーチは使⽤用.
・チェックポイントの平均化は⾏行行わない.
・表3­−(A):計算量量を⼀一定に保ちながら、attention-‐‑‒head  の数と    
            attention-‐‑‒key  と  attribute  の次元を変更更したものを表記.
・シングルヘッドのアテンションは、最⾼高値よりもBLUE  0.9  ポイント悪い.
・⼀一⽅方で、あまり多くのヘッド数でも品質が低下.
【  表3について  】
26  :  Results
6.3  English  Constituency  Parsing
Transformerが他のタスクに⼀一般化できるかどうかを評価したい.
  ー  英語のconstituency解析(English  Constituency  Parsing)
      の実験.
•  明確な課題:出⼒力力には強い構造的制約があり、⼊入⼒力力よりもかなり⻑⾧長く
なる.
•  RNN-‐‑‒Seq2Seqモデルは、⼩小データでは最⾼高精度度を達成することが
  できなかった.
【  データセット  】:  Wall  Street  Journal  (WSJ)  portion  of  the  Penn  Treebank  
【  Transformerの設定  】
・  トークン数  ー  教師あり:  16k  /  半教師あり:  32k
・  データ数    ー  教師あり:  40k  /  半教師あり:  17M
                    半教師有り:BerkleyParserコーパス  併⽤用
•  モデル:Transformer-‐‑‒4層(  1024-‐‑‒dim  )
•  最⼤大出⼒力力⻑⾧長:⼊入⼒力力⻑⾧長  +  300
•  ビームサーチ幅:21  /  α=0.3
27  :  Results
6.3  English  Constituency  Parsing
•  タスク固有のチューニングが不不⼗十分にも関わらず、モデルは驚くほどうまく実⾏行行.
•  Recurrent  Neural  Network  Grammar  を除いて、Transformerは、以前に報告
されたすべてのモデルよりも優れた結果を得た.
•  RNN-‐‑‒Seq2Seqモデルとは対照的に、TransformerはWSJ訓練セットの40K⽂文
    だけを訓練する場合でも、Berkeley-‐‑‒Parser  を上回る.
1.   Introduction
2.   Background
3.   Model  Architecture
4.   Why  Self-‐‑‒Attention
5.   Training
6.   Results
7.   Conclusion
28  :  Conclusion
•  本研究では、Transformer  を紹介.
•  Transformer  は、Enc-‐‑‒Decモデルで⼀一般的に⽤用いられる再帰層
(recurrent  layer)の代わりにmulti-‐‑‒headed  self-‐‑‒attentionを⽤用いた
attentionのみから構成される初めての系列列変換モデルである.
•  機械翻訳タスクでは、RNNやCNNに⽐比べて極めて⾼高速に学習できる.
また、WMTʼ’14  Eng-‐‑‒to-‐‑‒Gen/Eng-‐‑‒to-‐‑‒Frc  で最⾼高精度度を達成し、
WMTʼ’14  Eng-‐‑‒to-‐‑‒Genにおいては、過去報告されたアンサンブル学習
モデルの結果よりも良良い精度度となった.
•  今後は、他のタスクへの応⽤用を⾏行行っていく.⽂文章以外の⼊入出⼒力力形式を
もつ問題へのTransformerの適⽤用を考えている.
•  画像・⾳音声・動画  等の⼤大規模な⼊入出⼒力力を効率率率的に扱うための制限付き
局所アテンション機構を調査する予定.※  ICLRʼ’18の複数⽂文書の⽣生成要約論論⽂文に発展.
•  逐次性の無い⽣生成⽅方式を確⽴立立することは、我々のもう⼀一つの研究⽬目的
である.
•  モデルの訓練と評価に⽤用いたコードは、下記で利利⽤用可能.
      >>  https://github.com/tensorflow/tensor2tensor
END