Y
Hacker News
new
|
ask
|
show
|
jobs
by
bellowsgulch
18 days ago
Self-attention is an O(n^2) operation. You don't want to train on individual characters, or bytes.