Hacker News new | ask | show | jobs
by bellowsgulch 18 days ago
Self-attention is an O(n^2) operation. You don't want to train on individual characters, or bytes.