KKumeotrongNghiên cứu Đọc paper Attention Is All You Need, chín năm sau Đọc lại paper Transformer 2017: tính attention bằng numpy, đo vì sao phải chia √d_k, và phần nào LLM hôm nay đã thay bằng pre-LN, RoPE, GQA, FlashAttention. 1 thg 10, 2026·17 phút đọc Nghiên cứu R&D