KKumeotrongNghiên cứu Đọc paper Attention Is All You Need, chín năm sau Đọc lại paper Transformer 2017: tính attention bằng numpy, đo vì sao phải chia √d_k, và phần nào LLM hôm nay đã thay bằng pre-LN, RoPE, GQA, FlashAttention. 1 thg 10, 2026·17 phút đọc Nghiên cứu R&D
KKumeotrongAI Đánh giá một hệ RAG: đo trước khi tin câu trả lời Dựng golden set từ câu hỏi thật, đo retrieval bằng hit@k, recall@k, MRR, kiểm câu trả lời bằng luật và LLM chấm, rồi chặn thay đổi trong CI. 1 thg 10, 2026·18 phút đọc Trợ lý AI cho BanHang 02
KKumeotrongCông nghệ mới Model Context Protocol: cho trợ lý AI đọc dữ liệu nội bộ mà không mở toang hệ thống Dựng một MCP server chỉ đọc bằng Python cho trợ lý chăm sóc khách hàng, chạy thử qua stdio, rồi xử lý quyền, xác thực, prompt injection và audit. 1 thg 10, 2026·17 phút đọc Công nghệ mới NEW