Bài trước mình có chia sẻ về bộ não thứ 2, cách mình kết hợp Bujo với Obsidian với Wiki để quản lý cuộc sống, và cuối bài mình có nhắc đến Javis.
Bài này mình đi tiếp một bước nữa, là cách biến cái bộ não thứ 2 đó thành một AI OS, tức là một cái hệ điều hành riêng chạy cả ngày cho mình, chứ không phải kiểu mở tab lên hỏi một câu rồi đóng tab lại.
Mình sẽ nói cực kỳ chi tiết để ae hiểu nguyên lý, chứ không phải để ae copy y nguyên.
Lưu ý: đây vẫn là cách làm cá nhân của mình thôi, mình vừa làm vừa sửa chứ không phải chuẩn mực gì cả, và tới giờ nó vẫn chưa xong. Ae đọc thấy đúng thì dùng, thấy sai thì góp ý cho mình nhé.
OK zô bài.
ĐẦU TIÊN THÌ: MÌNH RÚT BỘ NÃO CỦA TRỢ LÝ RA, CẮM CÁI KHÁC VÀO, NÓ VẪN NHỚ NGUYÊN
Hôm trước mình có làm một thử nghiệm nhỏ.
Javis của mình lúc đó đang chạy bằng Claude Code. Mình vào trang Models, đổi sang một model khác hẳn của hãng khác hẳn, kiểu như tháo con chip trong máy tính ra rồi lắp con của hãng đối thủ vào.
Rồi mình hỏi nó một câu về việc kinh doanh của mình.
Nó trả lời như chưa có chuyện gì xảy ra. Vẫn biết mình bán gì, tuần trước mình chốt cái gì, con số nào đang xấu đi.
Lúc đó mình mới thực sự hiểu cái mình đã ngồi làm mấy tháng trời.
Mình không làm ra một con AI. Mình làm ra cái chỗ để cắm con AI vào.
Và đấy chính là khác biệt giữa việc dùng AI với việc có một AI OS.
AI OS LÀ CÁI QUÁI GÌ, NÓI CHO DỄ HIỂU
Ae thử nghĩ lại xem mình đang dùng AI kiểu gì.
Mở tab lên, hỏi, nó đáp, đóng tab. Hôm sau mở lại, nó không biết ae là ai, ae lại kể từ đầu, kể xong hỏi, nó đáp, đóng tab.
Toàn bộ trí nhớ về ae nằm trong cái tab đó. Đổi công cụ là mất trắng, hết hạn gói là mất trắng, hãng đóng cửa là mất trắng.
Nói cách khác ae đang đi thuê, mà thuê xong không được giữ lại cái gì.
Mình chỉ làm ngược lại thôi. Trí nhớ để bên ngoài, nằm trên ổ cứng của mình, thuộc về mình. Con AI chỉ là cái phần cắm vào để đọc và ghi vào trí nhớ đó.
Model rồi sẽ đổi, năm nay con này giỏi nhất, sang năm con khác. Cái không được đổi là cuốn sổ.
Hiện tại Javis của mình cắm được 8 bộ não khác nhau: Claude Code, ChatGPT qua Codex, OpenRouter, OpenAI API, Anthropic API, Gemini, Groq và Ollama. Đổi cái nào cũng được, năng lực gần như không đổi, vì đồ nghề và trí nhớ nằm ở tầng dưới chứ không nằm trong model.
MÌNH ĐÃ DỰNG NHẦM THỨ TRONG MẤY THÁNG ĐẦU
Bước ngoặt của mình đến từ một câu hỏi nghe hơi ngớ ngẩn.
Cái điện thoại của ae, thứ gì làm nó thành cái điện thoại?
Không phải con chip, chip chỉ là một cục silicon. Không phải màn hình, không phải pin, không phải cái mic.
Thứ làm nó thành cái điện thoại là hệ điều hành, cái lớp nối con chip với màn hình với mic với bộ nhớ, để mấy thứ vô tri đó nói chuyện được với nhau.
Mình nhận ra suốt mấy tháng mình chỉ đang loay hoay mài cho con chip sắc hơn, trong khi thứ mình thiếu là cái hệ điều hành.
Từ đó mình bỏ hẳn cách nghĩ dựng một con AI, chuyển sang dựng một AI OS gồm 4 mảnh ghép.
4 MẢNH GHÉP, KHÔNG HƠN
Toàn bộ hệ thống mình đang chạy, nói cho gọn nhất thì chỉ có 4 thứ.
Bộ não. Con AI thật sự suy nghĩ. Nhận yêu cầu, chọn đúng skill, làm.
Trí nhớ. Một thư mục trên máy, toàn file markdown. Mọi thứ nó biết, nó làm, nó kết luận đều rơi xuống đây.
Giọng nói. Tai và miệng. Ae nói ra nó nghe, nó trả lời nó đọc lên.
Cái mặt. Một màn hình duy nhất để nhìn: chỉ số, lịch, việc, khung chat.
4 thứ này thì ai cũng biết. Chỗ hầu hết mọi người bỏ qua là cái nối chúng lại với nhau.
Trong Javis, cái nối đó là một trung tâm kết nối MCP. Ae cắm phần mềm bán hàng vào đó, cắm tài khoản quảng cáo, cắm lịch, cắm Zalo, cắm Gmail. Cắm một lần thôi. Từ đó bộ não nào cắm vào cũng dùng chung được cả bộ đồ nghề.
Đó chính là lý do cái thử nghiệm đầu bài chạy được. Mình đổi bộ não, nhưng dây nhợ vẫn nguyên và cuốn sổ vẫn nguyên.
Giờ đi vào từng bước.
BƯỚC 1: ĐẤU BỘ NÃO, VÀ DẠY NÓ BẰNG NHỮNG FILE RẤT NHỎ
Nguyên lý ở bước này chỉ có một câu: một skill là một file, mỗi file dạy đúng một việc, và file đó chỉ được mở ra khi đúng lúc cần tới.
Ae cứ hình dung nó như cái trang Index trong Bujo mà bài trước mình có nói. Bộ não không nạp hết mọi thứ nó biết cùng lúc, nó đọc lướt cái mục lục, thấy cái nào khớp thì mới mở đúng trang đó ra.
Cấu trúc một file skill đơn giản đến mức hơi thất vọng, nó chỉ là một file markdown gồm 3 phần.
Tên skill
Mô tả khi nào thì dùng
Hướng dẫn làm từng bước
Phần số 2 ngắn nhất nhưng lại quan trọng nhất, vì nó chính là cái nhãn dán ngoài hộp. Viết nhãn mờ nhòe thì bộ não không bao giờ mở đúng hộp.
Chỗ này mình có một bài học hơi đau muốn kể cho ae.
Hồi đầu mình ngồi viết một cái prompt khổng lồ, nhồi vào đó cách viết bài, cách đọc báo cáo quảng cáo, cách trả lời khách, cách lên kế hoạch, tất tật, dài mấy nghìn chữ.
Kết quả là mình hỏi chuyện quảng cáo thì nó trả lời lẫn giọng viết content, mình nhờ viết bài thì nó chèn số liệu vào. Càng nhồi thêm càng lú.
Cái prompt đó giờ nằm trong thùng rác. Thay vào đó là 56 file skill nhỏ trong vault của mình, mỗi file dạy đúng một việc, một vài cái là mặc định của hệ thống còn lại mình tự viết dần.
Bài học thứ 2, cái này quan trọng hơn: skill tốt không nghĩ ra được từ trong đầu.
Mình từng ngồi viết sẵn một loạt skill cho những việc mình nghĩ là mình sẽ cần. Đa số nằm im tới giờ, chưa dùng lần nào.
Những skill hữu dụng nhất đều sinh ra theo đúng một kiểu. Mình làm một việc bằng tay, làm xong, tuần sau thấy vẫn phải làm lại y hệt, lúc đó mới viết nó thành skill.
Vậy nên ae đừng viết 20 skill. Viết 5 cái này trước thôi, đúng thứ tự.
Kéo số. Lấy vài con số quan trọng nhất của ae về một chỗ.
Tóm tắt hộp thư. Sáng ra gộp thư quan trọng thành một đoạn.
Quét cái đang nóng. Trong ngành của ae hôm nay có gì mới.
Lên kế hoạch. Viết ra 3 việc quan trọng nhất hôm nay.
Đọc và ghi vault. Tra lại trí nhớ, và ghi thêm vào trí nhớ.
5 cái này phủ gần hết một ngày làm việc bình thường. Làm xong 5 cái ae sẽ tự biết cái thứ 6 là gì.
BƯỚC 2: DỰNG TRÍ NHỚ, ĐÂY LÀ BƯỚC QUYẾT ĐỊNH TẤT CẢ
Nếu ae chỉ đủ sức làm 1 trong 4 bước thì làm bước này.
Nguyên lý: cái gì không nằm trong vault thì coi như chưa từng xảy ra.
Vault của mình chỉ là một thư mục thường trên ổ cứng, chia 3 ngăn.
Ngăn thô. Mọi thứ vừa thu về chưa xử lý. Báo cáo, ảnh chụp màn hình, ghi chú vội, đơn thuốc, biên bản.
Ngăn wiki. Tri thức đã chưng cất. Cái gì hiểu ra rồi thì đúc thành một trang, nối sang các trang liên quan.
Ngăn kết quả. Mọi thứ Javis làm ra. Bài viết, báo cáo, kế hoạch.
Toàn bộ là file markdown thường, đuôi .md. Không database, không tài khoản đám mây, mở bằng Notepad cũng đọc được.
Nghe thô sơ nhưng thô sơ chính là điểm mạnh. Vì nó là file thường nên ae đọc được mọi thứ trợ lý biết về ae, không có góc khuất nào. Thấy nó ghi sai thì mở ra sửa tay như sửa file Word.
Ở đây có một hiểu lầm mình muốn dọn luôn. Nhiều ae nghe tới bước này là lao đi cài Obsidian trước. Obsidian chỉ là cái cửa sổ đẹp để nhìn đống file đó thôi, không có nó thì thư mục vẫn chạy bình thường. Cái quan trọng là thư mục, không phải phần mềm mở thư mục.
Kể ae nghe một chuyện để thấy vì sao cấu trúc đơn giản lại quan trọng.
Nhà mình 2 vợ chồng dùng chung một hệ thống này nhưng mỗi người một vault riêng. Việc kinh doanh của mình không lẫn vào việc của vợ, mà cả 2 vẫn xài chung bộ não, chung đống skill. Tách ra dễ như tách 2 cái folder, chỉ vì trí nhớ là thư mục chứ không phải database.
Việc làm được ngay: tạo một thư mục, 3 thư mục con, xong. Rồi mỗi lần trợ lý làm ra cái gì thì bắt nó ghi xuống đó.
Đừng chờ có hệ thống hoàn hảo rồi mới bắt đầu ghi, vì trí nhớ chỉ có giá trị khi nó đủ dày, mà dày thì cần thời gian chứ không cần thiết kế.
BƯỚC 3: LẮP TAI VÀ MIỆNG CHO NÓ
Nguyên lý: gõ phím là một cái phễu hẹp, ae nghĩ nhanh hơn tay ae gõ rất nhiều.
Nghe như chuyện tiện lợi vặt nhưng nó đổi hẳn cách ae dùng hệ thống.
Khi phải mở laptop, mở tab, gõ một đoạn, ae sẽ chỉ hỏi những chuyện đủ quan trọng để bõ công. Khi chỉ cần giữ một phím rồi nói, ae sẽ hỏi cả những chuyện nhỏ. Mà chuyện nhỏ mới là thứ chiếm phần lớn một ngày.
Có một điểm mình muốn nhấn: nên chạy phần nghe ngay trên máy của ae, đừng đẩy tiếng nói lên mạng.
Không phải vì mình sợ ai nghe lén đâu. Mà vì lúc làm việc mình hay nói ra tên khách, con số, chuyện nội bộ, mấy thứ đó không có lý do gì phải rời khỏi cái máy này. Chạy tại máy còn được thêm 2 cái lợi nữa là không tốn phí theo phút và không phải chờ mạng.
Nói thẳng chỗ chưa ngon: nhận dạng tiếng Việt vẫn vấp. Câu thường thì ổn, nhưng tên riêng, tên thương hiệu, mấy từ chuyên ngành pha tiếng Anh thì nó nghe sai đều đặn. Chiều nào mình nói nhanh là y như rằng có một câu nó hiểu lệch. Cái này mình vẫn đang phải sửa tay và mình không nghĩ nó sạch hoàn toàn trong năm nay.
Và đây là chỗ mình muốn cảnh báo: đừng làm bước này đầu tiên.
Nó là bước sướng nhất nên ai cũng muốn làm trước. Nhưng lắp giọng nói vào một hệ thống chưa có trí nhớ thì ae chỉ vừa dựng ra một cái loa biết nói chuyện phiếm. Để nó sau bước 1 và bước 2.
BƯỚC 4: DỰNG CÁI MẶT CHO NÓ
Nguyên lý: một màn hình, không tab.
Cái tốn sức nhất trong một ngày làm việc thực ra không phải là làm việc, nó là chuyển qua chuyển lại. Mở trang quảng cáo, mở phần mềm bán hàng, mở lịch, mở hộp thư, mở ghi chú. Mỗi lần chuyển là một lần mất mạch, mà mất mạch thì tốn vài phút để nối lại.
Bước này gom hết về một chỗ.
Chỗ hay là ae không phải tự thiết kế gì cả, ae tả cho bộ não nghe rồi nó dựng. Câu mình dùng đại loại thế này.
Dựng cho tôi một màn hình nền tối gồm: tình trạng hệ thống, bảng lệnh nhanh, lịch hôm nay, khung chat có thu âm và đọc lại, và một khu hiện dữ liệu sống lấy thẳng từ vault. Một màn hình duy nhất, không tab.
Chạy, mở lên xem, thấy chỗ nào chưa ưng thì nói tiếp cho nó sửa.
Nói thật về thời gian: cái carousel mình làm có ghi bước này mất một buổi tối. Đúng cho bản đầu tiên chạy được thôi, không đúng cho bản ae thật sự dùng hàng ngày. Bản mình đang dùng sửa không đếm nổi bao nhiêu lần, tuần này vẫn còn sửa.
Nhưng chỗ đáng nói là mỗi lần sửa mình chỉ mô tả bằng lời, không đụng vào một dòng code nào.
MỘT NGÀY CỦA MÌNH NÓ CHẠY NHƯ NÀO
Kể ae nghe 4 mốc trong ngày để thấy cái mình mô tả không phải một món đồ chơi công nghệ.
7 giờ sáng. Tóm tắt buổi sáng. Thư quan trọng, lịch hôm nay, tin đáng chú ý trong ngành, gộp thành một đoạn ngắn rồi đọc lên trong lúc mình pha cà phê.
9 giờ. Chốt 3 việc quan trọng nhất. Và 3 việc đó không nằm trong đầu mình, nó nằm lại trong vault. Nghĩa là chiều mình hỏi lại sáng nay tôi chốt cái gì thì có câu trả lời chính xác, chứ không phải ngồi cố nhớ.
2 giờ chiều. Kéo chỉ số. Quảng cáo, đơn hàng, tương tác. Không phải để ngắm, mà để bắt sớm cái đang lệch.
7 giờ tối. Chốt ngày. Ghi lại hôm nay học được gì, hỏng chỗ nào. Việc chưa xong thì dời sang mai hoặc bỏ hẳn, mà bỏ hẳn cũng là một quyết định và nó phải được ghi lại.
Ae để ý thấy chưa, 4 mốc này thật ra chính là tư duy Bujo mình nói ở bài trước. Ghi vào đúng khung, rồi mỗi ngày dọn dẹp và ra quyết định.
Cái AI làm ở đây không phải là nghĩ thay mình. Nó chỉ làm cho việc ghi chép và dọn dẹp nhẹ tới mức mình không bỏ giữa chừng nữa. Hồi ghi sổ giấy mình bỏ giữa chừng suốt.
NÊN LÀM THEO THỨ TỰ NÀO, VÀ AI THÌ CHƯA NÊN LÀM
Nếu bắt đầu lại từ hôm nay mình sẽ làm đúng thứ tự này.
Thư mục vault. Trước tất cả. Ngày đầu tiên đã có thể bắt đầu ghi.
3 tới 5 skill đầu. Chỉ viết cho việc ae đang làm bằng tay mỗi tuần.
Cắm 1 nguồn dữ liệu thật. 1 thôi. Cái sổ ae hay phải mở ra nhìn nhất.
Giọng nói.
Cái màn hình.
Số 4 với số 5 đảo chỗ cho nhau cũng không sao. Số 1 với số 2 thì không được đảo.
Còn đây là phần ít ai nói: có những người chưa nên làm cái này.
Nếu ae chưa có thói quen ghi chép nào cả, kể cả sổ giấy, thì dựng hệ thống này xong ae chỉ có một cái vault rỗng chạy bằng điện. Trí nhớ nhân tạo nó khuếch đại thứ ae đã có sẵn, ae chưa có gì thì nó khuếch đại số 0.
Nếu việc của ae chưa có số liệu đều đặn để nhìn thì cũng khoan. Trợ lý không nhìn thấy gì thì nó chỉ trả lời chung chung cho lịch sự thôi.
Bắt đầu bằng 2 tuần ghi tay đã. Thật đấy. Rồi hẵng cắm điện.
NÓI THẬT VỀ TIỀN, PHẦN NÀY ÍT NGƯỜI NÓI
Cho ae một con số thật, đo trên máy mình, tính tới trưa nay.
Hệ thống ghi nhận 8,6 triệu token đi vào và khoảng 117 nghìn token đi ra, qua đúng 10 lượt trò chuyện. Quy theo bảng giá API thì rơi vào khoảng 14 đô.
10 lượt chat. 14 đô.
Có 2 điều mình phải nói ngay để ae khỏi hiểu sai.
Thứ nhất, mình không trả từng đó tiền. Mình chạy bằng gói thuê bao tháng, nên con số kia là giá quy đổi để tham chiếu chứ không phải hóa đơn của mình. Nhưng nếu ae cắm bằng API rời thì đó đúng là số ae phải trả.
Thứ hai, ae để ý cái tỷ lệ kỳ quặc: vào 8,6 triệu, ra 117 nghìn, gấp hơn 70 lần. Là vì mỗi lượt hỏi hệ thống phải nạp lại toàn bộ ngữ cảnh, gồm hướng dẫn, trí nhớ, nội dung file đang mở. Ae gõ một câu 3 chữ, nhưng thứ đi lên đường truyền là cả một tập hồ sơ.
Đây là chỗ khiến nhiều người dựng xong rồi bỏ. Không phải vì nó không chạy, mà vì cuối tháng nhận hóa đơn xong thì hoảng.
Nên nếu ae định làm thì bắt đầu bằng gói thuê bao có sẵn, hoặc bằng model chạy ngay trên máy, đừng cắm thẳng API rồi để nó chạy tự do.
MỘT SỐ SAI LẦM KHI DỰNG AI OS
Mấy cái này mình vấp hết rồi nên kể lại cho ae đỡ mất thời gian.
1. Lao vào lắp giọng nói trước. Vì nó sướng nhất và khoe được ngay. Nhưng chưa có vault thì nó chỉ là cái loa biết nói chuyện phiếm.
2. Nhồi tất cả vào một cái prompt khổng lồ. Mình nói ở trên rồi. Nhiều skill nhỏ, mỗi cái một việc, luôn luôn hơn một prompt to.
3. Đi tìm model xịn nhất trước khi cắm dữ liệu. Một model đời cũ mà được nhìn thấy số thật của ae thì có ích hơn hẳn một model đời mới ngồi đoán. Chọn model là việc làm sau cùng chứ không phải đầu tiên.
4. Tưởng dựng xong là hết việc. Bước lắp giọng nói thì nhanh thật. Bước dựng vault và viết skill thì không có điểm kết thúc, nó giống việc dọn nhà hơn là việc lắp một món đồ.
5. Tin nó tuyệt đối. Nó ghi nhầm chỗ, nó hiểu lệch một câu tiếng Việt, nó tóm tắt rất tự tin trong khi bỏ sót đúng cái ý quan trọng. Tuần nào mình cũng bắt được vài lỗi kiểu đó. Nên mình có một nguyên tắc không phá: cái gì đi ra ngoài thì mình đọc trước. Tin nhắn gửi khách, bài đăng, thư trả lời. Nó soạn, mình duyệt, rồi mới gửi.
VỀ QUYỀN, PHẦN NÀY MÌNH MUỐN AE ĐỌC KỸ NHẤT
Đây là thứ mình cho là quan trọng nhất cả bài, và cũng là thứ mình thấy gần như không ai nhắc khi hướng dẫn dựng trợ lý AI.
Javis của mình chia 3 mức quyền, và mình khuyên ae dựng cái gì cũng nên chia như vậy.
Chỉ đọc. Nó xem, nó phân tích, nó đề xuất. Không đụng vào cái gì hết.
Được ghi nháp. Nó viết được file trong vault của ae. Vẫn không được đụng ra ngoài.
Toàn quyền. Nó gửi tin thật, đăng bài thật, tiêu tiền thật.
Mọi thứ mình dựng đều bắt đầu ở mức 1. Lên mức 2 sau khi mình đã nhìn nó chạy đủ lâu. Mức 3 mình chỉ mở cho những việc rất hẹp, đã chạy đúng nhiều lần, và hỏng cũng không chết ai.
Lý do rất đơn giản thôi. Một câu trả lời sai thì ae đọc rồi bỏ qua. Một tin nhắn gửi nhầm cho khách thì không thu về được. Một chiến dịch quảng cáo chạy sai thì tiền đã đi rồi.
Automation hỏng không đau ở chỗ nó làm sai. Nó đau ở chỗ nó làm sai rất nhanh và rất nhiều lần trước khi ae kịp nhìn.
VÌ SAO MÌNH VẪN NGỒI LÀM CÁI NÀY THÔNG NGÀY THÔNG ĐÊM
Nói thật thì tổng thời gian mình bỏ ra cho Javis tới giờ chắc còn nhiều hơn thời gian nó tiết kiệm được cho mình.
Cái mình đổi được là thứ khác.
Trước đây mỗi thứ mình nghĩ ra, mỗi bài học sau một lần làm hỏng, mỗi quyết định và lý do đằng sau nó, đều nằm rải rác trong đầu mình và trong mấy chục cái tab. 3 tháng sau hỏi lại thì mình không dựng lại được.
Bây giờ nó nằm ở một chỗ. Và cái chỗ đó dày lên mỗi ngày thay vì mỏng đi.
Năm ngoái mình đóng cửa một biz. Nhiều thứ mình học được từ lần đó mình đã để rơi mất, chỉ vì lúc ấy không có chỗ nào để hứng.
Cái mình dựng, nói cho cùng, chỉ là một cái chỗ để hứng. Và vì bộ não tháo ra lắp vào được nên cái chỗ đó sống lâu hơn bất kỳ con AI nào đang có mặt hôm nay.
Giống hệt cái ý mình nói ở bài trước thôi: quan trọng là bồi bổ cho não mình chứ không phải não AI. AI chỉ khuếch đại thứ ae đã có sẵn.
Bài này cũng đã dài, chúc mừng ae nào đọc được tới đây.
Nếu ae đang định bắt tay làm thật thì mình có 2 thứ để gửi, đều là đồ mình đang dùng chứ không phải tài liệu viết cho đẹp.
Một file SKILL.md mẫu, mở ra là thấy ngay cấu trúc gồm những gì và viết cái phần khi nào thì dùng ra sao. Kèm luôn danh sách 5 skill đầu tiên mình nói ở bước 1, viết đủ chi tiết để ae chép về sửa lại theo việc của mình.
Ae còm JAVIS ở dưới nhé, hoặc trả lời thẳng email này cũng được.
Còn ae nào muốn đi theo cả quá trình mình dựng cái này lớn dần lên, gồm cả những lần mình làm hỏng rồi phải gỡ ra làm lại, thì bấm đăng ký để khỏi lỡ số sau.
Hẹn ae số sau.
@blogminhquy












