★ Biến điện thoại của bạn thành máy chủ AI ★
LLM Server cho phép bạn chạy các mô hình ngôn ngữ lớn trực tiếp trên thiết bị Android của mình — và hiển thị chúng dưới dạng điểm cuối API cục bộ mà bất kỳ ứng dụng, tập lệnh hoặc tác nhân AI nào cũng có thể kết nối.
Không cần đám mây. Không cần đăng ký. Điện thoại của bạn trở thành hệ thống phụ trợ AI.
━━━━━━━━━━━━━━━━━━━━━━━━━━━━
🧠 SUY LUẬN TRÊN THIẾT BỊ
• Chạy các mô hình LLM trọng lượng mở (Llama, Gemma, Phi, Qwen, Mistral và nhiều hơn nữa)
• Tối ưu hóa cho phần cứng di động với lượng tử hóa GGUF
• Bảo mật hoàn toàn — dữ liệu của bạn không bao giờ rời khỏi thiết bị
• Hoạt động hoàn toàn ngoại tuyến sau khi các mô hình được tải xuống
🔌 MÁY CHỦ API TÍCH HỢP SẴN
• API REST tương thích với OpenAI được phục vụ từ điện thoại của bạn
• Kết nối bất kỳ công cụ nào hỗ trợ định dạng API của OpenAI
• Truyền phản hồi theo thời gian thực thông qua Sự kiện được gửi từ máy chủ (Server-Sent Events)
• Phục vụ nhiều máy khách trên mạng cục bộ của bạn
🤖 HOÀN HẢO CHO CÁC TÁC NHÂN AI
• Cho phép trợ lý AI gọi điện thoại của bạn như một máy chủ LLM
• Hermes Agent, LangChain, AutoGPT — bất kỳ ứng dụng nào có HTTP
• Hỗ trợ Tailscale/ZeroTier để truy cập từ xa an toàn
• Không cần khóa API — bạn sở hữu mô hình
📱 CÁCH HOẠT ĐỘNG
1. Tải xuống mô hình từ trình duyệt mô hình tích hợp sẵn
2. Nhấn "Khởi động máy chủ" để khởi chạy điểm cuối API
3. Trỏ bất kỳ máy khách nào đến http://your-phone-ip:8080/v1/chat/completions
4. Vậy là xong — điện thoại của bạn giờ đã là một máy chủ AI
🔧 CHI TIẾT KỸ THUẬT
• Máy chủ llama.cpp để suy luận CPU/GPU nhanh
• Hỗ trợ các mô hình GGUF (Q4_K_M, Q5_K_M, Q8_0 và hơn thế nữa)
• Điểm cuối /v1/chat/completions tương thích với OpenAI
• Độ dài ngữ cảnh có thể cấu hình, nhiệt độ và lấy mẫu
• Dịch vụ nền tiếp tục hoạt động ngay cả khi ứng dụng được thu nhỏ
• Lập lịch suy luận tối ưu hóa pin
━━━━━━━━━━━━━━━━━━━━━━━━━━━━
💡 CÁC TRƯỜNG HỢP SỬ DỤNG
• Trợ lý AI cá nhân hoạt động 100% trên thiết bị của bạn
• Phát triển & thử nghiệm — nguyên mẫu các tính năng AI mà không tốn chi phí đám mây
• Hệ thống phụ trợ tác nhân AI — cho phép các tác nhân tự động sử dụng điện thoại của bạn như bộ não của chúng
• AI ưu tiên quyền riêng tư — dữ liệu nhạy cảm không bao giờ được lưu trữ trên đám mây
• AI ngoại tuyến — hoạt động trên máy bay, trong đường hầm, bất cứ đâu
🔒 QUYỀN RIÊNG TƯ & BẢO MẬT
• Tất cả quá trình suy luận diễn ra trên thiết bị
• Không thu thập dữ liệu, không đo từ xa, không đám mây • Máy chủ API chỉ có thể truy cập được trên mạng cục bộ của bạn theo mặc định
• Hệ sinh thái mô hình mã nguồn mở — không bị ràng buộc bởi nhà cung cấp
━━━━━━━━━━━━━━━━━━━━━━━━━━━━
LLM Server thu hẹp khoảng cách giữa các mô hình AI mã nguồn mở mạnh mẽ và các thiết bị bạn mang theo hàng ngày. Ngừng trả tiền cho các cuộc gọi API đám mây — chạy AI của riêng bạn, theo điều kiện của riêng bạn.
Tải xuống ngay và biến điện thoại của bạn thành một cỗ máy AI mạnh mẽ.
Chạy các mô hình AI trên điện thoại của bạn và sử dụng chúng như một điểm cuối API cho bất kỳ ứng dụng nào.
Lần cập nhật gần đây nhất
31 thg 8, 2026