danveloper/flash-moe
Menjalankan model 400 miliar parameter secara lokal biasanya butuh rak server. danveloper berhasil melakukannya di MacBook Pro dengan RAM 48GB. Engine-nya namanya flash-moe. Alih-alih memuat model 209
π Status: β Published | ποΈ Kategori: AI Models & Local Inference | βοΈ Kurator: Muh Habibie
π― Hook
Section titled βπ― HookβMenjalankan model 400 miliar parameter secara lokal biasanya butuh rak server. danveloper berhasil melakukannya di MacBook Pro dengan RAM 48GB. Engine-nya namanya flash-moe. Alih-alih memuat model 209GB ke memori, dia streaming bobot dari SSD ke GPU sesuai kebutuhan, menghasilkan sekitar lima token per detik di hardware konsumen. Seluruh engine-nya dibangun dalam 24 jam, dengan Claude Code menjalankan eksperimen secara otonom berdasarkan paper penelitian Apple.
π Deskripsi
Section titled βπ DeskripsiβInference engine murni C/Metal yang menjalankan Qwen3.5-397B-A17B (model Mixture-of-Experts 397 miliar parameter) di MacBook Pro dengan RAM 48GB pada 4.4+ token/detik dengan output berkualitas produksi termasuk tool calling.
Seluruh model 209GB di-stream dari SSD lewat pipeline Metal compute custom. Tanpa Python. Tanpa framework. Cuma C, Objective-C, dan Metal shader yang di-tune manual.
Spesifikasi Mesin: MacBook Pro, Apple M3 Max Chip: CPU 16-core (12P + 4E), GPU 40-core, ANE 16-core Memori: 48 GB unified (~400 GB/s bandwidth) SSD: 1TB Apple Fabric, sequential read 17.5 GB/s (terukur) macOS: 26.2 (Darwin 25.2.0)
flash-moe karya danveloper cocok untuk AI engineer yang ingin menjalankan model besar secara lokal di hardware konsumen, mengatasi masalah kebutuhan memori yang sangat besar dengan streaming bobot model dari SSD alih-alih memuatnya ke RAM.
π¬ Komentar Netizen
Section titled βπ¬ Komentar Netizenββ5 token per detik. Dengan effort reasoning yang sering dipakai model modern, program Hello World aja butuh sejam buat keluar. Dengan harga memori yang gila-gilaan, sepertinya perusahaan besar sudah mengunci masa depan mereka dengan cara yang tidak jujur.β β @64jcl
βItu cuma 17B parameter aktif. Yang kamu butuhkan cuma router untuk load satu layer dan mengaktifkannya. Sebenarnya ini cuma kumpulan model mini 17B dengan pengetahuan lainnya disembunyikan, seperti menukar banyak model kecil. Alih-alih menyimpan semua layer MoE di RAM, kamu bisa swap masuk keluar dari disk yang memang lambat. Waktu model MoE keluar, saya heran kenapa mereka gak izinkan hal ini. Butuh waktu lama sebelum model 400B aktif parameter bisa jalan lokal karena memory bandwidthβ β @adroberts
βini basically memory hierarchy yang dijadikan produk. suka banget sama kerjaan model gini, terobosannya bukan modelnya, tapi gimana mereka maksa lewat hardware biasaβ β @mktpavlenko
πΌοΈ Tangkapan Layar & Preview
Section titled βπΌοΈ Tangkapan Layar & Previewβ

