Lewati ke konten
TEKNOIDTEKNOIDTEKNOID
Semua Repositori

microsoft/BitNet

Microsoft baru saja mengubah permainan 🤯

📅 Status: ✅ Published | 🗂️ Kategori: AI Models & Local Inference | ✍️ Kurator: Muh Habibie

Microsoft baru saja mengubah permainan 🤯

Mereka meng-open-source-kan bitnet.cpp, framework inference LLM 1-bit.

Memungkinkan kamu menjalankan model 100B parameter di CPU lokal tanpa GPU.

  • Inference 6.17x lebih cepat

  • 82.2% lebih hemat energi di CPU

100% Open Source.

bitnet.cpp adalah framework inference resmi untuk LLM 1-bit (mis. BitNet b1.58). Menawarkan suite kernel yang dioptimasi, yang mendukung inference 1.58-bit model yang cepat dan lossless di CPU dan GPU (dukungan NPU akan datang berikutnya).

Rilis pertama bitnet.cpp adalah untuk mendukung inference di CPU. bitnet.cpp mencapai speedup 1.37x sampai 5.07x di ARM CPU, dengan model yang lebih besar mengalami gain performa yang lebih besar. Selain itu, mengurangi konsumsi energi 55.4% sampai 70.0%, lebih lanjut meningkatkan efisiensi keseluruhan. Di CPU x86, speedup berkisar 2.37x sampai 6.17x dengan pengurangan energi antara 71.9% sampai 82.2%. Lebih lanjut, bitnet.cpp bisa menjalankan model BitNet b1.58 100B di CPU tunggal, mencapai kecepatan yang sebanding dengan kecepatan baca manusia (5-7 token per detik), secara signifikan meningkatkan potensi untuk menjalankan LLM di device lokal. Silakan refer ke technical report untuk detail lebih lanjut.

Optimasi terbaru memperkenalkan implementasi kernel paralel dengan tiling yang bisa dikonfigurasi dan dukungan embedding quantization, mencapai speedup tambahan 1.15x sampai 2.1x dibanding implementasi original di berbagai platform hardware dan workload. Untuk informasi teknis detail, lihat optimization guide.

bitnet.cpp karya Microsoft cocok untuk developer dan AI engineer, mengatasi masalah kebutuhan GPU yang mahal dengan mengaktifkan inference model besar yang efisien langsung di CPU.

“Kecuali itu bukan model 100B parameter, tapi 1B. Literally ada di halaman yang kamu link.” — @tristannothling

“1-bit quantized… Output-nya paling banter bakal semi-coherent狗shit. Model 100B yang mereka sebut bahkan gak tersedia untuk di-download. Angkat bahu” — @billyarkakar

“Ini model 0.8B parameter. Saya bisa jalanin di RaspberryPi.” — @six60six

“Bagus tapi belum cukup AI gak menerima kompromi Naikkan parameter tapi turunkan kepentingannya bukan cara yang tepat” — @gordonspacer

Tangkapan layar microsoft/BitNet 1

Tangkapan layar microsoft/BitNet 2

Tangkapan layar microsoft/BitNet 3