Model pengkodean sumber terbuka mulai menembus dunia pada tahun 2026. DeepSeek V4 Pro baru-baru ini mencapai angka 80,6% di tolok ukur SWE-bench Verified, duduk tepat di sebelah model sumber tertutup termahal di dunia.
Tapi inilah syaratnya. Model open coding terbaik saat ini membutuhkan server rack yang belum Anda miliki. Yang berjalan di satu kartu grafis 24GB adalah model yang benar-benar berbeda, dan lebih dekat ke puncak daripada yang seharusnya. Pertanyaannya bukan model mana yang terbaik secara keseluruhan. Pertanyaannya adalah model mana yang terbaik yang bisa Anda jalankan untuk jenis coding yang sebenarnya Anda lakukan.
Berikut adalah 10 yang layak diketahui. Satu akan muat di mesin Anda. Yang lain akan cocok untuk dompet Anda.
Tingkat 1: The Frontier Open Six
Model-model inilah yang saling bertukar pukulan dengan perbatasan tertutup. Jumlahnya mulai dari 400 miliar hingga hampir...
GLM-5.2
Zhipu membangun GLM-5.2 untuk tugas rekayasa panjang dan multi-langkah di repositori besar. Perangkat ini mempertahankan fokus dan melacak ketergantungan variabel di seluruh jendela konteks token 1M-nya.
Perusahaan ini beroperasi di bawah lisensi MIT dengan total parameter sekitar 753B. Ini menggunakan campuran arsitektur ahli (MoE), artinya hanya sebagian parameter yang berjalan per token, dalam hal ini sekitar 40B. Tim ini memuncaki lapangan terbuka pada benchmark SWE-bench Pro yang lebih berat dengan skor 62,1 persen. API ini berharga sekitar $1,40 untuk input dan $4,40 untuk output per juta token.
Menangani jendela konteks token 1M membutuhkan kompromi arsitektur tertentu. Seiring bertambahnya panjang konteks, mekanisme perhatian biasanya mengalami degradasi seperti "jarum di tumpukan jerami", di mana fakta-fakta yang terkubur di tengah prompt diabaikan. GLM-5.2 menggunakan teknik penskalaan posisi putar (RoPE) yang dimodifikasi yang menjaga recall konteks tengah lebih baik dibandingkan pendahulunya. Ketika Anda menempelkan seluruh pohon sintaksis abstrak repositori ke dalam prompt, model sebenarnya menggunakannya.
Kode Kimi K2.7
Moonshot AI merancang Kimi K2.7 Code agar bertindak secara otonom. Anda mengarahkan model ini ke masalah GitHub yang menggambarkan kondisi balapan di worker latar belakang. Ia menulis perbaikan, menjalankan suite pengujian Anda, membaca log kegagalan, dan menulis ulang fungsi sampai pengujian lulus. Kartu model menunjukkan arsitektur menggunakan ratusan sub-agen untuk mengoordinasikan ribuan langkah dalam satu permintaan kompleks.
Kimi K2.7 Code memiliki sekitar satu triliun parameter total dan mengaktifkan 32B per token. Perusahaan ini beroperasi di bawah lisensi MIT yang telah dimodifikasi. Jika Anda membangun agen pengkodean internal yang perlu berinteraksi secara iteratif dengan compiler atau linter, model ini memberikan keandalan penggunaan alat yang diperlukan.
Keandalan agen berasal dari bagaimana model ini dilatih pasca-produksi. Alih-alih penyetelan instruksi standar, Kimi K2.7 menjalani pembelajaran penguatan yang ekstensif pada lintasan output compiler yang berhasil dan gagal. Ia memahami bahwa kesalahan sintaks bukanlah keadaan kegagalan, melainkan sinyal untuk menyesuaikan output sebelumnya.
DeepSeek V4 Pro dan Flash
DeepSeek V4 membuat rute API lebih murah daripada membayar listrik untuk menjalankan server sendiri. Anda dapat memproses jutaan token log, dokumentasi, dan kode dengan biaya sangat murah, menjadikannya pilihan default untuk pembuatan dokumentasi massal dan analisis pipeline CI/CD.
Baik varian Pro maupun Flash menawarkan jendela konteks token 1M di bawah lisensi MIT. V4 Pro berharga sekitar $0,435 untuk input dan $0,87 untuk output per juta token. Varian V4 Flash menurunkan harga menjadi $0,14 dan $0,28.
Mengintegrasikan ini ke dalam alur kerja otomatis membutuhkan standar standar OpenAI SDK, yaitu menukar URL dasar dan ID model.
import os
from openai import OpenAI
client = OpenAI(
api_key=os.getenv("DEEPSEEK_API_KEY"),
base_url="https://api.deepseek.com/v1"
)
# Using the ultra-cheap Flash variant for high-volume log analysis
response = client.chat.completions.create(
model="deepseek-v4-flash",
messages=[
{"role": "system", "content": "You are a strict code reviewer."},
{"role": "user", "content": "Review this pull request for race conditions: ..."}
],
max_tokens=2048
)
print(response.choices[0].message.content)
Qwen3-Coder-480B-A35B
Alibaba merilis model campuran 480B dari para ahli ini di bawah lisensi Apache 2.0. Perusahaan ini menangani 256.000 token dan memperoleh skor tercatat 69,6 persen di SWE-bench Verified.
Banyak model open-weights menggunakan lisensi khusus yang membatasi penggunaan komersial atau mengharuskan pelaporan di atas ambang pendapatan tertentu. Lisensi Apache 2.0 menghilangkan hambatan tersebut. Perusahaan dapat mengirimkan ini secara komersial tanpa peninjauan hukum. Jika Anda membangun produk coding komersial dan membutuhkan backend kelas frontier yang dapat Anda hosting sendiri secara legal di lingkungan perusahaan yang aman, ini adalah pilihan paling aman untuk Anda.Qwen3-Coder-480B
Namun, menerapkan model 480B membutuhkan infrastruktur yang signifikan. Bahkan pada kuantisasi 8-bit, Anda membutuhkan hampir setengah terabyte VRAM, artinya node 8x H100 atau 8x MI300X. 35 miliar parameter aktif per token menjaga latensi generasi tetap rendah, tetapi kapasitas memori yang dibutuhkan untuk menampung bobot menentukan jejak perangkat keras.
MiniMax M3
MiniMax M3 menargetkan alur kerja pengembangan front-end yang berat dan membutuhkan konteks visual. Anda bisa memasukkan ekspor Figma, modul CSS, dan tangkapan layar bug UI ke dalam prompt, memintanya untuk menghubungkan tata letak flexbox agar sesuai dengan referensi visual. Fitur multimodal asli memetakan tata letak visual langsung ke komponen React yang perlu diperbaiki.
Fitur ini memiliki jendela konteks token 1 juta dan mendapat skor 59% di SWE-bench Pro. Perusahaan ini beroperasi di bawah lisensi khusus yang dibatasi penggunaan komersial. Dengan harga sekitar $0,30 untuk input per juta token, dengan harga output yang bervariasi tergantung pada routing penyedia API, sering kali antara $0,96 dan $2,40, ini adalah pilihan ekonomis untuk tugas multimodal.
Kimi K3
Kimi K3 dari Moonshot menurunkan beban terbukanya pada 26 Juli 2026, mendorong timbangan menjadi 2,8 triliun parameter. Fitur ini memiliki jendela konteks token 1M.
Model ini adalah puncak kemampuan dari ekosistem terbuka saat ini. Aplikasi ini menangani tugas penalaran algoritmik yang kompleks, pemrograman sistem, dan optimasi compiler. Karena skalanya sebesar 2,8T, ini adalah yang tersulit untuk self-host dan tetap efektif hanya API bagi sebagian besar pengembang.
Tier 2: Empat Yang Bisa Anda Jalankan
Enam itu kamu sewa. Keempatnya kamu miliki.
Di sinilah open source menguntungkan bagi pengembang individu. Anda tidak memiliki tagihan API. Tidak ada kode proprietary yang keluar dari mesin Anda. Tingkat yang dapat dijalankan cukup dekat dengan batas sehingga untuk sebagian besar pengkodean sehari-hari, Anda tidak akan merasakan celahnya.
Qwen3-Coder-Next
Jika Anda memiliki Mac Studio 64GB atau 96GB, atau AMD Strix Halo 128GB baru, adalah target Anda. Ini adalah model parameter total 80B yang memperoleh skor 70,6 persen pada SWE-bench Verified di bawah lisensi Apache 2.0.Qwen3-Coder-Next
Karena kuantisasi 4-bit, komputer ini berjalan dengan sekitar 46GB memori terpadu. Trik rekayasa yang sebenarnya di sini adalah campuran arsitektur ahli. Hanya 3 miliar parameter yang aktif per token. Ini berarti coder berkualitas 80B berjalan cepat di desktop yang baik, memberikan kecepatan penalaran hampir terbatas tanpa membanjiri bandwidth memori Anda.
Bandwidth memori adalah pembunuh diam dari performa LLM lokal. Ketika sebuah model menghasilkan token, model harus membaca bobot aktif dari memori ke inti komputasi. Model 80B yang padat membutuhkan pemindahan 80 miliar parameter untuk setiap kata yang diketiknya. Dengan hanya mengaktifkan 3 miliar parameter, ini mengurangi kebutuhan bandwidth memori, memungkinkan mencapai lebih dari 50 token per detik pada arsitektur memori terpadu konsumen seperti Strix Halo.
Qwen3.6 27B
Untuk pengembang solo dengan kartu 24GB, Qwen3.6 27B menangani tugas coding harian tanpa membanjiri memori. Alibaba merilis model padat ini pada April 2026 di bawah lisensi Apache 2.0. Dibutuhkan sekitar 17GB VRAM dengan presisi Q4, artinya muat dengan nyaman pada satu RTX 3090, 4090, atau 5090.
Ini adalah model 27B yang padat dan mampu bersaing dengan arsitektur yang jauh lebih besar. Ollama menjalankannya dengan sempurna untuk alur kerja teks dan coding standar menggunakan GGUF komunitas. Jika Anda ingin menggunakan kemampuan penglihatan multimodal aslinya, Anda membutuhkan file visi terpisah, yang memerlukan penyajian melalui atau LM Studio.mmprojllama.cpp
# Serving Qwen3.6 27B for coding (text-only) with llama.cpp
# -ngl 99 offloads all layers to the GPU for maximum speed
# -c 32768 sets the context budget to 32k tokens
./llama-server \
-m models/Qwen3.6-27B-Q4_K_M.gguf \
-c 32768 \
-ngl 99 \
--port 8080
# Note: Add --mmproj models/Qwen3.6-27B-mmproj-f16.gguf
# only if you specifically want to pass image inputs.Devstral Small 2
Mistral membangun Devstral Small 2 khusus untuk pekerjaan menggunakan alat multi-file. Ini adalah model dengan kepadatan 24 miliar parameter dengan jendela konteks 256.000 token. Kartu ini cocok untuk kartu 24GB dengan presisi Q4 dan beroperasi di bawah lisensi Apache 2.0.
Jika Anda menghubungkan model lokal ke dalam skrip Python yang perlu menjalankan perintah shell, Devstral Small 2 mengikuti batasan skema JSON dan tanda tangan fungsi dengan andal. Ini adalah pilihan yang kuat untuk kerangka kerja agen ketika Anda membutuhkan alternatif dari arsitektur Qwen.
gpt-oss
OpenAI merilis bobot terbuka di bawah garis keturunan gpt-oss. Model ini memiliki total parameter 21 miliar dan mengaktifkan 3,6 miliar. Dibutuhkan sekitar 14GB VRAM dan muat untuk kartu 16GB. Yang lebih besar membutuhkan perangkat keras kelas 80GB.gpt-oss-20bgpt-oss-120b
Ini membawa garis keturunan OpenAI ke perangkat keras lokal. Model ini kuat dalam bernalar melalui masalah sebelum menulis kode. Algoritma ini menghasilkan jejak rantai pemikiran internal, mengolah logika dari algoritma kompleks sebelum menghasilkan implementasi akhir.
Yang Selalu Salah: Autocomplete
Seluruh daftar di atas berfokus pada model chat dan agen. Tidak ada satupun dari mereka yang merupakan alat yang tepat untuk tugas yang paling sering dilakukan pengembang. Penyelesaian tab membutuhkan pendekatan yang sama sekali berbeda.
Autocomplete mengandalkan fill-in-the-middle (FIM). FIM adalah tujuan pelatihan khusus yang mengajarkan model untuk memprediksi kode antara apa yang berada di atas dan di bawah kursor Anda. Model bahasa kausal standar hanya tahu cara memprediksi kata berikutnya berdasarkan apa yang terjadi sebelumnya. FIM mentokenisasi file menjadi awalan, akhiran, dan bagian tengah, melatih model untuk menjembatani celah tersebut. Anda tidak bisa menggunakan agen triliunan parameter untuk ini. Anda membutuhkan model kecil yang cepat yang terhubung langsung ke editor Anda untuk memprediksi token dalam milidetik.
Codestral 2 adalah jawaban terbuka. Mistral mengirimkannya pada April 2026 dengan lisensi Apache 2.0 dengan dukungan FIM asli. Dibutuhkan 16 hingga 24GB VRAM untuk berjalan.
Anda menghubungkan ini ke Continue.dev, ekstensi open-source untuk VS Code dan JetBrains. Pengaturan ini sesuai dengan pelengkapan tab Copilot secara lokal dengan latensi lebih rendah dan tanpa langganan. Jika perangkat keras Anda lebih kecil, ini adalah alternatifnya, membutuhkan sekitar 9,5GB VRAM pada kuartal ke-4.Qwen2.5-Coder 14B
Konfigurasi ini mengharuskan pengaturan peran spesifik untuk autocomplete agar editor tahu cara memformat prompt menggunakan token FIM yang benar.
Model untuk pekerjaan mana
Model yang sama jarang menjadi jawaban untuk dua pekerjaan yang berbeda. Anda harus menyesuaikan arsitektur dengan alur kerja. Tabel di bawah ini membagi pilihan terbuka terbaik berdasarkan tugas coding spesifik yang perlu Anda selesaikan.
Apa yang Dapat Dijalankan Perangkat Keras Anda
Aturan praktis untuk penerapan lokal adalah pada presisi Q4, Anda membutuhkan sekitar 0,6GB VRAM per satu miliar parameter. Kartu 24GB menampung model 32B dengan ruang tersisa yang cukup untuk jendela konteks yang sehat.
Arsitektur memori terpadu bekerja dengan cara yang berbeda. Mac Studio dengan memori 64GB atau 96GB, atau kotak AMD Strix Halo dengan 128GB, dapat menjalankan model yang seharusnya membutuhkan server khusus dengan beberapa GPU perusahaan.
0 komentar:
Posting Komentar