Tech Trends 08 Aug 2026 90 views 0 komentar

Membangun AI Assistant Lokal dengan Ollama dan Open WebUI - ChatGPT tanpa Internet di 2026

Membangun AI Assistant Lokal dengan Ollama dan Open WebUI - ChatGPT tanpa Internet di 2026

Tahun 2025, saya sempat frustasi harus bayar subscription ChatGPT Plus tiap bulan. Harganya naik lagi, dan fitur yang saya pakai cuma coding assistance sama summarize dokumen. Padahal di komputer kantor saya punya GPU RTX 3060 12GB yang cuma dipake buat browsing sama nonton YouTube. Sayang banget kan?

Setelah cari-cari solusi, saya nemu Ollama tool yang bikin run model LLM lokal jadi semudah docker pull. Dan pas digabungin sama Open WebUI, hasilnya? ChatGPT-style interface yang jalan 100% di mesin sendiri. Gratis, offline, dan data saya tetap aman. Di artikel ini saya bakal jelasin cara setup dari nol sampai bisa dipake.

Kenapa Harus AI Lokal?

Sebelum masuk ke tutorial, ada beberapa alasan kenapa AI lokal makin populer di kalangan developer Indonesia:

  • Privasi data Kalau kamu kerja di perusahaan yang strict soal data, kirim codebase ke OpenAI server itu big no-no. Dengan Ollama, semua proses jalan di mesin lokal.
  • Bebas biaya bulanan GPT-4 API itu bayar per token. Kalau kamu coding 8 jam sehari, bill-nya bisa $50-100 per bulan. Model lokal? Sekali install, selamanya gratis.
  • Offline capability Di daerah yang internetnya kurang stabil (hey, banyak kota di Indonesia yang masih begini), AI lokal tetap bisa dipake tanpa koneksi internet.
  • Latency rendah Tidak perlu tunggu response dari server OpenAI. Model kecil seperti Phi-3 atau Gemma 2 bisa respond dalam hitungan detik.

Spesifikasi Minimum yang Dibutuhkan

Oke, realistis dulu ya. AI lokal itu butuh resource. Ini spesifikasi minimum yang saya rekomendasikan berdasarkan pengalaman:

  • RAM 16GB Minimal. Model 7B parameter butuh sekitar 4-8GB RAM saat inference. Kalau mau jalan lancar sambil buka browser + VS Code, 16GB itu sweet spot.
  • GPU (opsional tapi sangat disarankan) NVIDIA dengan VRAM minimal 6GB. RTX 3060 12GB itu ideal untuk budget. AMD juga support lewat ROCm tapi setup-nya lebih ribet.
  • Storage 20GB+ Model 7B sekitar 4GB, model 13B bisa 8GB. Sisain buat beberapa model sekaligus.
  • CPU modern Kalau nggak punya GPU, CPU-based inference juga bisa. Tapi jangan harap secepat GPU. AMD Ryzen 5 / Intel i5 generasi ke-12 ke atas sudah oke.

Step 1: Install Ollama

Ollama itu basically Docker tapi untuk LLM. Cara install-nya super gampang.

Linux (Ubuntu/Debian):


curl -fsSL https://ollama.com/install.sh | sh

Serius, satu baris command itu saja. Ollama otomatis download binary, setup systemd service, dan siap dipake. Kalau mau cek berhasil atau nggak:


ollama --version
# Output: ollama version 0.6.2 (atau versi terbaru)

# Cek service berjalan
systemctl status ollama

macOS: Download installer dari ollama.com/download. Tinggal drag ke Applications, selesai.

Windows: Download executable dari website yang sama. Double-click installer, next-next-finish.

Step 2: Download Model LLM

Setelah Ollama terinstall, saatnya download model. Ini beberapa rekomendasi berdasarkan kebutuhan:


# Untuk coding assistance (rekomendasi utama)
ollama pull codellama:7b

# Untuk general chat (good all-rounder)
ollama pull llama3.1:8b

# Untuk summarization dan writing
ollama pull gemma2:9b

# Model ringan untuk PC kentang (4GB RAM)
ollama pull phi3:mini

# Cek model yang sudah di-download
ollama list

Saya pribadi paling sering pakai codellama:7b buat coding assistance dan llama3.1:8b untuk general tasks. Kalau RAM kamu terbatas, mulai dari phi3:mini dulu model ini cuma butuh 2GB RAM dan surprisingly capable untuk ukuran kecil.

Proses download pertama kali butuh waktu beberapa menit tergantung kecepatan internet. Tapi setelah itu, semua proses jalan offline.

Step 3: Test Ollama dari Terminal

Sebelum install Open WebUI, coba test dulu dari terminal:


# Interactive chat
ollama run codellama:7b

# Atau langsung kirim prompt
ollama run llama3.1:8b "Tuliskan function PHP untuk validasi email"

Kalau sudah bisa respond, berarti Ollama berjalan normal. Ketik /bye untuk keluar dari interactive mode.

Step 4: Install Open WebUI dengan Docker

Open WebUI itu interface web yang mirip ChatGPT, tapi terhubung ke Ollama. Setup-nya pakai Docker, jadi butuh Docker terinstall dulu.

Install Docker kalau belum ada:


# Install Docker (Ubuntu)
curl -fsSL https://get.docker.com | sh
sudo usermod -aG docker $USER
# Logout dan login lagi agar group 

# Verifikasi
docker --version

Sekarang jalankan Open WebUI:


docker run -d \
 -p 3000:8080 \
 --add-host=host.docker.internal:host-gateway \
 -v open-webui:/app/backend/data \
 --name open-webui \
 --restart always \
 ghcr.io/open-webui/open-webui:main

Penjelasan parameter penting:

  • -p 3000:8080 Map port 3000 di host ke port 8080 di container. Bisa diganti sesuai kebutuhan.
  • --add-host=host.docker.internal:host-gateway Ini CRITICAL. Tanpa ini, Open WebUI nggak bisa connect ke Ollama yang jalan di host. Banyak orang stuck di sini.
  • -v open-webui:/app/backend/data Persistent storage supaya chat history nggak hilang.
  • --restart always Auto-start kalau server reboot.

Tunggu beberapa menit sampai container running, lalu buka browser:


# Cek status container
docker ps | grep open-webui

# Kalau perlu cek logs
docker logs open-webui -f

Buka http://localhost:3000 di browser. Kamu akan diminta buat akun admin pertama ini cuma untuk pertama kali. Setelah itu, interface-nya persis seperti ChatGPT.

Step 5: Konfigurasi Open WebUI

Setelah login, ada beberapa setting yang perlu diatur:

1. Connect ke Ollama:

Buka Settings (icon gear) Connections. Pastikan Ollama Base URL adalah http://host.docker.internal:11434. Kalau pakai Linux dan port default Ollama, ini harusnya otomatis terdeteksi.

2. Pilih Default Model:

Settings General Default Model. Pilih model yang paling sering kamu pakai. Saya pilih codellama:7b.

3. System Prompt:

Kamu bisa set system prompt supaya AI selalu respond dalam gaya tertentu. Misalnya:


Kamu adalah asisten programming yang menjawab dalam Bahasa Indonesia 
campur Inggris. Jawaban harus praktis dengan contoh kode. 
Gunakan tone kasual seperti teman diskusi.

4. Enable Web Search (opsional):

Di Settings Web Search, kamu bisa integrate SearXNG atau DuckDuckGo supaya AI bisa search internet. Ini useful banget kalau butuh info terbaru yang belum ada di training data model.

Step 6: Optimasi Performa

Berikut tips yang saya pelajari dari trial and error selama beberapa bulan pakai setup ini:

  • Gunakan GPU untuk inference Pastikan Ollama detect GPU kamu dengan nvidia-smi. Kalau nggak, install NVIDIA Container Toolkit:

# Install NVIDIA Container Toolkit
curl -fsSL https://nvidia.github.io/libnvidia-container/gpgkey | \
 sudo gpg --dearmor -o /usr/share/keyrings/nvidia-container-toolkit-keyring.gpg

curl -s -L https://nvidia.github.io/libnvidia-container/stable/deb/nvidia-container-toolkit.list | \
 sed 's#deb https://#deb [signed-by=/usr/share/keyrings/nvidia-container-toolkit-keyring.gpg] https://#g' | \
 sudo tee /etc/apt/sources.list.d/nvidia-container-toolkit.list

sudo apt-get update && sudo apt-get install -y nvidia-container-toolkit
sudo nvidia-ctk runtime configure --runtime=docker
sudo systemctl restart docker
  • Quantization matters Model dengan quantization Q4_K_M itu sweet spot antara kualitas dan kecepatan. Jangan pakai Q8 atau FP16 kecuali punya VRAM 24GB+.
  • Context length Semakin panjang context, semakin banyak RAM/VRAM yang dipake. Untuk coding, 4096 token sudah cukup. Bisa diatur di Open WebUI per-chat.
  • Multiple models Kamu bisa punya beberapa model sekaligus. Switch model di Open WebUI sesuai task: CodLlama untuk coding, Llama untuk diskusi, Gemma untuk writing.

Step 7: Akses dari Luar Jaringan (Bonus)

Mau akses Open WebUI dari luar rumah? Ada beberapa opsi:

  • Tailscale Paling gampang. Install Tailscale di server dan device kamu, langsung bisa akses dari mana saja. Gratis untuk personal use.
  • Cloudflare Tunnel Gratis, dan bisa akses via domain sendiri. Setup-nya pakai cloudflared:

# Install cloudflared
curl -fsSL https://pkg.cloudflare.com/cloudflare-main.gpg | sudo tee /usr/share/keyrings/cloudflare-main.gpg
echo 'deb [signed-by=/usr/share/keyrings/cloudflare-main.gpg] https://pkg.cloudflare.com/cloudflared focal main' | sudo tee /etc/apt/sources.list.d/cloudflared.list
sudo apt-get update && sudo apt-get install cloudflared

# Quick tunnel (tanpa akun Cloudflare)
cloudflared tunnel --url http://localhost:3000

Command terakhir akan generate URL temporary yang bisa diakses dari browser manapun. Kalau mau URL permanent, perlu setup Cloudflare account dan custom domain.

  • Reverse proxy nginx Untuk yang sudah punya VPS, tinggal tambah nginx config:

server {
 listen 443 ssl;
 server_name ai.kinara.web.id;
 
 ssl_certificate /etc/letsencrypt/live/ai.kinara.web.id/fullchain.pem;
 ssl_certificate_key /etc/letsencrypt/live/ai.kinara.web.id/privkey.pem;
 
 location / {
 proxy_pass http://127.0.0.1:3000;
 proxy_set_header Host $host;
 proxy_set_header X-Real-IP $remote_addr;
 proxy_set_header X-Forwarded-For $proxy_add_x_forwarded_for;
 proxy_set_header X-Forwarded-Proto $scheme;
 
 # WebSocket support untuk streaming response
 proxy_http_version 1.1;
 proxy_set_header Upgrade $http_upgrade;
 proxy_set_header Connection "upgrade";
 }
}

Perbandingan Harga: Lokal vs Cloud API

Ini tabel perbandingan biaya yang saya buat berdasarkan pengalaman 6 bulan pakai keduanya:

  • OpenAI GPT-4 API (coding tasks ~100k token/hari): sekitar $80-120/bulan. Belum termasuk GPT-4 Vision kalau butuh analisis gambar.
  • ChatGPT Plus: $20/bulan, tapi ada rate limit dan data dikirim ke server OpenAI.
  • Ollama + Open WebUI: $0/bulan. Investasi awal cuma listrik (~Rp 50rb/bulan untuk PC 200W yang jalan 8 jam/hari).
  • Hardware cost untuk AI lokal: RTX 3060 12GB sekitar Rp 3.5-4 juta (baru) atau Rp 2-2.5 juta (bekas). ROI dalam 2-3 bulan dibanding bayar API.

Troubleshooting Masalah Umum

Beberapa error yang sering muncul dan cara fix-nya:

  • "Ollama is not running" di Open WebUI Cek systemctl status ollama. Restart kalau perlu: sudo systemctl restart ollama
  • Response sangat lambat Pastikan GPU terdeteksi: ollama ps harusnya tunjukkan GPU accelerator. Kalau CPU-only, install NVIDIA driver dan Container Toolkit.
  • Docker container crash Cek logs: docker logs open-webui --tail 50. Biasanya masalah permissions atau Ollama belum accessible.
  • Model tidak muncul di Open WebUI Refresh halaman, atau coba curl http://localhost:11434/api/tags untuk verifikasi model terdaftar di Ollama.
  • Out of memory Turunkan context length atau pakai model yang lebih kecil. phi3:mini cuma butuh 2GB RAM.

Kesimpulan

Setup AI lokal dengan Ollama dan Open WebUI itu ternyata nggak serumit yang dibayangkan. Investasi awal yang dibutuhkan cuma waktu 30 menit untuk install, dan mungkin beberapa jam untuk explore model-model yang tersedia. Dari sisi biaya, jauh lebih hemat dibanding cloud API apalagi kalau kamu heavy user.

Yang paling saya suka adalah fleksibilitasnya. Bisa coba banyak model, fine-tune system prompt, dan yang paling penting data coding saya nggak pernah keluar dari jaringan lokal. Buat developer Indonesia yang sering kerja di bandwidth terbatas atau concern soal privasi data, ini solusi yang sangat worth it.

Coba setup di weekend dan kasih tahu pengalaman kamu di kolom komentar! Model apa yang jadi favorit kamu? Atau ada tips lain untuk optimize Ollama yang belum saya sebut?


Bagikan artikel ini:

Komentar (0)

Belum ada komentar. Jadilah yang pertama memberikan tanggapan!

Tinggalkan Komentar