Skip to content

Panduan Lengkap AI Voice Cloning untuk Studio Independen

— Bebas dari ketergantungan platform. Berbicara dengan suara Anda sendiri.

Catatan lengkap membangun sistem kloning suara lokal dari nol, termasuk setiap masalah yang ditemui.


Mengapa harus begini?

Platform sintesis suara yang ada sekarang tidak lebih dari dua jenis.

Gratis — suara generik di mana-mana, video Anda terdengar persis seperti video orang lain, tidak ada kekhasan. Pendengar tahu dalam tiga detik platform apa yang Anda gunakan. Dari mana datangnya ciri khas?

Berbayar — dihitung per karakter, setiap kali membuat suara Anda menghitung dalam hati berapa harga kalimat ini, sedang merekam pun ragu apakah perlu diulang. Skala membesar, tagihan bulanan jadi angka yang membuat Anda mengerutkan dahi.

Adakah jalan ketiga?

Ada. Bangun sendiri.

Gunakan model AI open-source, bangun layanan sintesis suara lokal di komputer Anda sendiri, dengan suara Anda sendiri, menghasilkan konten Anda sendiri. Tidak ada batas karakter, tidak ada biaya, suara adalah milik Anda, gaya adalah milik Anda. Inilah tampilan studio independen yang seharusnya.


Apa sistem ini?

Banyak orang mendengar "bangun TTS sendiri" dan langsung membayangkan harus menulis program sintesis suara dari awal.

Bukan begitu.

Ini lebih dekat dengan konsep "mendirikan server sendiri":

LapisanApa ituYang perlu Anda lakukan
Model AIOtak sintesis suara, sudah dilatih orang lainUnduh dan gunakan
FrameworkLingkungan yang membuat model bisa berjalanInstal dan konfigurasi
Suara AndaSampel referensi untuk modelRekam 4–6 detik audio
Kode AndaPenghubung input dan outputBagian inilah yang Anda tulis

Setelah selesai dikonfigurasi, komputer Anda menjalankan layanan lokal dengan antarmuka Web. Anda bisa mengoperasikannya di browser, atau memanggil API-nya secara programatik, menjadikannya komponen dalam pipeline otomasi Anda.

Model yang digunakan dalam panduan ini adalah GPT-SoVITS, alasannya sederhana: performa bahasa Mandarin terbaik, antarmuka sepenuhnya berbahasa Mandarin, Voice Cloning hanya butuh rekaman 4–6 detik, open-source dan boleh digunakan secara komersial secara gratis.


Apa yang Anda butuhkan?

Perangkat Keras

Sistem ini tidak menuntut perangkat keras tinggi. Lingkungan uji panduan ini adalah laptop biasa tanpa GPU dedicated, berjalan pada CPU murni.

KonfigurasiWaktu menghasilkan 100–200 karakter
Ada GPU NVIDIA (6GB VRAM ke atas)~10–30 detik
CPU saja~150–250 detik

Jika penggunaan tidak berat, CPU murni sudah cukup. Merekam beberapa dubbing video per hari dan menunggu beberapa menit untuk file audio masih dalam batas yang bisa diterima.

Perangkat Lunak

  • Windows 10 / 11
  • Python (panduan ini menggunakan 3.11 — alasan dijelaskan di bawah)
  • Miniconda (alat manajemen versi Python)
  • VS Code (lingkungan pengembangan)
  • Git

Satu konsep yang harus Anda pahami dulu: virtual environment Python

Sebelum mulai menginstal, ada satu konsep yang harus Anda kuasai — jika tidak, masalah yang terjadi kemudian akan sangat menjengkelkan.

Manajemen paket Python memiliki konsep "lingkungan".

Bayangkan komputer Anda memiliki beberapa gudang independen:

Komputer Anda
├── Python 3.14 global (default sistem)
├── conda environment tts (Python 3.11, yang kita buat)
└── .venv (VS Code terkadang membuat ini otomatis)

Paket di setiap gudang sepenuhnya independen. Sesuatu yang diinstal di gudang A tidak terlihat dari gudang B.

Inilah mengapa banyak orang menginstal paket tapi tetap mendapat pesan tidak ditemukan saat dijalankan. Penyebabnya hampir selalu sama — diinstal di gudang yang salah.

GPT-SoVITS membutuhkan Python 3.11, tapi komputer Anda mungkin sudah punya versi lebih baru (lingkungan uji panduan ini adalah 3.14). Solusinya adalah menggunakan Miniconda untuk membuat environment Python 3.11 yang terisolasi, terpisah sepenuhnya dari Python sistem, tidak saling mengganggu.

Setelah konsep ini dipahami, langkah-langkah instalasi berikut tidak akan terasa aneh.


Langkah-langkah Instalasi

Langkah 1: Instal Miniconda

Jalankan di terminal VS Code:

bash
winget install Anaconda.Miniconda3

Setelah instalasi selesai, tutup VS Code dan buka kembali agar variabel lingkungan berlaku. (Penulis panduan ini melakukan segalanya di terminal VS Code. Anda juga bisa menggunakan terminal sistem terpisah — hasilnya sama.)

Setelah dibuka kembali, izinkan PowerShell menjalankan skrip:

bash
Set-ExecutionPolicy -ExecutionPolicy RemoteSigned -Scope CurrentUser

Verifikasi conda terinstal dengan sukses:

bash
conda --version

Melihat nomor versi berarti berhasil.


Langkah 2: Buat environment Python 3.11

Terima syarat layanan Anaconda (jalankan masing-masing baris terpisah, setiap baris akan meminta konfirmasi — ketik Y dan tekan Enter):

bash
conda tos accept --override-channels --channel https://repo.anaconda.com/pkgs/main
conda tos accept --override-channels --channel https://repo.anaconda.com/pkgs/r
conda tos accept --override-channels --channel https://repo.anaconda.com/pkgs/msys2

Buat environment khusus:

bash
conda create -n tts python=3.11 -y

Aktifkan environment (lakukan ini setiap kali sebelum digunakan):

bash
conda activate tts

Ketika terminal berubah dari (base) menjadi (tts), Anda berhasil.


Langkah 3: Clone GPT-SoVITS

Masuk ke direktori kerja Anda dan clone proyek:

bash
cd D:\direktori-kerja-anda
mkdir tts-service
cd tts-service
git clone https://github.com/RVC-Boss/GPT-SoVITS.git
cd GPT-SoVITS

Langkah 4: Instal paket

bash
pip install -r requirements.txt

Langkah ini mengunduh banyak paket dan membutuhkan beberapa menit — biarkan selesai.

⚠️ Masalah yang ditemui: konflik versi

Setelah menginstal requirements.txt, beberapa paket memiliki versi yang berkonflik dan perlu diperbaiki secara manual:

bash
# gradio terlalu baru — downgrade
pip install gradio==4.44.0

# masalah versi starlette dan fastapi
pip install "fastapi==0.115.0" "starlette>=0.37.2,<0.39.0"

# masalah versi jinja2
pip install jinja2==3.1.4

# paket yang kurang
pip install psutil pyyaml ffmpeg-python
conda install -c conda-forge editdistance

⚠️ Masalah yang ditemui: torchaudio di Windows

torchaudio versi baru di Windows bergantung pada torchcodec, tapi torchcodec tidak didukung di Windows. Perlu menginstal versi yang kompatibel:

bash
pip install torchaudio==2.9.0 torch==2.9.0

⚠️ Masalah yang ditemui: sumber daya bahasa NLTK

Pertama kali menghasilkan teks campuran Mandarin-Inggris, perlu mengunduh model bahasa Inggris NLTK:

bash
python -c "import nltk; nltk.download('averaged_perceptron_tagger_eng')"

Langkah 5: Unduh model pre-trained

GPT-SoVITS membutuhkan beberapa model pre-trained untuk berfungsi, total sekitar 3GB, diunduh dari HuggingFace:

bash
python -c "from huggingface_hub import snapshot_download; snapshot_download('lj1995/GPT-SoVITS', local_dir='GPT_SoVITS/pretrained_models')"

Waktu unduh tergantung kecepatan koneksi — sekitar 30 menit hingga 1 jam. Jika terhenti, tekan Ctrl+C dan jalankan ulang — mendukung unduhan lanjutan.

Perlu juga membuat direktori cache untuk model deteksi bahasa:

bash
mkdir GPT_SoVITS\pretrained_models\fast_langdetect

Langkah 6: Mulai layanan

Perintah startup standar untuk setiap sesi:

bash
conda activate tts
cd D:\direktori-kerja-anda\tts-service\GPT-SoVITS
C:\Users\nama-pengguna-anda\miniconda3\envs\tts\python.exe webui.py

Mengapa menggunakan path Python lengkap? VS Code terkadang mengaktifkan otomatis environment .venv, menimpa environment tts kita. Menggunakan path lengkap memastikan Python yang benar selalu berjalan, tanpa gangguan.

Ketika startup berhasil, terminal menampilkan:

Running on local URL: http://0.0.0.0:9874

Browser otomatis terbuka dan memuat http://localhost:9874 — server lokal Anda sudah aktif, seluruh layanan berjalan di komputer Anda sendiri.


Menghasilkan suara Anda untuk pertama kalinya

Siapkan sampel suara

Sebelum memulai, Anda butuh rekaman suara Anda sendiri sebagai audio referensi.

Tips rekaman:

  • Durasi: 5–10 detik
  • Lingkungan: ruangan tenang, matikan kipas dan AC
  • Peralatan: ponsel sudah cukup — mikrofon ponsel modern dapat menangani Voice Cloning dengan baik. Faktanya penulis pertama kali test menggunakan mikrofon bawaan laptop... entah mengapa berhasil juga.
  • Konten: berbicara natural — tidak perlu menyiapkan naskah khusus
  • Format: MP3 atau WAV keduanya bisa

Transfer rekaman ke komputer dan simpan di lokasi tetap (misalnya D:\tts-service\my_voice.wav). Upload file ini setiap sesi — tidak perlu merekam ulang.


Buka antarmuka inferensi

  1. Buka http://localhost:9874 di browser
  2. Klik tab 1-GPT-SoVITS-TTS
  3. Klik sub-tab 1C-Inferensi
  4. Klik tombol oranye "Buka TTS Inference WebUI"
  5. ⚠️ Tombol mungkin tidak merespons selama lebih dari 30 detik — ini normal (panduan ini menggunakan laptop lama tanpa GPU, kecepatan alami lebih lambat). Tunggu dengan sabar, jangan klik lagi
  6. Setelah dimulai, tab browser baru terbuka dan memuat http://localhost:9872 — ini adalah antarmuka pembuatan suara yang sebenarnya

Pengaturan parameter

Parameter yang direkomendasikan untuk gaya penyampaian keuangan yang tenang:

ParameterRekomendasiKeterangan
Kecepatan bicara1.1Sedikit lebih cepat dari alami, terdengar lebih berirama
Jeda antar kalimat0.2 detikJeda alami antar kalimat
top_k5Semakin kecil semakin stabil, cocok untuk konten formal
top_p0.8Mode konservatif, mengurangi pengucapan yang tidak alami
temperature0.7–1.0Semakin kecil semakin datar, semakin besar semakin ekspresif
Potong berdasarkan tanda bacaAktifSangat penting — membuat intonasi jauh lebih alami

"Potong berdasarkan tanda baca" adalah pengaturan yang paling mempengaruhi kealamian. Ketika aktif, model berhenti secara alami di tanda titik dan koma, terdengar jauh lebih seperti orang sungguhan daripada mesin membaca teks.


Catatan untuk teks campuran Mandarin-Inggris

Teks campuran Mandarin-Inggris adalah kasus paling sulit untuk TTS — titik peralihan bahasa menciptakan sedikit hesitasi.

Perbaikan: tambahkan koma sebelum kata benda proper bahasa Inggris untuk memberi model buffer pergantian bahasa. Selain itu jika tidak ingin kualitas "kabur" seperti pengalaman penulis pertama kali, pisahkan nama merek bahasa Inggris dengan spasi — misalnya Space X — agar model melafalkan secara alami daripada dibaca menjadi satu kata:

# Aslinya
SpaceX melantai di bursa saham

# Setelah diperbaiki
,SpaceX melantai di bursa saham

Trik kecil ini secara nyata memperbaiki hesitasi saat pergantian bahasa.


Referensi waktu pembuatan (mode CPU)

Panjang teksPerkiraan waktu
Di bawah 50 karakter~50–80 detik
100–200 karakter~150–250 detik
500+ karakter~10–15 menit

⚠️ Penting: Jangan operasikan browser saat sedang menghasilkan suara. Saat CPU memproses TTS, semua sumber daya difokuskan pada komputasi — menggulir halaman akan merebut sumber daya dan menyebabkan audio output tersendat.

Cara kerja yang disarankan: klik hasilkan, pergi mengerjakan hal lain, kembali untuk mendengarkan hasilnya.


Output dan penyimpanan

Ketika pembuatan selesai, player dan tombol unduh muncul di antarmuka.

  • Klik unduh — nama file adalah audio.wav
  • Disimpan ke folder unduhan default browser
  • ⚠️ Setiap unduhan menimpa file yang sama — segera ganti nama versi yang Anda sukai

Mengintegrasikan ke dalam pipeline otomasi

GPT-SoVITS menyediakan API, sehingga Anda bisa memanggilnya secara programatik tanpa harus mengoperasikan antarmuka Web setiap kali.

Penggunaan dasar:

python
import requests

response = requests.get("http://localhost:9880", params={
    "text": "Hari ini kita akan membahas...",
    "text_lang": "zh",
    "ref_audio_path": "D:/tts-service/my_voice.wav",
    "prompt_text": "isi yang dikatakan audio referensi Anda",
    "prompt_lang": "zh"
})

with open("output.wav", "wb") as f:
    f.write(response.content)

Dengan ini seluruh pipeline produksi video bisa berjalan otomatis (bagian pembuatan teks bisa menggunakan Claude atau platform AI lain — sesuai preferensi):

Claude membuat naskah

GPT-SoVITS API menghasilkan suara

FFmpeg menggabungkan video

Output akhir

Rencana ke depan

  • Deployment ke cloud / MCP: Deploy layanan TTS lokal ke server cloud, atau kemas sebagai alat MCP agar AI bisa memanggilnya langsung. Keduanya pada dasarnya sama — membuat layanan ini menjadi API yang bisa dipanggil dari jarak jauh kapan saja, tidak lagi bergantung pada laptop lokal yang harus menyala.
  • Fine-tuning suara: Gunakan lebih banyak rekaman suara sendiri untuk melatih model khusus, meningkatkan kemiripan dan kealamian suara lebih lanjut.

Penutup

Dari "membayar platform sampai terasa sakit" hingga "menjalankan layanan kloning suara di komputer sendiri" — jaraknya hanya satu sore pengaturan (atau tidur malam lalu lanjut berjuang setengah hari) dan sedikit kesabaran menghadapi masalah.

Masalahnya nyata. Konflik versi, lingkungan yang kacau, masalah kompatibilitas Windows — semua ini adalah bagian dari prosesnya, dan itulah mengapa panduan ini mendokumentasikan setiap kesalahan.

Anda tidak perlu menjadi insinyur untuk melakukan ini. Anda hanya perlu mau melakukannya selangkah demi selangkah — dan ketika menemui kesalahan, jangan panik. Salin pesan kesalahannya ke AI dan tanyakan.

Suara adalah milik Anda. Sistem adalah milik Anda. Konten adalah milik Anda.

Inilah tampilan studio independen yang seharusnya.


Bacaan Lebih Lanjut


Lingkungan uji: Windows 11, laptop tanpa GPU dedicated, Python 3.11, GPT-SoVITS versi terbaru
Tanggal pembuatan: Juni 2026

Basis Pengetahuan Digital Ascentek