Dell Storage Engines: Mempercepat AI Inferencing dengan PowerScale dan ObjectScale

Poin Penting:

  • Solusi KV Cache offloading dari Dell yang menggunakan PowerScale dan ObjectScale mampu memberikan kinerja hingga 19x lebih cepat untuk Time to First Token (TTFT) dibandingkan vLLM standar. Ini berarti proses inferensi AI bisa berjalan lebih cepat dan respons kueri lebih singkat.
  • Dengan memindahkan KV Cache ke penyimpanan berperforma tinggi, solusi Dell dapat mengurangi beban GPU, mengatasi bottleneck memori, dan meningkatkan efisiensi sistem.
  • Selain inferensi, Dell AI Data Platform (AIDP) menyederhanakan seluruh siklus data AI — mulai dari data mentah hingga pembuatan pengetahuan — sehingga organisasi bisa menjalankan AI dalam skala besar dengan lebih mudah.

Mengapa Performa AI Menjadi Tantangan Besar?

Model bahasa besar atau LLM (Large Language Models) kini digunakan untuk berbagai kebutuhan bisnis — mulai dari chatbot, asisten digital, hingga pembuatan konten. Namun, semakin canggih modelnya, semakin besar pula sumber daya komputasi yang dibutuhkan.

Salah satu tantangan utamanya adalah performance bottleneck yang sering membuat sistem lambat dan biaya meningkat. Banyak perusahaan mengira solusinya adalah membeli lebih banyak GPU — yang mahal dan boros daya.

Namun ternyata ada cara yang lebih cerdas dan lebih hemat biaya: optimasi KV Cache.


Apa itu KV Cache dan Mengapa Penting?

Dalam inferensi LLM, Key-Value Cache menyimpan hasil perhitungan sementara, sehingga model tidak perlu menghitung ulang setiap kali menghasilkan token baru. Ini sangat memengaruhi respons pertama model yang disebut:

Time to First Token (TTFT)
— seberapa cepat model memberikan respons awal.

Masalahnya, ukuran KV Cache dapat mencapai gigabyte hingga terabyte. Ini bisa membuat memori GPU cepat penuh dan menyebabkan:

  1. Performa melambat, sehingga respons AI menjadi lebih lama.
  2. Pekerjaan gagal, karena memori tidak cukup untuk menjalankan model.

Solusi tradisional biasanya menambah GPU atau memori — tetapi ini mahal, tidak efisien, dan tidak mengatasi akar masalah.


Solusi Cerdas dari Dell: Offload KV Cache ke Penyimpanan AI Berperforma Tinggi

Dell menawarkan pendekatan baru yang jauh lebih efisien:
memindahkan (offload) KV Cache dari GPU ke penyimpanan PowerScale atau ObjectScale.

Alih-alih memaksa GPU menyimpan semuanya, KV Cache disimpan di storage yang cepat dan scalable, lalu diambil kembali secara efisien tanpa perlu dihitung ulang.

Ini memberikan tiga keuntungan utama:

  1. Mengurangi beban GPU
    GPU hanya fokus pada tugas inferensi inti.
  2. Menghilangkan batasan memori GPU
    KV Cache bisa diperluas jauh melebihi kapasitas GPU.
  3. Mengurangi biaya dan meningkatkan efisiensi
    Tidak perlu menambah GPU baru untuk menangani workload besar.

Solusi ini didukung oleh stack perangkat lunak yang telah divalidasi Dell:

  • vLLM inference engine
  • LMCache dengan Dell connector
  • NVIDIA NIXL (dengan plugin S3-over-RDMA untuk ObjectScale)

Stack ini terintegrasi langsung dengan PowerScale dan ObjectScale, baik untuk file maupun objek.


Hasil Benchmark: Performa yang Mengagumkan

Dell menguji kinerja vLLM + LMCache + NVIDIA NIXL untuk mengukur TTFT dengan KV Cache yang sudah disiapkan penuh.

Hasilnya:

  • PowerScale dan ObjectScale hanya membutuhkan 1 detik untuk menghasilkan token pertama pada context window penuh 131K.
  • vLLM standar memerlukan lebih dari 17 detik untuk jumlah token yang sama.

Ini berarti solusi Dell memberikan peningkatan performa 19x lebih cepat.

Bahkan pada context kecil (1K token), Dell Storage Engine tetap lebih cepat daripada GPU menghitung KV Cache secara langsung.

Ini menunjukkan penyimpanan Dell memiliki latensi sangat rendah dan performa tinggi.


Perbandingan Dell dengan Kompetitor

Dell juga melakukan pengujian menggunakan model Qwen3-32B dan membandingkannya dengan solusi dari VAST.

Hasilnya:

  • PowerScale: 0.82 detik TTFT
  • ObjectScale: 0.86 detik TTFT
  • VAST: 1.5 detik TTFT

Dalam uji ini, Dell jauh lebih cepat — dan memberikan hingga 14x akselerasi dibandingkan vLLM standar tanpa KV Cache offloading.


Mengapa Ini Penting untuk Masa Depan AI?

KV Cache offloading bukan hanya solusi untuk masalah performa hari ini.
Ini adalah fondasi untuk infrastruktur AI masa depan.

Dengan menggunakan PowerScale atau ObjectScale sebagai mesin penyimpanan yang mempercepat AI, organisasi dapat:

  • Menjalankan model lebih besar tanpa menambah GPU
  • Mengurangi biaya operasional
  • Meningkatkan throughput inferensi
  • Mendapatkan respons AI lebih cepat dan lebih stabil

Dell AI Data Platform: Lebih dari Sekadar Percepatan Inferensi

Dell tidak hanya menyediakan solusi penyimpanan cepat.
AIDP (Dell AI Data Platform) menyediakan satu platform terpadu yang mencakup seluruh siklus hidup data AI:

  1. Pengambilan data
  2. Transformasi data
  3. Penyimpanan dan analisis
  4. Pelatihan model
  5. Inferensi dan deployment
  6. Aplikasi berbasis agen AI (agentic AI)

Dengan arsitektur modular dan terbuka, AIDP dapat bekerja bersama NVIDIA dan ekosistem AI lainnya. Ini membantu organisasi membangun dan menjalankan AI dalam skala besar dengan lebih cepat dan efisien.


 

Infrastruktur IT yang kuat adalah kunci produktivitas perusahaan. Dengan storage indonesia, merupakan bagian dari PT. iLogo Indonesia, yang merupakan mitra terpercaya dalam solusi Infrastruktur IT dan Cybersecurity terbaik di Indonesia.
Hubungi kami sekarang atau kunjungi storage.ilogoindonesia.id untuk informasi lebih lanjut!