EIKON Technology

Vertex AI

Info

Mencoba Kemudahan Inference-as-a-Service dengan Cloud Run dan Vertex AI

Untuk meningkatkan kecepatan pengembangan aplikasi bertenaga large language model (LLM), Anda dapat mempertimbangkan Inference-as-a-Service. Mari kita bahas bagaimana pendekatan ini dapat membantu Anda! Apa itu Inference-as-a-Service? Dengan “Inference-as-a-Service”, aplikasi perusahaan berinteraksi dengan model pembelajaran mesin (dalam hal ini, LLM), dengan overhead operasional yang rendah. Ini berarti Anda dapat menjalankan kode untuk berinteraksi dengan LLM tanpa berfokus pada infrastruktur. Cloud Run sebagai Inference-as-a-Service Cloud Run adalah platform serverless container milik Google Cloud yang memanfaatkan runtime kontainer tanpa harus memikirkan infrastrukturnya. Inilah sebabnya mengapa Cloud Run cocok untuk menjalankan aplikasi bertenaga LLM–Anda hanya membayar saat layanan berjalan. Ada banyak cara untuk menggunakan Cloud Run untuk melakukan inferensi dengan LMM. Hari ini, kita akan membahas cara hosting LLM terbuka di Cloud Run dengan GPU. Pertama, kenali Vertex AI. Vertex AI adalah platform AI/ML lengkap milik Google Cloud yang menawarkan primitif yang diperlukan bagi perusahaan untuk melatih dan menyajikan model ML. Di Vertex AI, Anda dapat mengakses Model Garden, yang menawarkan lebih dari 160 model dasar termasuk model pihak pertama (Gemini), pihak ketiga, dan model sumber terbuka. Baca juga: Google Cloud Directory Sync Kini Menyediakan Setelan Pengelolaan Akun Sementara Vertex AI menyediakan titik akhir inferensi terkelola, Google Cloud juga menawarkan tingkat fleksibilitas baru dengan GPU untuk Cloud Run. Hal ini pada dasarnya mengubah paradigma inferensi. Mengapa? Karena alih-alih hanya mengandalkan infrastruktur Vertex AI, Anda sekarang dapat mengontainerisasi LLM (atau model lain) dan menerapkannya langsung ke Cloud Run. Ini berarti Anda tidak hanya membangun lapisan tanpa server di sekitar LLM, tetapi Anda menghosting LLM itu sendiri pada arsitektur tanpa server. Model diskalakan ke nol saat tidak aktif, dan diskalakan secara dinamis sesuai permintaan, mengoptimalkan biaya dan performa. Dengan akselerasi GPU, layanan Cloud Run dapat siap untuk inferensi dalam waktu kurang dari 30 detik. Sesuaikan LLM Anda dengan RAG Photo Credit: Google Cloud Selain menjalankan dan menskalakan LLM, sering kali untuk  perlu menyesuaikan respons dengan domain atau kumpulan data tertentu. Di sinilah Retrieval-Augmented Generation (RAG) berperan, komponen inti untuk memperluas pengalaman LLM Anda – dan komponen yang dengan cepat menjadi standar untuk kustomisasi kontekstual. Baca juga: Meningkatkan Interpretabilitas LLM dengan Evaluation Service Vertex AI Photo Credit: Google Cloud Ada beberapa cara Inference-as-a-Service berperan. Misalnya, saat melihat arsitektur ini, kita melihat bahwa Cloud Run menangani logika inferensi inti, mengatur interaksi antara Vertex AI dan AlloyDB. Secara khusus, ia berfungsi sebagai jembatan untuk mengambil data dari AlloyDB dan meneruskan kueri ke Vertex AI, yang secara efektif mengelola seluruh aliran data RAG. Baca juga: Layanan Zero-touch Enrollment untuk Perangkat Chrome OS Untuk memulai, kunjungi codelab ini yang akan menunjukkan cara membangun AI Python Application generatif menggunakan Cloud Run. Jika Anda ingin menguji Cloud Run dengan GPU, cobalah codelab ini. Kemudahan Cloud Run sebagai Inference-as-a-Service ini bisa Anda nikmati cukup dengan berlangganan Google Cloud yang kini telah tersedia di EIKON Technology. Untuk informasi lebih lanjut, silakan hubungi kami di sini!

Info

Mengoptimalkan Kinerja Gemini secara Aman dengan Fitur System Instructions Vertex AI

Saat perusahaan berlomba-lomba mengadopsi chatbot yang digerakkan oleh AI generatif, penting untuk mengurangi risiko terpapar pelaku ancaman yang memaksa model AI untuk membuat konten berbahaya. Google melalui  Vertex AI dapat membantu mengelola risiko tersebut. Lalu,  bagaimana cara menggunakannya? Model Gemini pada Vertex AI menggunakan dua jenis filter konten Filter keamanan yang tidak dapat dikonfigurasi secara otomatis memblokir keluaran yang berisi konten terlarang, seperti materi pelecehan seksual anak dan informasi identitas pribadi. Filter konten yang dapat dikonfigurasi memungkinkan Anda menentukan ambang batas pemblokiran dalam empat kategori bahaya (ujaran kebencian, pelecehan, konten seksual eksplisit, dan konten berbahaya) berdasarkan skor probabilitas dan tingkat keparahan. Filter ini dinonaktifkan secara default, tetapi Anda dapat mengonfigurasinya sesuai kebutuhan. Photo Credit: Google Cloud Blog Penting untuk dicatat bahwa, seperti sistem otomatis lainnya, filter ini terkadang dapat menghasilkan hasil positif palsu, yang secara keliru menandai konten yang tidak berbahaya. Hal ini dapat berdampak negatif pada pengalaman pengguna, terutama dalam pengaturan percakapan. System instructions: Pengarahan model proaktif untuk keamanan khusus Petunjuk sistem untuk model Gemini di Vertex AI memberikan panduan langsung kepada model tentang cara berperilaku dan jenis konten yang akan dibuat. Dengan memberikan petunjuk khusus, Anda dapat secara proaktif mengarahkan model agar tidak membuat konten yang tidak diinginkan untuk memenuhi kebutuhan unik perusahaan. Baca juga: Gemini Kini Menyediakan Perlindungan Data Tambahan untuk Akun Sekolah System instructions memiliki keuntungan berikut dibandingkan filter konten: Anda dapat menentukan bahaya dan topik tertentu yang ingin dihindari dan tidak terbatas pada sekumpulan kategori kecil. Lebih detail. Misalnya, alih-alih hanya mengatakan “hindari ketelanjangan”, Anda dapat menentukan apa yang dimaksud dengan ketelanjangan dalam konteks budaya dan menguraikan pengecualian yang diizinkan. Anda dapat mengulangi instruksi untuk memenuhi kebutuhan. Misalnya, jika Anda melihat bahwa instruksi “hindari konten berbahaya” menyebabkan model menjadi terlalu berhati-hati atau menghindari topik yang lebih luas dari yang dimaksudkan, Anda dapat membuat instruksi lebih spesifik, seperti “hindari diskusi tentang penggunaan narkoba ilegal”. Baca juga: Gemini Kini Tersedia di BigQuery, Bisa Apa Saja? Namun, system instructions memiliki batasan sebagai berikut: Lebih rentan terhadap zero-shot dan teknik jailbreak rumit lainnya. Menyebabkan model menjadi terlalu berhati-hati pada topik-topik yang tidak jelas. Dalam beberapa situasi, system instruction yang rumit untuk keselamatan dapat secara tidak sengaja memengaruhi kualitas keluaran secara keseluruhan. Evaluasi konfigurasi keamanan Anda Photo Credit: Freepik Anda dapat membuat set evaluasi dan menguji performa model dengan konfigurasi spesifik Anda sebelumnya. Disarankan untuk membuat set yang berbahaya dan tidak berbahaya secara terpisah, sehingga Anda dapat mengukur seberapa efektif konfigurasi Anda dalam menangkap konten yang berbahaya dan seberapa sering konfigurasi tersebut secara tidak tepat memblokir konten yang tidak berbahaya. Baca juga: Model Gemini 2.0 Kini Tersedia untuk Umum Fitur Vertex AI berperan dalam memastikan penggunaan Gemini yang aman dan bertanggung jawab. Pendekatan terbaik bergantung pada persyaratan khusus dan toleransi  risiko Anda. Untuk memulai, Anda bisa melihat dokumentasi tentang content filters dan system instructions ini. Kemudahan Vertex AI ini bisa Anda nikmati cukup dengan berlangganan Google Cloud yang kini telah tersedia di EIKON Technology. Untuk informasi lebih lanjut, silakan hubungi kami di sini!

Scroll to Top