Model tersebut mendukung input multimodal, termasuk teks, gambar, dan video, serta mampu menghasilkan video 1080p berkualitas tinggi berdurasi 5 hingga 20 detik, lengkap dengan audio yang tersinkronisasi secara alami.

BEIJING, TIONGKOK – Media OutReach Newswire – 17 September 2026 – HiDream.ai, sebuah perusahaan AI yang berspesialisasi dalam model fondasi dan AI generatif, mengumumkan peluncuran HiDream-O1-Video-1.0, atau HiDream V1, model generasi video omnimodal native miliknya.

Dirancang dengan pemahaman yang lebih mendalam tentang maksud kreatif dan fisika dunia nyata, HiDream V1 mendukung input multimodal termasuk teks, gambar, dan video. Model ini dapat menghasilkan video 1080p dengan fidelitas tinggi berdurasi 5 hingga 20 detik, dengan perencanaan naratif yang ditingkatkan, konsistensi karakter, kelayakan fisik, dan sinkronisasi audiovisual.

Dalam debutnya di dua benchmark internasional independen, HiDream V1 menempati peringkat No. 4 secara global pada Artificial Analysis Image to Video Leaderboard (With Audio) dan No. 8 pada Arena.ai Image-to-Video leaderboard, menempatkannya di antara model generasi video terkemuka di dunia.

Debut Kuat di Dua Benchmark AI Internasional

Artificial Analysis secara independen mengevaluasi model AI terkemuka melalui pengujian benchmark yang terstandarisasi dan dapat direproduksi. Arena.ai menggunakan perbandingan head-to-head anonim dan voting pengguna untuk menilai output model. Bersama-sama, kedua platform tersebut memberikan perspektif pihak ketiga tentang performa model berdasarkan pengujian terstandarisasi dan preferensi pengguna dunia nyata.

Hasil HiDream V1 menunjukkan daya saingnya di dimensi-dimensi kunci termasuk kualitas visual, kepatuhan terhadap prompt, kualitas gerakan, koherensi naratif, dan koordinasi audiovisual.

Pasar generasi video AI global telah menjadi semakin kompetitif, dengan model-model yang dikembangkan oleh tim China—termasuk Seedance dan MiniMax H3—mempertahankan posisi kuat di papan peringkat internasional. Debut papan atas HiDream V1 semakin memperluas kehadiran China di antara model generasi video terkemuka di dunia.

“Generasi model video berikutnya tidak akan didefinisikan semata-mata oleh resolusi yang lebih tinggi atau durasi yang lebih panjang,” kata Yao Ting, Chief Technology Officer HiDream.ai. “Yang penting adalah apakah sebuah model dapat benar-benar memahami maksud kreator dan bagaimana objek, aksi, dan suara berinteraksi di dunia nyata. HiDream V1 dirancang sejak awal untuk merepresentasikan teks, video, dan audio dalam kerangka kerja yang terunifikasi. Tujuan kami adalah membawa generasi video melampaui sekadar terlihat tajam dan bergerak mulus menuju pemahaman instruksi, mempertahankan performa yang koheren, dan menjaga suara selaras dengan visual. Performanya di dua benchmark internasional independen memberikan validasi yang menggembirakan atas pendekatan omnimodal native kami.”

Peningkatan dalam Fidelitas Visual, Koherensi Naratif, dan Konsistensi Karakter
HiDream V1 memperkenalkan perbaikan yang luas dalam rendering fidelitas tinggi, kesinambungan naratif, dan konsistensi karakter. Alih-alih mengoptimalkan hanya untuk kualitas frame individual, model ini dirancang untuk mempertahankan koherensi di seluruh urutan video.

Setelah karakter, emosi, motivasi, dan aturan fisik ditempatkan dalam urutan yang berkelanjutan, setiap elemen dapat mempengaruhi yang lain. Oleh karena itu, HiDream menggunakan kerangka kerja teknis yang dibangun di sekitar tiga tahap: perencanaan terlebih dahulu, diikuti oleh generasi bersama, dan kemudian penyelarasan melalui sinyal reward multimodal.

Dalam pendekatan ini, model pertama-tama merencanakan naratif dan status karakter pada tingkat global. Kemudian secara bersama-sama membatasi visual, gerakan, dan semantik selama generasi, sebelum menggunakan sinyal reward multimodal untuk menyelaraskan kualitas visual, kesinambungan, dan kelayakan fisik.

Arsitektur Omnimodal Native untuk Pemahaman Maksud dan Fisika yang Lebih Baik
Tantangan utama dalam generasi video AI adalah beralih dari kualitas frame individual ke pemahaman yang lebih luas tentang instruksi kompleks, gerakan berkelanjutan, dan aturan yang mengatur dunia fisik.

Prompt pengguna sering mengandung beberapa lapisan informasi, termasuk karakter, aksi, latar, arahan kamera, dialog, dan suara. Untuk menangani persyaratan ini secara lebih efektif, HiDream V1 menggabungkan pemahaman dan perencanaan maksud multimodal. Sebelum generasi dimulai, model menyusun permintaan pengguna di seluruh elemen seperti durasi shot, latar, status karakter, gerakan, ekspresi wajah, komposisi, gerakan kamera, dialog, dan suara ambien.

Melalui alur kerja “memahami, merencanakan, dan menghasilkan” ini, HiDream V1 merencanakan pengembangan naratif dan status karakter pada tingkat global, sekaligus mengoordinasikan visual, gerakan, semantik, dan audio selama generasi. Hal ini dirancang untuk meningkatkan kelengkapan konten, konsistensi karakter, dan kesinambungan antar shot.

Penalaran fisik adalah kemampuan inti lain dari HiDream V1. Model ini menggabungkan faktor-faktor seperti gravitasi, inersia, tumbukan, deformasi, material, pencahayaan, dan kesinambungan spasial ke dalam proses generasi. Akibatnya, pergerakan objek, aksi karakter, dan respons lingkungan dapat lebih mencerminkan perilaku dunia nyata.

Pendekatan ini membawa generasi video melampaui mereproduksi penampilan visual dan menuju pemodelan bagaimana dunia dinamis beroperasi seiring waktu.

Durasi Video yang Adaptif terhadap Konten

Sebagian besar model generasi video saat ini mengharuskan pengguna untuk menentukan durasi tetap terlebih dahulu, memaksa konten agar sesuai dengan jendela waktu yang telah ditentukan. Hal ini dapat menyebabkan jeda yang tidak perlu setelah suatu aksi berakhir atau penggunaan gerakan lambat untuk mengisi sisa waktu.

HiDream V1 sebaliknya menggabungkan durasi ke dalam proses perencanaan naratifnya. Dalam rentang 5 hingga 20 detik, model dapat menentukan panjang video yang sesuai berdasarkan bagaimana suatu peristiwa berlangsung, berapa lama suatu aksi membutuhkan waktu untuk diselesaikan, dan pacing yang dibutuhkan oleh konten.

Kemampuan ini bukan sekadar menambah atau menghapus frame. Ini dirancang untuk membuat durasi melayani naratif, menghasilkan pacing yang lebih alami dan urutan yang lebih lengkap. Pengguna dapat fokus pada mendeskripsikan peristiwa dan hasil yang diinginkan, sementara model merencanakan struktur temporal yang sesuai.

Pemodelan Bersama Teks, Video, dan Audio

Sistem generasi video AI konvensional sering mengikuti alur kerja bertahap di mana visual dihasilkan terlebih dahulu dan suara ditambahkan setelahnya. Hal ini dapat menyebabkan ketidaksesuaian antara gerakan bibir, aksi fisik, suara ambien, dan efek suara.

HiDream V1 menggunakan arsitektur omnimodal native untuk memodelkan sinyal teks, video, dan audio secara bersama-sama. Ketiga modalitas saling membatasi dan menginformasikan dalam satu proses generasi. Gerakan visual mempengaruhi timing suara, dialog dan efek suara berkontribusi pada nada emosional suatu adegan, dan panduan teks mengarahkan proses generasi sepanjang waktu.

Pendekatan terunifikasi ini dirancang untuk meningkatkan sinkronisasi across performa karakter, perubahan lingkungan, dan aksi fisik.

Selama pasca-pelatihan, HiDream menggunakan Diffusion Reinforcement Learning dan model reward multimodal yang selaras dengan persepsi manusia dan preferensi estetika. Konten yang dihasilkan dievaluasi di berbagai dimensi, termasuk kualitas visual, semantik, gerakan, kelayakan fisik, dan suara, membantu meningkatkan konsistensi dan realisme secara keseluruhan.

Melengkapi Portofolio Model Dunia Omnimodal Native HiDream

HiDream V1 bukan model yang berdiri sendiri. Ini adalah komponen inti dari strategi model dunia omnimodal native HiDream.

Dibangun di atas fondasi UiT yang terunifikasi, atau Unified Transformer, portofolio perusahaan kini terdiri dari empat keluarga model utama:

  • HiDream-O1-Image, untuk pemahaman dan generasi gambar;
  • HiDream-O1-Video, untuk generasi konten dinamis dan penceritaan temporal;
  • HiDream-O1-World, untuk simulasi lingkungan 3D dan interaksi real-time; dan
  • HiDream-O1-Embodied, untuk penalaran spasial, perencanaan aksi, dan umpan balik dalam AI yang terwujud.

Daripada beroperasi sebagai empat tumpukan teknologi yang terpisah, model-model ini dirancang untuk berkembang dari arsitektur terunifikasi yang sama. Bersama-sama, mereka mencakup pemahaman spasial, pemodelan temporal, interaksi 3D, dan aksi yang terwujud, menciptakan sistem terintegrasi untuk mempersepsi, memahami, menghasilkan, berinteraksi dengan, dan bertindak atas dunia fisik.

Model-model HiDream sebelumnya telah mencapai hasil terkemuka di beberapa benchmark independen. HiDream-O1-Image 1.5, versi komersial dari model gambar perusahaan, menempati peringkat No. 2 secara global dan No. 1 di antara model China pada leaderboard text-to-image Artificial Analysis, sementara edisi open-source-nya juga mencapai No. 2. HiDream-O1-World menempati peringkat No. 1 secara keseluruhan pada WBench, sebuah benchmark untuk model dunia interaktif. HiDream-O1-Embodied mencapai hasil peringkat pertama dalam kategori adaptasi gangguan dan penalaran spasial di RoboColiseum.

“Kami tidak membangun empat lini produk model yang terisolasi,” kata Dr. Mei Tao, pendiri dan CEO HiDream.ai. “Kami membangun sistem omnimodal native yang berbagi fondasi teknis terunifikasi dan terus berkembang menuju pemahaman yang lebih dalam tentang dunia nyata. Kompetisi di antara generasi model fondasi berikutnya akan bergantung tidak hanya pada peningkatan kemampuan individu, tetapi juga pada apakah modalitas yang berbeda dapat memahami, menghasilkan, dan berinteraksi dalam arsitektur terunifikasi.”

Dari memahami dan menghasilkan dunia hingga mensimulasikan dan bertindak di dalamnya, peluncuran HiDream V1 melengkapi bagian kunci dari portofolio model dunia omnimodal native HiDream.

HiDream Menyelesaikan Pendanaan Seri C+

Bersamaan dengan peluncuran HiDream V1, HiDream mengumumkan penyelesaian putaran pendanaan Seri C+ yang didukung oleh New Micro Capital, Jiaozi Capital, dan ICBC Capital. Hasilnya akan mendukung penelitian dan pengembangan model omnimodal native, iterasi produk, infrastruktur komputasi AI, dan perluasan aplikasi industri.

New Micro Capital didirikan bersama oleh Shanghai New Micro Technology Group, Shanghai Science and Technology Venture Capital Group dan tim manajemennya. Perusahaan ini mengelola aset hampir RMB 10 miliar.

Sebagai unit venture capital korporat dari New Micro Technology Group, New Micro Capital memperluas investasinya di kecerdasan buatan. Dengan memanfaatkan kemampuan industri grup dalam manufaktur sirkuit terintegrasi khusus, perusahaan ini berupaya memajukan kolaborasi di seluruh infrastruktur AI, teknologi model, dan aplikasi pengguna akhir.

Jiaozi Capital adalah platform investasi ekuitas yang didukung negara dan dimiliki sepenuhnya di bawah Chengdu Jiaozi Financial Holding Group. Perusahaan ini berfokus pada kecerdasan buatan dan sektor teknologi strategis lainnya, menggunakan modal jangka panjang dan sumber daya industri untuk mempercepat komersialisasi teknologi dan pengembangan ekosistem.

Dengan peluncuran HiDream V1, strategi model dunia omnimodal native HiDream bergerak dari peta jalan teknis menuju sistem terintegrasi yang didukung oleh fondasi terunifikasi, portofolio model yang terkoordinasi, dan kemampuan produk yang dapat diterapkan.

Ketersediaan

HiDream V1 saat ini dalam pengujian internal dan diperkirakan akan tersedia dalam waktu dekat. Pengguna dapat mempelajari lebih lanjut di: https://hiharness.ai/

Tentang HiDream.ai

HiDream.ai adalah perusahaan kecerdasan buatan (artificial intelligence) yang berfokus pada AI generatif dan model dunia omnimodal asli (native omnimodal world models). Dibangun di atas arsitektur UiT yang terpadu, portofolio model perusahaan ini mencakup pembuat gambar (image generation), pembuat video (video generation), simulasi dunia interaktif, dan kecerdasan berwujud (embodied intelligence). HiDream bertujuan untuk mengembangkan sistem AI yang mampu memahami, menghasilkan, mensimulasikan, dan bertindak di dunia nyata.

Penyangkalan Papan Peringkat: Peringkat yang dikutip dalam siaran pers ini mencerminkan hasil yang tersedia untuk umum pada saat publikasi dan dapat berubah seiring diperbaruinya model yang berpartisipasi, data evaluasi, atau metodologi platform.