Haber

Google DeepMind, Gemini'de Ajan Bazlı Video Anlama Yeteneklerini Tanıttı

Google DeepMind, video anlama odaklı yeni ajan bazlı yeteneklerini Gemini yapay zeka modeli için tanıttı. Bu yeni özellikler, Gemini'nin görsel içeriği yorumlamasını, zamansal dizileri anlamasını ve bu kavrayışa dayalı anlamlı eylemler gerçekleştirmesini sağlayarak pasif video analizinin ötesine geçmesine olanak tanıyor.

Ajan bazlı yaklaşım, modellerin içeriği basitçe tanımladığı veya sınıflandırdığı geleneksel video analizinden, video bağlamını değerlendirebilen ve buna uygun şekilde yanıt verebilen sistemlere doğru bir geçişi temsil ediyor. Bu gelişme, Gemini'nin mevcut çoklu modalite güçlü yönleri üzerine inşa ediliyor ve yeteneklerini dinamik, zamana dayalı içeriklere genişletiyor.

Duyuru, ajan bazlı video anlamanın otomatik video düzenlemeden, video içeriğini gerçek zamanlı olarak gezinebilen ve yorumlayabilen etkileşimli yapay zeka asistanlarına kadar uzanan uygulamaları destekleyebileceğini vurguluyor. DeepMind, sistemin uzun video dizilerinde tutarlılığı korurken önemli olayları ve eylemleri tespit edebildiğini belirtti.

Bu çalışma, yapay zeka geliştirme sürecinde modellerin yalnızca girdileri işlemek yerine bunları aktif olarak değerlendirebildiği ve anlayışlarına dayalı uygun yanıtları veya eylemleri belirleyebildiği daha geniş bir trendi yansıtıyor.

Kaynaklar