AGV Filosunu Pekiştirmeli Öğrenmeyle Yönetmek: PPO Vakası
Kural tabanlı sevkiyattan pekiştirmeli öğrenmeye geçişin gerçek bir vaka üzerinden hikâyesi: hat duruşları nasıl %98.6 azaldı, filo kullanımı nasıl arttı.
AGV filoları çoğu tesiste hâlâ sabit kurallarla yönetiliyor: en yakın araç, en eski görev veya basit öncelik sıraları. Bu yaklaşım sakin bir sahada işe yarar; ama peak yükte, değişken talep altında hızla tıkanır.
Sorunun Gerçek Yüzü
Saha dinamiktir: hat ihtiyacı, AGV konumu, batarya seviyesi, trafik ve şarj istasyonu uygunluğu sürekli değişir. Kural tabanlı bir sistem bu değişkenliği önceden kodlanmış senaryolarla karşılamaya çalışır — ama gerçek hayat senaryo sayısından fazladır.
Bir üretim tesisinde yaşadığımız somut tablo: vardiya başına ortalama 21 hat durması, filo kullanımı %72, ortalama şarj süresi 70 dakika. Kural tabanlı sistem sınırlarına dayanmıştı.
PPO Neden Bu Problem İçin Uygun?
Proximal Policy Optimization (PPO), pekiştirmeli öğrenmenin dengeli bir varyantıdır: keşif ile kararlılık arasında iyi bir denge kurar, bu da üretim ortamı gibi hata toleransının düşük olduğu senaryolarda önemlidir. Model, her sevkiyat kararını AGV konumları, batarya seviyeleri, görev öncelikleri, hat ihtiyacı ve trafik verisini birlikte değerlendirerek verir.
Sahaya Çıkmadan Test Etmek
Karar motoru doğrudan sahada değil, fizik tabanlı bir simülasyon ve Unity dijital ikiz ortamında geliştirildi. AGV filosu, hatlar, görev noktaları ve şarj istasyonları sanal ortamda modellendi; farklı senaryolar sahaya müdahale etmeden test edildi. Bu, hem güvenlik hem de geliştirme hızı açısından kritikti.
Sonuçlar
Dört ay süren geliştirme ve devreye alma sürecinin ardından — tam vaka detayına buradan bakabilirsiniz — hat durmaları vardiya başına ~21'den ~0.3'e indi (%98.6 azalma), aktif AGV oranı %72'den %91'e yükseldi, ortalama şarj süresi 70 dakikadan 50 dakikaya düştü ve aynı filo kapasitesiyle tamamlanan görev sayısı %39 arttı.
Güvenlik Sınırı
Modelin özgürce karar verdiği bir kara kutu değil bu. Güvenlik ve operasyon kurallarının dışına çıkan her durumda sistem klasik, önceden tanımlı güvenli karara döner. Yapay zekâ optimizasyonu sağlarken, saha güvenliği ve operasyonel süreklilik korunuyor; her karar günlüklenir ve baseline ile karşılaştırılabilir durumda kalıyor.