Bir modelin boyutunu ve hesaplama maliyetini azaltırken performansını mümkün olduğunca koruma teknikleri bütünü.
Model sıkıştırma (model compression), bir yapay zeka modelinin boyutunu, bellek kullanımını ve hesaplama maliyetini azaltırken performansını mümkün olduğunca koruma amacı taşıyan bir teknikler bütünüdür. Üç ana yaklaşım öne çıkar: nicemleme (quantization), modelin ağırlıklarını normalde kullanılan yüksek hassasiyetli sayı formatları yerine daha düşük hassasiyetli formatlarla (8-bit veya 4-bit tam sayılar gibi) temsil ederek bellek ve hesaplama tasarrufu sağlar; budama (pruning), modelin performansına çok az katkı sağlayan bağlantıları ve nöronları çıkararak ağı seyrekleştirir; bilgi damıtma (knowledge distillation) ise büyük ve güçlü bir "öğretmen" modelin bilgisini, çok daha küçük bir "öğrenci" modele, öğretmenin çıktılarını taklit ettirerek aktarır.
Model sıkıştırmanın önemi, en güçlü modellerin genellikle devasa bellek ve hesaplama kaynağı gerektirmesinden, ancak gerçek dünya uygulamalarının çoğu zaman mobil telefonlar, IoT cihazları veya sınırlı bulut kaynakları gibi kısıtlı ortamlarda çalışmak zorunda olmasından gelir. Sıkıştırılmış bir model, akıllı telefonlarda çevrimdışı çalışabilen sesli asistanlardan, düşük gecikmeli gerçek zamanlı uygulamalara kadar pek çok senaryoyu mümkün kılar; günümüzde açık kaynak büyük dil modellerinin nicelleştirilmiş versiyonlarının tüketici donanımlarında çalıştırılabilmesi, büyük ölçüde bu tekniklerin olgunlaşması sayesindedir.
ZncLabs temel özellikler için zorunlu çerezleri, isteğe bağlı analizleri ise yalnızca onayınızla kullanır. Ayrıntılar için Gizlilik sayfasını inceleyin.