Düşük Maliyetli Token Üretimi İçin Pratik Rehber
Konuya bakış InfoQ Ana Sayfası Sunumlar Dünyanın En Ucuz Tokenlarını Üretmek: Bir Nasıl Yapılır Kılavuzu Dünyanın En Ucuz Tokenlarını Üreten Yapay Zeka, ML ve Veri Mühendisliği: Bir Nasıl Yapılır Kılavuzu Okuma listesi Sunum Hızını Görüntüle: İndir…


Konuya bakış
InfoQ Ana Sayfası Sunumlar Dünyanın En Ucuz Tokenlarını Üretmek: Bir Nasıl Yapılır Kılavuzu Dünyanın En Ucuz Tokenlarını Üreten Yapay Zeka, ML ve Veri Mühendisliği: Bir Nasıl Yapılır Kılavuzu Okuma listesi Sunum Hızını Görüntüle: İndir 30:14 Özet Meryem Arık, yüksek hacimli, gerçek zamanlı olmayan iş yükleri için düşük maliyetli LLM çıkarım mimarileri tasarlamaya yönelik stratejileri tartışıyor.
Yazılım mimarlarının ve mühendislik liderlerinin, donanım, çıkarım çalışma süreleri, spekülatif kod çözme ve akıllı kuyruk yeniden sıralaması arasında kritik ödünler vererek, büyüklük sırasına göre maliyet düşüşlerini nasıl başarabileceklerini açıklıyor. Bio Meryem Arık, kendi kendine barındırılan yapay zeka çıkarım platformu Doubleword’ün kurucu ortağı ve CEO’sudur.
Oxford Üniversitesi mezunu olan Meryem, Teorik Fizik ve Felsefe okudu. TEDx ve QCon da dahil olmak üzere önde gelen konferanslarda sık sık konuşuyor ve çıkarım teknolojisi ve kurumsal yapay zeka hakkındaki içgörülerini paylaşıyor. Meryem, yapay zeka alanına yaptığı katkılardan dolayı Forbes 30 Yaş Altı 30 ödülüne layık görüldü. Konferans hakkında Yazılım dünyayı değiştiriyor.

Nasıl işliyor?
QCon San Francisco, geliştirici topluluğunda bilginin ve yeniliğin yayılmasını kolaylaştırarak yazılım geliştirmeyi güçlendirir. Uygulayıcı odaklı bir konferans olan QCon, ekiplerindeki yeniliği etkileyen teknik ekip liderleri, mimarlar, mühendislik direktörleri ve proje yöneticileri için tasarlanmıştır.
Transkript Meryem Arık: Çoğu şirket kendi işlerine fazla para ödüyor Çıkarım yığınlarının neye benzediği ve çıkarım yığınlarının kullanım durumu öncelikleriyle eşleşip eşleşmediği konusunda yeterince derinlemesine düşünmedikleri için, bazen en yüksek token kullanım durumlarından bazıları için bir büyüklük sırası olan 2 ila 5 kat arası çıkarımlar.
Bugün, tek amacınız mümkün olan en düşük maliyetle token üretmek olduğunda, çıkarım sistemlerini sıfırdan tasarlamak için gerekenleri anlatacağım. Bu tür bir odaklanma, popüler genel amaçlı kurulumlardan nasıl daha iyi performans gösterebilir? Sanırım söylemem gereken ilk şey, Türk olan babam sayesinde inanılmaz derecede ucuz olduğumdur. Asla pazarlık yapmadan hiçbir şey satın almam.
Pratik değerlendirme
Doubleword’de yaptığımız şey bir çıkarım şirketi olmamızdır. Özellikle son 6 ila 12 ay içinde karşılaştığımız en yüksek token üreten kullanım durumlarından biri ve oldukça hızlı bir şekilde büyüyen, çok sayıda token üreten gerçek zamanlı olmayan kullanım durumlarıdır. Nasıl daha ucuz tokenler üretebileceğimizi düşünerek çok zaman harcıyoruz ve bundan öğrendiklerimi sizin için paylaşacağım.
Çıkarım Takasları ve Token Ekonomisi Çıkarım ekonomisini ve tokenları ücretlendirme konusunda nasıl düşündüğümüzü oluşturmak için biraz zaman ayıracağım. Çıkarım, çoğu şey gibi bir değiş-tokuş oyunudur. Gerçekten üçünden yalnızca ikisine sahip olabilirsiniz ve bu da düşük gecikme arasındadır, yani jetonlarımı ne kadar hızlı üretebilirim? jetonlarımın maliyeti ve ardından aldığım jetonların kalitesi.
Bu örneklerin her birinin neye benzediğini size açıklayacağım. Maliyetten ödün vereceğimi söyleyebilirim. Maliyet konusuna girmeyeceğim. O zaman bu değiş tokuşu nasıl yapacaksınız? Düşük parti boyutunda çalıştırmak, çok pahalı donanımlar kullanmak gibi şeyler yapacağım. Daha fazla gecikme optimize edilmiş çıkarım optimizasyonu yapardım.
Nelere dikkat edilmeli
Bu, kodlama asistanlarının çok popüler olduğu bazı kullanım durumları için gerçekten faydalıdır. Başka bir örnek ise çok düşük gecikmeli, yüksek kaliteli çıktılarla ilgilenebileceğiniz sohbet robotlarıdır. Model kalitesinden ödün vermek istediğim yerde başka bir seçim yapabilirim. Yanıtlarımın gerçekten hızlı olmasını ve ucuz olmasını istiyorum. Daha küçük bir model kullanabilirim. Modeli nicemleyebilirim.
Bunun gerçek zamanlı kullanım durumları korkuluklar veya bir yönlendirme modeli olabilir veya aslında burada bulamadım ama cihaz üzeri modeller de olabilir. Eğer gerçekten cihazda yerel olarak bir şey çalıştırmak istersem, bu değiş tokuşu yapardım. İlgilendiğim ve bugün hakkında konuşacağım takas, gecikmeyi umursamayacağım zamandaki bu takastır.
Benim ilgileneceğim tek şey model kalitesinin yüksek olması ve maliyetinin çok düşük olması. Bu takası nasıl yapıyorsunuz? Bu konuşmada bundan daha fazla bahsedeceğim. Partiye özel optimizasyonlar, sıranın yeniden düzenlenmesi, akıllı planlama gibi şeyler yapardım. Benim için heyecan verici olan şey bu Bu aslında oldukça popüler bir değiş-tokuş. Kullanım örnekleri arasında veri işleme ve çevrimdışı aracılar yer alır.
Çok uzun, karmaşık bir iş akışını gerçekleştirmek için gece boyunca çalışan bir temsilcim var. Özetleme, veri etiketleme, veri üretme. İnce ayar veya RL yapıyorsam sentetik veri üretimi. Bu kovaya düşen pek çok kullanım durumu var.
Heyecan verici olan şey, modeller daha iyi hale geldikçe, bu gruptaki kullanım senaryolarının sayısı da artmaya devam edecek, çünkü modellerin mümkün olan her adımda döngüde bir insana ihtiyaç duymadan bağımsız çalışabileceğine güvenebiliriz. Bugün bahsettiğimiz takas budur. Çıkarım alanında, bu düşük gecikmeli kullanım senaryolarına çok fazla enerji harcandı. Maliyetim ile gecikmem arasında bir denge alanınız var.
Gerçekten ultra düşük gecikmeli çıkarım yaptığımda Cerebras ve Groq gibi bunu gerçekten iyi sağlayan sağlayıcılar var. Bunu yapma şekli ise özel donanımdır. Daha sonra günlük chatbot tarzı çıkarım yapıyoruz, vLLM, SGLang burada popüler çerçevelerdir. Ayrıca çıkarım sağlayıcıların çoğu bu oldukça düşük gecikmeli alanın etrafında oturuyor.
Daha sonra, bu çok ucuz, yüksek gecikme süreli iş yükleri için araştırma ekibimizin son altı aydan bir yıla kadar odaklandığı nokta burasıdır. Daha Ucuz Tokenlar Yapmak Bu konuşmayı yapılandırma yöntemim şu: çok hızlı tokenlarla başlayacağım. ben konuşacağım Çok hızlı jetonlar elde etmek için ne gibi tavizler verdiğimizi biliyoruz. O zaman söyleyin, bu hızlı tokenlardan çok ucuz tokenlara nasıl geçeceğiz?
Yaptığımız ödünleşim farklılıkları nelerdir? Birisi bir sonraki slaydın referansını alırsa çok mutlu olurum, ancak Jeremy Clarkson Top Gear’dan Monty Python’a geçeceğim, bunun için pazarlık yapmamız gerekiyor. Bu referansları gerçekten alan var mı, yoksa çok mu İngilizce? ABD’ye uygun bir eşdeğerim var. Her ihtimale karşı bir yedeğim vardı.
Bu gerçekten ucuz jetonlarla lüks arabalardan The Art of the Deal’a geçeceğiz. Gecikme konusunda sağlayıcıların liderlik tablosuna bakarak başlayalım. Bu konuşmanın amacı doğrultusunda sadece bir modeli ele alacağım, o da gpt-oss-120 milyar. Bu, birçok popüler çıkarım sağlayıcısının gecikmesini, verimini ve maliyetini karşılaştıran Yapay Analiz’den edinilebilen halka açık bir kıyaslamadır.
Bu konuda oldukça geniş bir aralık olduğunu görebilirsiniz. Örneğin, çıkarım için şu anda Cloudflare’i kullanmanızı tavsiye etmem. Burada Cerebras’ın çok hızlı tokenler ürettiğini görebilirsiniz. Çıkış hızı olan başka bir grafik alabilirsem, Cerebras’ın hemen hemen herkesten çok daha hızlı olduğunu görebilirsiniz.
Cerebras, çok hızlı ama oldukça pahalı tokenlar arasında geçiş yapmanın mükemmel bir örneği olarak başlayacağım yer. Cerebralar gerçekten hızlı jetonlar üretiyor, ancak Ayrıca burada gerçekten pahalı tokenlar ürettiklerini de not edebilirsiniz. Gerçekten pahalı jetonlar yapıyorlar. Öte yandan aşağılara indikçe biraz daha yavaş olan bu tokenlar da biraz daha ucuzluyor.
Optimizasyon Katmanları Hakkında konuşacağım birkaç optimizasyon katmanı var. Öncelikle donanımdan bahsedeceğim. Cerebras’ın aslında en pahalı ve aynı zamanda en hızlı token olması şaşırtıcı değil. Donanım düzeyinde yapabileceğimiz ödünleşimlerden bahsedeceğim. Model seviyesinde bir şeyler yapabilirsiniz ama bundan bahsetmiyorum çünkü sabit bir model olduğunu varsayıyoruz. Çalışma süresi hakkında konuşacağız.
Daha sonra planlama ve düzenleme hakkında konuşacağız. Tokenlarımızı çok daha ucuz hale getirmek için bu farklı seviyelerde optimizasyonlar yapabiliriz. 1. Donanım Donanımla başlayalım. Cerebras’ın gerçekten hızlı tokenler üretmesi hiç de şaşırtıcı değil çünkü benim ilgilendiğim değiş tokuşa göre tamamen farklı bir ödünleşim yaptılar. Onlar sanki süper hızlı olacağız ve umursadığımız tek şey bu.
Birim ekonomisi açısından aslında biraz daha iyi olan GPU’lara geçersem, GPU maliyetinde anında düşüş elde ettiğimi görebiliyorum. Çıkış tokenleri için bu tür 0,6 dolarlık bir oran sunan bir grup sağlayıcı var ve bunların çoğu yalnızca GPU’larda çalışıyor. Bunların hepsinin satıcı olduğunu belirtmek isterim r-tedarik edilen fiyatlardır ve bu nedenle onlara mutlaka güvenemezsiniz.
Örneğin, bu konuda bir grup sağlayıcının aslında zarara uğradığını biliyorum. Bunun yerine InferenceMAX by SemiAnalytics’ten bahsedebiliriz. SemiAnaliz’i duyan var mı? Gerçekten harika bir kaynak ve GPU’larla ilgileniyorsanız blogu almak veya blogu almak harika bir şey.
SemiAnalytics’in yaptığı şey, InferenceMAX adlı bu projeyi yayınlamalarıydı; burada bir dizi farklı GPU’yu karşılaştırdılar ve teorik olarak mümkün olan verim, gecikme ve maliyet değişimlerine baktılar. Bu SemiAnalytic InferenceMAX projesinden alınmıştır. Sadece donanımı taşıyarak, yani bu durumda, H100’den biraz daha yeni nesil donanım olan B200’e geçerek benzer bir gecikme elde edebiliyorum.
Ölçülen istek için gecikmem kabaca 4 saniye civarında, ancak maliyetim aslında yaklaşık %75 oranında düşüyor, bu da gerçekten önemli. Bunun nedeni aslında bu yeni GPU’ların daha iyi olmasıdır. Aynı gecikme süresi için daha fazla eş zamanlı istek çalıştırabiliyorum ki bu gerçekten çok etkili. Maliyetlerinizi düşürmeyi önemsiyorsanız, uygulaması çok kolay bir şey olarak en yeni nesil donanıma geçmeyi düşünün.
Neredeyse her zaman daha ucuzdur. Tamamen kullanabiliyorsanız neredeyse her zaman daha ucuz olduğunu unutmayın. Bu da önemli bir husus. İş yükünüz varsa diyelim çok sık büyük toplu iş yükleri çalıştırıyorsunuz ve bu GPU’yu zamanın yüzde 50’sinden fazlasını kullanabiliyorsunuz; eğer bulabilirseniz, neredeyse her zaman en yeni nesil GPU’lara geçmeye değer.
Yalnızca GPU’ları taşımaktan biraz daha gelişmiş bir teknik, ayrıştırılmış hizmettir. Yapay zeka çıkarımında önemli olan iki şey vardır. Floplar ve bant genişliği var. Flop’lar kodlama aşamanızda, bant genişliği ise kod çözme aşamanızda önemlidir. En solda bir sürü farklı GPU türü var. Bu aslında dahili olarak sahip olduğumuz bir şeyin ekran görüntüsü. Bir sürü farklı GPU türü ve bir sürü farklı sağlayıcı.
Bu GPU türlerinin tümü farklı özelliklere sahiptir. Bellek için farklı özelliklere sahiptirler. Floplar için farklı özelliklere ve bant genişliği için farklı özelliklere sahiptirler. Benim ilgilendiğim şey bu flopların ve bant genişliği sayılarının maliyete göre ne olduğu. Nereden alabileceğime kıyasla, dolar başına alabileceğim floplar nelerdir?
Örneğin, ayrılmış bir bulut sunucusu alırsam bunun, isteğe bağlı bir bulut sunucusuna sahip olduğumdan daha ucuz olacağını biliyorum. İyi oldukları farklı şeylere sahip farklı GPU’ların profillerini alabilirsiniz. Bazı GPU’lar kodlamada gerçekten iyidir, bazıları ise kod çözmede gerçekten iyidir.
Kodlamanızı bir tür GPU’da ve ardından kod çözme işleminizi başka bir GPU’da çalıştırmak için ayrıştırılmış sunumu kullanabilirsiniz. Eğer yakınlaştırırsam biraz daha fazla, bunlardan bazılarının dolar başına flop’lara ve dolar başına bant genişliğine diğer GPU’lara göre çok daha iyi olduğunu görebiliyorum. Daha sonra kodlamamı birinde diğerine çalıştırmayı seçebilirim.
Önceden doldurma, hesaplamaya bağlı olma eğilimindedir. Kod çözme işlemim belleğe bağlı olma eğilimindedir. Bu kombinasyonu denemeye karar verebilirim ve bu kombinasyonlar arasında bir karar verebilirim, aslında daha ucuz bir sistem üretebilir miyim? Bunun uygulanmasının son derece önemsiz olduğunu ve bunu sadece eğlence için yapmayacağımı belirtmek isterim.
Bu, eğer biraz uğraşabilirseniz, oldukça önemli maliyet tasarrufları elde edebileceğiniz bir şeydir. Belleğin iki GPU arasında taşınması önemsiz olmadığından bunun gecikmenizi yok ettiğini belirtmek isterim. Donanım düzeyinde ne yapabiliriz? Farklı GPU’ların farklı gecikme süreleri ve maliyet değişimleri vardır. Satıcının sağladığı jeton maliyetlerine karşı çok dikkatli olun.
Kendi kendine ev sahipliği yapıyorsanız, bunlar genellikle gerçek maliyetten oldukça farklıdır. İyi bir kullanım elde edebiliyorsanız, en yeni nesil GPU’ları kullanmalısınız. Ön doldurma ve kod çözme aşaması için farklı GPU’ları birleştirebileceğiniz, heterojen ayrıştırılmış sunum gibi gelişmiş teknikler vardır. 2. Çıkarım Motoru İkinci katman bu çıkarım motoru veya çalışma zamanı katmanıdır.
Şimdiye kadar, gecikmeyi maliyetle veya gecikmenin maliyetini dengelemek istiyorsanız yapabileceğiniz en önemli şey, parti boyutuyla oynamaktır. Yani şimdiye kadar , yapabileceğiniz en etkili şey. Bu, SemiAnalytics’in InferenceMAX makalesinden alınan bir grafiktir. Bu durumda elimde B200 var, bu yüzden sadece B200’ler arasındaki değiş tokuşa bakıyorum. X ekseninde gecikme var.
Y ekseninde milyon jeton başına maliyetim var. Çünkü bu odada hepimiz gerçekten ucuzuz, milyon token başına maliyeti elimizden geldiğince düşürmeye çalışıyoruz. Gecikmede bu darbeyi almakta sorun yok. Çıkarımın bir değiş-tokuş oyunu olduğunu söylediğimde, bu grafik gerçekten bunu özetliyor.
InferenceMAX’ın çalışma şekli, farklı paralellik kombinasyonlarını ve ardından GPU’ların eşzamanlı isteklerini test etmeleri ve bunu planlamalarıdır ve bu şekilde görünür. Bu eğrinin bir ucundaki iki ucunu alırsam, yani gecikmeyi çok önemsiyorsam, paralel çalışan sekiz GPU’m var gibi görünen bir kurulumla sonuçlanırım ve bununla yalnızca dört kullanıcıya hizmet verebilirim ki bu gerçekten çok fazla kullanıcı değil.
Milyon token başına maliyetimin bu kadar yüksek olmasının nedeni de bu, çünkü her kullanıcı iki GPU alıyor ki bu çok fazla. Eşzamanlı isteklerimi, yani parti büyüklüğümü 128’e yükseltirsem, o zaman çok daha ucuz bir token maliyeti elde edebilirim çünkü bu 128, GPU’yu diğer herkesle paylaşıyor.
Toplu iş boyutunun bu kadar etkili olmasının nedeni, bu kod çözme aşamasında ödediğiniz şeyin, her isteğin gerçek token üretimi olmamasıdır. Onlara
İlgili yazılar
- Git ve GitHub kullanımı için pratik rehber
- Geliştiriciler İçin SEO: Anahtar Kelimelerden Çok Site Hızı ve Deneyimi Önemli
Editörün Notu
Düşük maliyetli token üretiminde donanım ve yazılım optimizasyonlarını dengeli kullanmak, verimliliği artırırken bütçeyi korumanızı sağlar; bu yaklaşım 2026’da yapay zeka projelerinizin sürdürülebilirliğini destekler.
