Değerlendirmeler: Yapay zekâ denemelerinden güvenli üretime geçiş

Değerlendirmenin yapay zekâ denemeleri ile güvenilir, üretime hazır dağıtım arasındaki boşluğu nasıl kapattığını öğrenin.

Yönetici özeti

  • Temel modeller gelişmiş olsa da üretimde güvenle kullanımı mümkün kılan asıl değişim, disiplinli değerlendirme uygulamalarından kaynaklanıyor

  • İyi tasarlanmış değerlendirmeler; ürün yöneticilerinin, yapay zekâ yönetişimi liderlerinin ve CTO’ların yapay zekâ ajanlarını geniş ölçekte güvenle devreye almasına yardımcı olarak yapay zekâyı bağımsız bir oyuncaktan rekabet avantajına dönüştürür.

  • Bu güven, yapay zekâ ajanının davranışını gerçek iş bağlamınızı yansıtan kullanıcı sorguları, uç durumlar ve alana özgü senaryolarla değerlendirmekten doğar; “en iyi model budur” diyen herkese açık bir karşılaştırmalı değerlendirmeden değil

  • Amaç, bu güveni ölçülebilir sonuçlarla gerekçelendirmektir. Başarı; olgusal doğruluk, uygun üslup, hız veya maliyet verimliliği gibi iş ihtiyaçlarınız ve risk toleransınızla uyumlu, somut ve ölçülebilir ölçütlerle "iyi"yi tanımlamak demektir.

  • Değerlendirmeyi sisteminizin tamamına (ölçümleme, günlük kaydı, A/B testi, koruyucu önlemler) yerleştirip titizlik ile verimliliği dengeleyen ekipler, daha hızlı ve dayanıklı dağıtım yapabilir.

Çoğu işletme, çalışanlarının ChatGPT veya Gemini’yi denemesinden rahatsız olmaz. Ancak LLM’leri kritik iş akışlarında veya ortamlarda kullanmak çok daha az yaygındır.

Bunun nedenleri çoğu zaman haklıydı: Kalite tutarsızdı ve halüsinasyon ya da istenmeyen davranış riski, teknolojinin sağlayabileceği olası faydalara ağır basıyordu.

Risk ile fayda arasındaki bu denge, geçen yıl belirgin biçimde değişti. Bu değişimin bir bölümü temel modellerin performansındaki gelişmelere bağlanabilse de büyük kısmı değerlendirme (ya da “eval”) alanında artan disiplinden kaynaklanıyor. Değerlendirmeler, bizim ve müşterilerimizin geniş ölçekli, müşteriye dönük ajanları birkaç hafta içinde devreye almasını sağlayan güveni verir.

Bu kılavuz; değerlendirmelerin temel unsurlarını, bunların nasıl tasarlanıp uygulanacağını ve üretim senaryolarında nasıl işletileceğini açıklayacak.

Değerlendirmenin temelleri (1): Başarı nasıl görünür?

Değerlendirmenin amacı kusursuz bir model bulmak değil; modelinizin iş ihtiyaçlarınız, kullanıcı beklentileri ve kuruluşunuzun risk toleransıyla uyumlu davrandığına dair gerekçeli bir güven oluşturmaktır.

Her değerlendirme stratejisinin temelinde basit bir soru vardır: “İyi” nasıl görünür? Yanıt net ve somut olmalıdır. Bir kuruluş için “iyi”, katı toleranslar içinde olgusal doğruluk anlamına gelebilirken bir başkası için hız, maliyet verimliliği veya kendine özgü bir üslup öncelikli olabilir. Kullanılabilecek verilerden geçerli yasal yükümlülüklere kadar tabi olduğunuz her kısıt bu tanımı şekillendirir.

En önemlisi, 'iyi' kavramı gerçekten ölçebileceğiniz bileşenler içermelidir. Başarı faydalı finansal rehberlik sunmaksa faydalılık; olgusal doğruluk, uygun sorumluluk reddi beyanları, kişiselleştirilmiş akıl yürütme ve güvenli sınırlar gibi niteliklerle ifade edilmelidir. “İyi” ölçülebilir terimlerle tanımlandıktan sonraki soru, sonuçları nasıl analiz edip yorumlayacağınızdır. Değerlendirmeyi yalnızca kanaate dayalı kararlar vermekten çıkarıp bir yönteme dönüştüren, bu sonuçlara göre harekete geçmektir.

Değerlendirmenin temelleri (2): Girdiler, model davranışı ve metrikler

Her değerlendirme işlem hattı birbiriyle bağlantılı üç temele dayanır:

  1. Girdiler/Karşılaştırmalı değerlendirmeler: Genel performans için gerçek dünyayı temsil eden örnekler ve alan uygunluğunu sınamak için özenle hazırlanmış kurum içi veri kümeleri.

  2. Model Davranışı: Modelin nasıl çağrıldığı (getirmeyle zenginleştirilmiş üretim, özetleme, yapılandırılmış bilgi getirme, araç kullanımı).

  3. Metrikler: Performansı nasıl ölçüp yorumladığınız.

Girdiler, sisteminizin karşılaşacağı dünyayı temsil etmelidir. En anlamlı içgörüler gerçek örneklerden gelir: müşteri sorgularınız, finansal senaryolarınız veya sektöre özgü durumlarınız. Modelin kullanıcılarınızın ihtiyaç duyduğu nüansları gerçekten kavrayıp iş ihtiyacını karşılayıp karşılamadığını ancak bunlarla test ederek anlayabilirsiniz.

Modele nasıl prompt verildiği, getirme veya araç kullanımının nasıl düzenlendiği ve bağlamın nasıl aktarıldığı gibi davranış unsurları, modelin kendisi kadar önemlidir. Aynı iki model, devreye alınma biçimlerine göre çok farklı davranabilir. Bu nedenle bu katman, değerlendirme tasarımınıza dâhil edilmelidir.

Son olarak metrikler var. Sayılar tek başına nadiren bütün resmi gösterir ancak doğru seçilmiş metrikler sistem davranışını yorumlanabilir kılar. Gecikme, doğruluk, güvenlik, tutarlılık, yanlılık, maliyet ve kullanıcı memnuniyeti birlikte üretimdeki sistemin çok boyutlu bir görünümünü oluşturur. Asıl ustalık, projenizin veya işletmenizin KPI’larıyla uyumlu ve kullanıcılarınız için en önemli nitelikleri görünür kılan metrikleri seçmektir. Daha basit metrikler çoğu zaman daha doğru ve daha düşük maliyetlidir; kötü metrik seçimleri ise ekipleri yanıltabilir. Metrik seçimine şöyle yaklaşabilirsiniz:

İyi metrik seçimlerine örnekler:

  • Müşteri hizmetleri sohbet botu: İlk temasta çözüm oranı (kullanıcının sorunu üst kademeye aktarılmadan çözüldü mü?), ortalama işlem süresi, kullanıcı memnuniyeti puanı, insan ajanlara aktarım oranı

  • Finansal araştırma aracı: Atıf doğruluğu (uygun kaynak gösterilen iddiaların yüzdesi), referans doğrularla teyit edilen olgusal kesinlik, getirme alaka düzeyi (doğru belgeleri buldu mu?), alan uzmanlarınca puanlanan akıl yürütme tutarlılığı

  • Kod üretme asistanı: Söz dizimi doğruluğu, testleri geçme oranı, güvenlik açığı sayısı, çalışan çözüme ulaşma süresi

Kötü metrik seçimlerine örnekler:

  • Kalitenin göstergesi olarak yalnızca yanıt uzunluğunu kullanmak (daha uzun ≠ daha iyi)

  • Doğruluktan verilen ödünleri dikkate almadan hızı ölçmek

  • Model güven puanlarını gerçek doğrulukla karşılaştırıp teyit etmeden izlemek

  • Kullanıcıya dönük doğrulama yapmadan yalnızca modelin içsel şaşkınlık değerine güvenmek

Kaçınılması gereken yaygın metrik hataları:

  • Çelişen metrikler: Aradaki ödünleşimi kabul etmeden hız ve kapsamlılık için aynı anda optimizasyon yapmak

  • Karşılaştırmalı değerlendirmelere aşırı uyum: Test kümesinde %95 başarı elde ederken gerçek kullanıcılar farklı davrandığı için üretimde başarısız olmak

Sıkı düzenlemelere tabi bir finansal hizmetler müşterimizin derin araştırma çözümünde doğruluk en önemli öncelikti. Uzmanlarca hazırlanmış soru-cevap veri kümelerini araçlarla üretilen veri kümeleriyle birleştirdik. Böylece kesinliği, sistemin doğru araçları seçme ve doğru bilgiyi getirme becerisini ölçerek doğruluk ve akıl yürütme kalitesine dengeli bir bakış elde ettik. Kilit nokta birden çok boyutu ölçmekti: olgusal doğruluk (uzman teyidi), getirme kalitesi (ilgili belgelerde kesinlik/duyarlılık) ve akıl yürütme tutarlılığı (mantıksal akışın yapılandırılmış değerlendirmesi).

İncelikli kalite değerlendirmesinde LLM hakem ne zaman kullanılmalı?

LLM hakem yaklaşımı, değerlendirme için ikinci bir yapay zekâ modeli kullanarak insan incelemesinin yerine ölçeklenebilir ve otomatik kalite puanlaması koyar. Daha basit metrikler gereken doğruluğu sağlayabilecekken LLM hakem yaklaşımı sıklıkla gereksiz yere kullanılır. Metrik anlamsal olduğunda (faydalılık, dayanaklılık, akıl yürütme kalitesi, üslup, politika yorumu) ve deterministik puanlama mümkün olmadığında olduğu gibi, deterministik kontrollerin kaliteyi yakalayamadığı durumlarda yararlı olabilir. Çok sayıda prompt/model çeşidi için ölçeklenebilir geri bildirime, ayrıca net bir değerlendirme ölçeği ile yapılandırılmış çıktı şeması tanımlamaya ihtiyaç duyabilirsiniz. Bu yaklaşımın işe yaraması için şu adımları izleyin:

  • Değerlendirme ölçeğinin boyutlarını açıkça tanımlayın: doğruluk, dayanaklılık, politikalara uygunluk, uygulanabilirlik ve üslup.

  • Hakem yanıtlarında yapılandırılmış çıktılar (JSON şeması) kullanın.

  • Hata analizi için hem ikili eşik puanlarını hem de tanılayıcı metni kaydedin.

  • Hakem çıktılarını her sürüm döngüsünde insanlarca etiketlenmiş örneklerle kalibre edin.

  • Kritik alanlarda çift hakem veya düzenli mutabakat kontrolleri kullanın.

  • Hakem sapmasını ve görüş ayrılığı oranını zaman içinde izleyin.

Karşılaştırmalı değerlendirmeler arasında kaybolmayın

Karşılaştırmalı değerlendirme veri kümesi; modelleri tutarlı biçimde değerlendirmek ve sürümler arasındaki sonuçları adil şekilde karşılaştırmak için kullanılan, yanıtları bilinen sabit ve özenle hazırlanmış test örnekleri kümesidir. Genellikle girdileri (ör. kullanıcı sorguları), beklenen çıktıları veya referans yargıları ve puanlamaya yönelik değerlendirme ölçütlerini/etiketlerini içerir. Herkese açık karşılaştırmalı değerlendirme testleri, en gelişmiş modellerin performansını karşılaştırmak için kullanılır ve sisteminizi tasarlarken hangi modelin uygun bir aday olabileceğine ilişkin ilk fikirleri edinmenize yardımcı olabilir.

Ancak kendi sisteminizde, bilinen sorunları nedeniyle bu karşılaştırmalı değerlendirmeleri iş bağlamınızdaki performansın göstergesi olarak kullanamazsınız:

  • Veri bulaşması: Modeller karşılaştırmalı değerlendirme verileriyle eğitilmiş olabilir; aynı veri kümesiyle değerlendirme yapmak, cevap anahtarına bakarak not vermeye benzeyebilir.

  • Doygunluk: En iyi modellerin tümü zaten en yüksek puanlara ulaştığından performanstaki iyileşme veya düşüş birkaç yüzde puanıyla sınırlı kalır ve çoğu zaman test sonuçlarının doğal değişkenliği içindedir.

  • Dar kapsam: Özenle seçilip temizlenen karşılaştırmalı değerlendirme verileri, gerçek görevlerinizi yansıtmaz. Bazıları LLM tarafından bile üretilmiştir ve verilerinizdeki karmaşıklığı ve uç durumları (yazım hataları, sıra dışı ifadeler, parazitli görüntüler) yansıtmaz.

Örnek: Öğrencilere yardımcı olan yapay zekâ matematik öğretmeni

Bir öğrenci, uygulamadan sözel problemleri çözmesine yardım etmesini ister.

Kullanabileceğiniz herkese açık bir karşılaştırmalı değerlendirme örneği: GSM8K (ilkokul düzeyinde matematiksel akıl yürütme)

  • İsteğe bağlı daha zor küme: MATH.

Bu karşılaştırmalı değerlendirme neden yararlı?

  • Genel matematiksel akıl yürütmede hangi modelin daha iyi olduğunu hızla karşılaştırmanızı sağlar,

  • Kapsamlı ürün değerlendirmelerine yatırım yapmadan önce iyi bir ilk eleme aracıdır.

Neden yine de kendi veri kümenize ihtiyacınız var?

Uygulamanızın GSM8K’nın test etmediği gereksinimleri vardır:

  • Müfredatınızdaki ifadeler ve konu sırası,

  • Yaş grubunuza uygun açıklama tarzı,

  • Belirsiz veya çok sayıda yazım hatası içeren öğrenci sorularının ele alınış biçimi,

  • Politika kuralları (ör. ne zaman ipucu, ne zaman tam yanıt verileceği).

Etkili doğrulama, uygulamanıza özgü karşılaştırmalı değerlendirmeler oluşturmaya dayanır. Bu veri kümeleri gerçek etkileşimlerden, tipik uç durumlardan ve olası hata biçimlerinden oluşmalıdır. Yeni bir ürün veya süreç uygulanırken bu zor bir görev olabilir. Ancak çoğu durumda mevcut bir üründen veya ilk test aşamasında bile mümkün olan en erken zamanda veri toplamak mümkündür. Uygulamanız geliştirildikten sonra bu karşılaştırmalı değerlendirmeler ürününüzle birlikte gelişmeli, zamanla zenginleşip daha temsilî hâle gelmelidir.

Vaka çalışması: Bireysel bankacılık asistanı için özel bir karşılaştırmalı değerlendirme oluşturma

Bir bankacılık sohbet botu bütçeler, harcamalar ve işlemler hakkındaki soruları yanıtlar. Herkese açık soru-cevap ve metinden SQL’e karşılaştırmalı değerlendirmeleri; SQL enjeksiyonu, veri sızıntısı veya çok turlu bağlamın sürdürülmesi gibi temel bankacılık risklerini kapsamıyordu. Bu ürünün ajan işlem hattını yansıtan özel bir karşılaştırmalı değerlendirme oluşturduk.

Bu kod tabanındaki özel karşılaştırmalı değerlendirmenin bileşenleri:

  • SQL enjeksiyonu, PII çıkarma, prompt geçersiz kılma ve oturumlar arası sızıntıya yönelik kötü amaçlı promptlardan oluşan kırmızı ekip test paketi

  • Güvenlikte sıfır tolerans: Her türlü SQL enjeksiyonu, PII çıkarma veya oturumlar arası sızıntı reddedilmelidir.

  • Bağlamı sürdürme doğruluğu: Yeniden yazılan sorgular, kullanıcının niyetini ve varlıkları korumalıdır.

Çıkarım: Karşılaştırmalı değerlendirme oluşturmayı bir ürün özelliği olarak ele alın. Mevcut düzenek, uçtan uca değerlendirmenin bağlandığını kanıtlıyor; ancak kapsam ve örneklem boyutları gerçek bankacılık risklerini (çok niyetli saldırılar, koruyucu önlemleri aşma girişimleri ve bağlama bağlı sorgular) yansıtacak şekilde büyütülmelidir. Karşılaştırmalı değerlendirme, yeni ajanlar ve koruyucu önlemlerle birlikte genişlemelidir.

Doğru dengeyi bulmaya yönelik değerlendirmeler: İstenen performansı mümkün olan en küçük modelle elde etmek

Uygulamanıza özgü karşılaştırmalı değerlendirme ile model seçimi arasındaki bağlantı kritik önemdedir. Karşılaştırmalı değerlendirmeniz yalnızca bir çözümün çalışıp çalışmadığını değil, hangi model boyutu ve eğitim sonrası teknik bileşiminin ihtiyaç duyduğunuz performansı en düşük maliyetle sağladığını da gösterir. Önceden eğitilmiş modellerdeki en güçlü iyileştirmeler (ChatGPT’deki “PT”), yeniden eğitimden değil "eğitim sonrası" yöntemlerden gelir.

Bu yöntemler; modelin hangi bilgilere erişebildiğini, bu bilgilerin nasıl yapılandırıldığını ve çıkarım sırasında modelin nasıl yönlendirilip düzenlendiğini şekillendirmeye odaklanır. Eğitim sonrası tekniklerden bazıları:

  • Düşünce zinciri promptları ve dinamik işlem gücü tahsisi (daha zor problemler üzerinde daha çok düşünme)

  • Birden çok çıktının üretilip en iyisinin seçildiği öz tutarlılık

  • Getirmeyle Zenginleştirilmiş Üretim (RAG), az örnekli örnekler ve ajan tabanlı iş akışları gibi bağlam oluşturma ve düzenleme yöntemleri

  • Modelin iç parametrelerinin ötesinde hareket etmesini sağlayan araç kullanımı ve harici bilgiye erişim

  • Yapılandırılmış ve yapılandırılmamış verileri verimli biçimde getirmek ve bunlar üzerinde akıl yürütmek için tasarlanmış bilgi temsili ve depolama stratejileri

Bu eğitim sonrası teknikler sistem performansını önemli ölçüde artırabilse de bazı ödünleşimleri beraberinde getirir. Eklenen her düzenleme, getirme veya akıl yürütme katmanı sistem karmaşıklığını, çıkarım süresini ve işletme maliyetini artırır. Ancak doğru eğitim sonrası teknik bileşimi özenle uygulandığında, performans gereksinimleri karşılanırken daha küçük, hızlı ve ucuz modellere güvenmek çoğu zaman mümkün olur. Performans, model boyutunu büyütmek yerine daha iyi sistem tasarımıyla elde edilir.

Bu denge her uygulamaya özgüdür ve en uygun teknik bileşimi, uygulamanıza özgü değerlendirmelerle belirlenmelidir. Bu değerlendirmeler, ek düzenlemenin artık anlamlı kazanım sağlamadığı noktayı belirlemenize yardımcı olarak ekiplerin hedef performans için gereken asgari eğitim sonrası karmaşıklık düzeyini seçmesini sağlar.

Hızlı ilerleyin, ancak değerlendirmeyi özenle yapın

Bir yapay zekâ çözümü; veritabanları, API’ler, kullanıcı arayüzleri, düzenleme katmanları, izleme altyapısı ve diğer bileşenleriyle bir bütün olarak düşünülmelidir. Bu nedenle değerlendirme, teknoloji yığınının tamamını kapsamalıdır. Olası sorunları görünür kılmak ve sorumlu biçimde hızlanmak için sistemin önemli bölümlerini izlemelisiniz.

Sistemin önemli bölümlerini izlemek şunları gerektirir:

  • Ölçülebilir sonuçlar için işlem hatlarınıza ölçümleme eklemek.

  • Her değişikliğin etkisini görebilmek için denemeleri kaydetmek.

  • Olası gerilemeleri test etmek amacıyla büyük değişiklikleri devreye almadan önce basit A/B karşılaştırmaları yapmak.

Veriye dayalı yineleme, kör noktalar oluşturmadan prototipten üretime giden yolu kısaltır. Günlük kaydı ve izleme, uygulamanın gerçek dünyada nasıl kullanıldığını anlamak için de önemlidir. Gözlemlenebilirliği sağlamaya yönelik bir örnek:

  • Adım 1: Kullanıcı isteği request_id, user_segment ve intent ile sisteme girer.

  • Adım 2: İz kaydı; model sürümünü, prompt sürümünü, getirilen belgeleri ve araç çağrılarını kaydeder.

  • Adım 3: LLM hakem yanıtı puanlar (correctness, groundedness, policy_risk).

  • Adım 4: Kural motoru eşikleri değerlendirir.

  • Adım 5: Eşik ihlal edilirse uyarı tetiklenir ve istek yedek akışa/insan incelemesine yönlendirilir.

  • Adım 6: Hata önce sınıflandırma kuyruğuna, ardından karşılaştırmalı değerlendirme iş listesine eklenir.

İade politikası asistanına ait Langfuse izi; istek akışını, getirme ve kural araçlarını, yanıt kalitesi değerlendirmesini, kalite eşiğini, puanlama meta verilerini ve oluşturulan yanıtı gösteriyor.

Gerçek kullanıcılar nadiren tasarımcıların beklediği gibi davranır. Bazıları talimatları yanlış anlayacaktır. Bazıları ise zayıf noktaları kasıtlı olarak yoklayacaktır. Bu uç durumlar anomali değil, son derece değerli sinyallerdir. İyi uygulanmış bir değerlendirme işlem hattı bunları yakalar, analiz eder ve gelecekteki testlere aktarır. Kör noktalar olmadan hızlı yineleme, ancak değerlendirme geliştirme sonrasında eklenmek yerine sistemin özüne yerleştirildiğinde mümkündür.

Koruyucu önlemleri ve izlemeyi ilk günden sisteme yerleştirmenizi öneriyoruz:

  • Uygulamanıza özgü karşılaştırmalı değerlendirmeyi kullanarak model metriklerini ve gerilemeleri düzenli olarak izleyin.

  • Uç durumları veya hasmane girdileri yakalayıp inceleyin ve bunları uygulamanıza özgü karşılaştırmalı değerlendirme veri kümesine ekleyin.

  • Bu değerlendirme metriklerinin temel KPI’larınızla uyumlu olmasını sağlayın.

  • Yeni riskleri göz ardı etmediğinizden ve yanlılıklara maruz kalmadığınızdan emin olmak için veri kümenizi ve karşılaştırmalı değerlendirmenizi düzenli olarak sorgulayın.

  • Metriklerdeki bozulma için otomatik uyarılar uygulayın (ör. doğruluk %85’in altına düşerse inceleme başlatın).

  • Kritik kararlar (hukuki tavsiye, tıbbi rehberlik, finansal işlemler) için insan incelemesi sürecini koruyun.

Sorumlu değerlendirme: enerji, maliyet ve mevzuata uygunluk

Her karşılaştırmalı değerlendirme çalışması, işlem gücü ve enerji tüketir. Her gereksiz deneme maliyeti artırır. Sorumlu değerlendirme, titizlik ile verimliliği dengelemelidir.

Enerji tüketiminin ve maliyetlerin kontrolden çıkmasını önlemek için bazı pratik adımlar atılabilir:

  • Mümkün olduğunda daha küçük modeller kullanın; ilk denemeleri daha ucuz modellerle yürütün ve yalnızca yaklaşımı doğruladıktan sonra ölçeği büyütün.

  • Promptları ve API çağrılarını önbelleğe alın.

  • Enerji duyarlı zamanlama kullanın (toplu işleme, spot bulut sunucuları, esnek öncelik).

  • İşlem kaynağı kullanımını performansla birlikte izleyin.

Aynı şekilde, yeni yapay zekâ düzenlemelerini yakından izleyin. Özel bir yasa bulunmadığında bile mevcut çerçeveler ve gerekli adımlar geçerliliğini korur. Örneğin:

Veri koruma:

  • Karşılaştırmalı değerlendirme veri kümelerinin, uygun izin alınmadan kişisel olarak tanımlanabilir bilgi (PII) içermediğinden emin olun

  • Kaydedilen sorgular için veri saklama politikaları uygulayın

  • Veri silme talepleri için gerekli mekanizmaları sağlayın

Eşitlik ve yanlılık:

  • Farklı demografik gruplardaki performansı test edin

  • Karşılaştırmalı değerlendirme hazırlanırken farklı kesimlerin temsil edilmesini sağlayın

İnsan hakları ve şeffaflık:

  • Modelin sınırlamalarını kullanıcılar için açıkça belgeleyin

  • Kritik kararlar için açıklamalar sunun

  • Kritik uygulamalarda insan gözetimini mümkün kılın

Sonuç: Değerlendirmeden gelişime

Değerlendirme tek seferlik bir etkinlik değil, sürekli gelişen bir sistemdir. Hızla değişen bir alanda avantajınız; modelleri ve yeni çözümleri daha etkili biçimde devreye alabilmek için ne kadar hızlı test edip öğrenebildiğinizde ve uyum sağlayabildiğinizde yatar.

Değerlendirmeyi mühendislik ve ürün yönetiminin temel bir faaliyeti hâline getiren ekipler daha hızlı ve güvenli biçimde yenilik yapabilir. Önce yapay zekâ uygulamanızın bağlamında “iyi”nin nasıl göründüğünü tanımlayın, bir değerlendirme platformu kurun ve bu platformu geliştirerek her yinelemede üretime hazır olma konusunda güven veren, uygulamanıza özgü bir karşılaştırmalı değerlendirme oluşturun.

Yazarlar

Fatemeh Tahavori, Romain Bourboulou