Yapay Zeka Ajanları Üretimde Neden Bozulur ve Her Arıza Modu Nasıl Test Edilir

Yapay zeka ajanları istemden ziyade API sınırında hata verir. Üretim ortamında ajanların beş hata verme şekli (araç çağrıları, hız limitleri, deterministik olmama, maliyet, güvenlik önlemleri) ve her birini sahte nesnelerle nasıl test edeceğiniz.

Ashley Innocent

Ashley Innocent

20 July 2026

Yapay Zeka Ajanları Üretimde Neden Bozulur ve Her Arıza Modu Nasıl Test Edilir

Kurumsal İçin Apidog

Şirket İçi (On-Premises) Dağıtım

SSO ve RBAC

SOC 2 Uyumlu

Apidog Enterprise'ı Keşfedin

Ajanınız demoda çalıştı. Bileti okudu, üç API'yi çağırdı ve temiz bir özet yayınladı. Sonra onu gönderdiniz. Bir hafta sonra aynı müşteriye iki kez e-posta gönderdi, bir günlük token bütçesini bir tekrar döngüsünde yaktı ve ön yüzünüze ayrıştıramayacağı bir yük verdi.

Çalışan bir prototip ile güvenilir bir ajan arasındaki bu boşluk, çoğu ekibin takılı kaldığı yerdir. Model nadiren suçludur. Sorun, tesisat olarak ele alınan kısımda yatar: ajanın bir cevaba ulaşmak için yaptığı API çağrıları. Bir ajan, araç çağrılarının bir döngüsüdür ve her araç çağrısı, başarısız olabilen, yavaşlayabilen, zaman aşımına uğrayabilen veya beklediğinizden farklı bir şey döndürebilen bir HTTP isteğidir. Bu çağrıları, herhangi bir üretim API'sini test ettiğiniz gibi test etmeyi atlayın ve ajanınız bir kötü yanıt yüzünden bir olaydan bir adım uzakta demektir.

İşte güven veren kısım: ajan güvenilirliği test edilebilir. Modelin davranışına güvenmek zorunda değilsiniz. Kullanıcılarınız onları sizin için bulmadan önce hata yollarını kasten çalıştırırsınız. Bu kılavuz, ajan arızalarını beş moda ayırır ve her birini nasıl yakalayacağınızı gösterir. İş API sınırında gerçekleşir, bu nedenle sözleşmeyi tasarlamak, arızaları taklit etmek ve geri dönenleri kontrol etmek için ajanın bağımlılıklarına yönlendirebileceğiniz bir platforma ihtiyacınız var. Apidog bu işi kapsar ve aşağıdaki örneklerde de yer alır.

button

Ajanlar istemde değil, API sınırında başarısız olur

Bir ajan üretimde yanlış davrandığında, içgüdü istemi düzenlemektir. Bazen bu yardımcı olur. Çoğu zaman arıza kelimelerle ilgili değildir. Ajan, gerçek bir API'den bir şey istedi ve yanıt yavaş, yanlış biçimlendirilmiş, hız sınırlamalı veya ajanın beklediğinden farklı bir şekilde geldi. Model daha sonra kötü girdi üzerinde akıl yürüttü ve kendinden emin ama yanlış bir şey yaptı.

Tek bir ajan adımının neleri içerdiğine bakalım. Model bir araç seçer. Kodunuz bu seçimi bir HTTP isteğine dönüştürür. Harici bir servis yanıt verir. Kodunuz sonucu modele geri besler. Dört aktarım ve bunların üçü makine öğrenimi değil, sıradan API entegrasyonudur. Bu iyi bir haber, çünkü API entegrasyonu çözülmüş bir test sorunudur. Yavaş bir uç noktayı nasıl taklit edeceğinizi veya bir JSON şeması üzerinde nasıl doğrulama yapacağınızı zaten biliyorsunuz. Ajanlar riskleri artırır, çünkü model temiz bir istisna atmak yerine aldığı her şeye göre hareket eder.

Dolayısıyla güvenilirlik sorusu "model yeterince akıllı mı" değil. "Ajanın API çağrılarının her türlü yanlış gidebileceği yolu test ettim mi" sorusudur. Beş mod bunun çoğunu kapsar.

Hata modu 1: sözleşmeden sapan araç çağrıları

En yaygın ajan hatası, çağırdığı API ile eşleşmeyen bir araç çağrısıdır. Model bir parametre icat eder, gerekli bir alanı atlar, şemanın bir tamsayı istediği yere bir dize gönderir veya doğru uç noktayı anlamsız argümanlarla çağırır. Diyelim ki bir rezervasyon ajanı guests: 2 yerine guests: "two" ile POST /reservations çağırıyor. API bir 400 döner veya daha kötüsü, gövdesinde bir hata gizlenmiş bir 200 döner ve ajan başarılı olmuş gibi devam eder.

Bunu, araç çağrısını bir sözleşme olarak test ederek yakalarsınız. Ajanın çağırabileceği her araç için şemayı tanımlayın, ardından giden isteğin eşleştiğini doğrulayın: gerekli alanlar mevcut, türler doğru, enum'lar geçerli. Ajan, sözleşmeyi bozan bir çağrı ürettiğinde, bunun üretimde sessizce değil, bir testte gürültülü bir şekilde başarısız olmasını istersiniz. Bir yapay zeka ajanının araç çağrılarını test etme hakkındaki kılavuzumuz bu konuda derinlemesine bilgi verir ve API'lerinizi çağıran ajanları test etme üzerine daha geniş yöntem, kurulumu uçtan uca kapsar.

Pratik hareket: ajanınızın kullandığı araç şemalarını yakalayın, bunları Apidog'a yükleyin ve ajanın gerçek araç çağrılarını bu tanımlara karşı çalıştırın. Uyumsuzluklar, bozulan tam alanı adlandıran doğrulama hataları olarak ortaya çıkar.

Hata modu 2: yukarı akış hataları ve hız limitleri

Ajanın yaptığı her harici çağrı, bir zaman aşımından önce bir 429, bir 500 veya hiçbir şey döndürmeyebilir. İyi oluşturulmuş bir ajan bunları tekrarlar ve geri çekilme ile ele alır. Kırılgan bir ajan ya ilk hatada pes eder ya da daha tehlikelisi, o kadar çok tekrar dener ki daha fazla yavaşlamayı tetikler ve bütçenizi tüketen bir döngüde döner. Anthropic SDK tartışma panosundaki en çok sorulan soru tam anlamıyla ajan hata kurtarma modelleri hakkındadır, bu da bu sorunun ne kadar yaygın olduğunu gösterir.

Sağlıklı bir API'ye karşı kurtarmayı test edemezsiniz, çünkü sağlıklı bir API asla ele almanız gereken hataları döndürmez. İşte taklit etmenin değeri burada yatar. Ajanın bağımlılığı için bir taklit kurun ve bir dizi programlayın: bir Retry-After başlığı ile bir 429, ardından bir 500, ardından bir başarı. Şimdi ajanınızın ne yaptığını izleyin. Gecikmeli geri çekiliyor mu? Başlığı dikkate alıyor mu? Makul sayıda denemeden sonra zarifçe pes ediyor mu, yoksa açıkça kapalı olan bir servisi durmadan meşgul etmeyi durdurmak için bir devre kesici açıyor mu? Ve tekrarlanan bir eylem etkisiz ise, bir tekrar çifte ücret mi alır veya çifte gönderim mi yapar? Idempotency key, bir tekrarın güvenli bir şekilde tekrarlanmasını sağlar.

Hız limitleri kendi provasını hak ediyor. Bir sağlayıcı tarafından yavaşlatıldığında ajanınızın nasıl davrandığını görmediyseniz, hız limiti aşıldı yanıtının ne anlama geldiği hakkındaki kılavuzumuzu okuyun ve ardından bunu simüle edin. Yapay zeka ajan hata kurtarma üzerine özel kılavuz, tekrar, zaman aşımı, geri çekilme ve devre kesici modellerini tam olarak kapsar.

Hata modu 3: deterministik olmayan çıktı

Sıcaklığı sıfıra ayarlasanız bile, çalıştırmalar arasında bayt-bayt aynı çıktıyı alamazsınız. Geliştiriciler bunu sürekli olarak yeniden keşfeder; vLLM'de uzun bir tartışma başlığı var tohumların ve sıcaklığın yeniden üretilebilirlik için yeterli olmadığı hakkında. Donanım, toplu işlem ve sağlayıcı tarafındaki değişiklikler her zaman farklılıklar yaratır. Testleriniz tam dizeler üzerinde doğrulama yaparsa, kararsız hale gelirler ve kararsız testler görmezden gelinir ki bu da hiç test olmamasından daha kötüdür. Kararsız testlere neyin sebep olduğu hakkındaki özetimiz doğrudan burada geçerlidir.

Çözüm, tam metin üzerinde değil, yapı ve anlam üzerinde doğrulama yapmaktır. Yanıtın bir JSON şemasına göre doğrulandığını kontrol edin. Araç çağrısının doğru şekle ve doğru hedefe sahip olduğunu kontrol edin. Sayısal bir cevabın makul bir aralığa düştüğünü kontrol edin. Gerekli anahtarların mevcut olduğunu ve yasaklanmış alanların olmadığını kontrol edin. "Yanıt, 0 ile sepet değeri arasında bir total içeriyor" diyen bir test, modelin doğal varyasyonundan sağ çıkar ve gerçek bir regresyonu hala yakalar. Deterministik olmayan yapay zeka ajanlarını test etme kılavuzu stratejilerin tam setini ortaya koyar ve ajan belleğinin nasıl çalıştığı hakkındaki makale, durumun bunu neden daha zor hale getirdiğini gösterir.

Hata modu 4: kontrolsüz maliyet

Ajanlar döngüye girer ve döngüler paraya mal olur. Başarısız bir çağrıyı birkaç bin kez tekrar eden tek bir takılı ajan, küçük bir faturayı bir gecede büyük bir faturaya dönüştürebilir. SDK tartışmalarındaki bir saha raporu, bir ajanın maliyetini ayda 500 dolardan 80 dolara düşürmeyi, kaliteden ödün vermeden başardığını belirtiyordu, bu da maliyetin ne kadar hızlı arttığını ve tasarımda genellikle ne kadar boşluk gizlendiğini gösterir.

Maliyet sadece finansal bir sorun değil, aynı zamanda bir güvenilirlik sorunudur, çünkü para israf eden hatalar (döngüler, gereksiz çağrılar, aşırı büyük bağlam) ajanı yavaş ve tahmin edilemez hale getirir. Her çalıştırma başına tokenları takip edin, görev başına bütçeyi sınırlayın ve mümkün olduğunca önbelleğe alın. Bunun komut satırı tarafı için, ajan token maliyetlerini düşürme kılavuzumuzda somut kaldıraçlar bulunmaktadır. Bir taklit karşı kurtarma yollarını test ederken, çağrı sayısını da izleyin. Başarılı olan ama bunu başarmak için kırk çağrı yapan bir ajan, bir maliyet olayının yakında gerçekleşeceğini bekler.

Hata modu 5: eksik güvenlik çitleri

En çok zarar veren hatalar, ajanın tam olarak kendisine söylenenleri yapması ve sonucun yine de kötü olmasıdır. E-postayı gönderir, kaydı siler veya siparişi verir, çünkü modelin kararı ile canlı eylem arasında hiçbir şey yoktur. SDK panolarında, bir ajanın sabaha karşı üçe birine patronuna e-posta göndermesi etrafında inşa edilmiş unutulmaz bir başlık bulunur. Bir kere komik, iki kere pahalı.

Güvenlik çitleri emniyet kemeridir. Bir ajanın onaysız gerçekleştirebileceği eylemler için bir izin listesi belirleyin. Yıkıcı veya geri döndürülemez çağrıları insan onayı arkasına kilitleyin. Ajan'a, yapmadan ne yapacağını açıklayan bir deneme modu verin. Ardından güvenlik çitinin işleyip işlemediğini test edin: yan etkili uç noktayı taklit edin, ajanı çalıştırın ve canlı eylem yerine onay yolunu vurduğunu doğrulayın. OWASP Top 10 for LLM applications gibi güvenlik rehberliği, neyi koruyacağınıza dair sağlam bir kontrol listesidir. Yapay zeka ajan güvenlik çitleri kılavuzu, onay geçitlerini ve patlama yarıçapı kontrolünü derinlemesine kapsar.

Bir ajan testi nasıl yapılandırılır

Beş modun ortak bir test şekli vardır ve bunu yeniden kullanabilirsiniz:

  1. Ajanınızın çağırabileceği araç şemalarını yakalayın, böylece doğrulanacak bir sözleşmeniz olur.
  2. Her bağımlılığı taklit edin, böylece zamanlamayı, durum kodlarını ve gövdeleri kontrol edebilir ve gerçek yan etkilerden kaçınabilirsiniz.
  3. Ajanı, canlı bir API'nin isteğe bağlı olarak üretmeyeceği olumsuz yollar dahil olmak üzere senaryo boyunca yönlendirin.
  4. Ajanın ne gönderdiğini ve nasıl tepki verdiğini doğrulayın: istek şekli, kurtarma davranışı, çağrı sayısı ve güvenlik çitlerinin devreye girip girmediği.

Bu döngüyü bir araç için çalıştırın, ardından bir sonrakini ekleyin. Kurulum, bozuk bir araç çağrısını bir kullanıcı yapmadan önce ilk kez yakaladığında kendini amorti eder.

Ajan güvenilirlik kontrol listesi

Bir ajan üretime geçmeden önce bu listeyi gözden geçirin:

Tüm yedisini işaretleyin ve ajanların üretimde bozulma yollarını test etmiş olursunuz.

Apidog'un nerede uyduğu (ve uymadığı)

Aracın işlevini açıkça belirtin. Apidog bir ajan çerçevesi, bir model barındırıcısı veya bir değerlendirme donanımı değildir. Ajanınızı inşa etmez veya çalıştırmaz. Yaptığı şey, ajanızın bağımlı olduğu API katmanına sahip olmaktır, ki bu hataların tam olarak yaşadığı yerdir.

Pratikte bu üç şey anlamına gelir. Ajanınızın çağırdığı araçlar için sözleşmeleri tasarlar ve saklarsınız, böylece giden istekleri bunlara karşı doğrulayabilirsiniz. Bu bağımlılıkları taklit eder ve canlı bir API'nin isteğe bağlı olarak üretmeyeceği hata yanıtlarını (429, 500, zaman aşımı, yanlış biçimlendirilmiş gövde) programlarsınız, böylece kurtarmayı prova edebilirsiniz. Ve deterministik olmayan çıktıdan sağ çıkan yanıtlar (şema, şekil, aralıklar, gerekli anahtarlar) üzerinde doğrulamalar yazarsınız. Dürüst uyum budur: Apidog, ajanınızın çağırdığı API'leri test eder, ele almanız gereken hataları taklit eder ve geri dönenleri kontrol eder. Ajanik yapay zeka testine genel bakışımız bunu daha geniş QA resminde konumlandırır.

Sıkça sorulan sorular

Ajan güvenilirliği bir model sorunu mu yoksa bir mühendislik sorunu mu? Çoğunlukla mühendislik. Model seçimi önemlidir, ancak olaylara neden olan hatalar (kötü araç çağrıları, ele alınmayan hız limitleri, eksik güvenlik çitleri) modelinizi değiştirmeden çözebileceğiniz entegrasyon ve test sorunlarıdır.

Ajanı, çağırdığı gerçek API'lere vurmadan test edebilir miyim? Evet ve yapmalısınız. Bağımlılıkları taklit edin, böylece hata yanıtlarını zorlayabilir, zamanlamayı kontrol edebilir ve yan etkilerden kaçınabilirsiniz. Kurtarma ve güvenlik çiti yollarını test etmenin tek güvenilir yolu budur.

Çıktı her çalıştırmada değiştiğinde testleri nasıl yazarım? Tam metin yerine yapı ve anlam üzerinde doğrulama yapın. Yanıtı bir şemaya göre doğrulayın, araç çağrısının şeklini kontrol edin ve sayılar için aralıklar kullanın. Deterministik olmayan yapay zeka ajanlarını test etme kılavuzu bunu ayrıntılı olarak kapsar.

Önce neyi test etmeliyim? Yıkıcı eylemler üzerindeki güvenlik çitlerini, ardından hata kurtarmayı. Bu ikisi sizi en pahalı hatalardan korur: zararlı bir eylem yapan bir ajan veya döngüye giren ve bütçenizi tüketen bir ajan.

Tek bir hata moduyla başlayın

Beş modun hepsini aynı anda test etmek zorunda değilsiniz. Sizi en çok korkutanı, genellikle güvenlik çitleri veya hata kurtarma, seçin ve bu hafta bir taklit karşısında prova yapın. Hatayı programlayın, ajanı çalıştırın ve ne yaptığını izleyin. Ajanınızın simüle edilmiş bir 429'u bütçeyi tüketen bir döngü yerine temiz bir geri çekilme ile ele aldığını ilk gördüğünüzde, ona daha çok güveneceksiniz ve yeşil bir demodan daha iyi bir nedenden dolayı.

Sözleşmeleri tasarlamak, hataları taklit etmek ve ajanınızın bağımlı olduğu yanıtlar üzerinde doğrulama yapmak için Apidog'u indirin.

API Tasarım-Öncelikli Yaklaşımı Apidog'da Uygulayın

API'leri oluşturmanın ve kullanmanın daha kolay yolunu keşfedin