Bir AI ajanı, bir döngüye yerleştirilmiş büyük bir dil modelidir. Bir hedefi adımlara bölerek planlar, veri okumak, kod çalıştırmak, mesaj göndermek veya bir sistemi sorgulamak için araçları çağırarak harekete geçer, geri dönen gerçek sonucu gözlemler ve hedefe ulaşana kadar tekrarlar. Üç şey bu mekanizmayı işler kılar: model, karar veren akıl yürütme motorudur, araçlar dış dünyaya dokunan ellerdir ve bellek onu durumlu hale getiren şeydir, çünkü kendi başına bir dil modeli bağlam penceresi dolduğunda her şeyi unutur. Bütün fikir bundan ibaret. Geri kalan her şey bu üç parçanın etrafındaki mühendisliktir.

Bu makale, ajanları kuran insanların onları gerçekte tarif ettiği şekilde, bu üç parçalı anatomiyi haritalandırır. Anthropic, AWS, Google ve IBM biraz farklı kelimeler kullanır, ancak aynı modelde buluşurlar. Sonunda, jargon olmadan, tek bir okumada kanonik zihinsel modele sahip olacaksınız. Bunu sizin yerinize yapmamızı tercih ederseniz, üretken yapay zeka mimarisini nasıl işlettiğimize bakın, ancak buradaki her şey kendi başınıza kullanmanız için sizindir.

Tek cümleyle AI ajanı nedir?

AWS sade tanımı verir: bir AI ajanı, ortamıyla etkileşime girebilen, veri toplayabilen ve bu veriyi önceden belirlenmiş hedefleri karşılayan kendi kendini yöneten görevleri yerine getirmek için kullanabilen yazılımdır. Anahtar ifade kendi kendini yönetmedir. İnsanlar hedefi belirler, ancak ajan oraya ulaşmak için yaptığı eylemleri bağımsız olarak seçer.

Bu ayrım, bir ajanı bir sohbet botundan ve eski tip otomasyondan ayıran şeydir. Bir sohbet botu yanıtlar ve durur. Geleneksel otomasyon, önceden yazdığınız sabit bir senaryoyu izler ve gerçeklik senaryoyla uyuşmadığı anda bozulur. Bir ajan ise bağlamı okur, bir karar verir, bir eylemde bulunur, sonucu görür ve uyarlanır. Eskiden bir kişiye ihtiyaç duyan karmaşık, çok adımlı işleri üstlenebilir.

Planla, harekete geç, gözlemle döngüsü nedir?

Döngü her ajanın kalp atışıdır. Markaları bir kenara bırakırsanız, dört büyük kaynağın hepsi aynı çevrimi tarif eder:

  1. Planla. Model, hedefi daha küçük, sıralı adımlara böler. AWS buna planlama modülü der; bu modül, iş başlamadan önce adımları mantıksal olarak sıralar.
  2. Harekete geç. Ajan, gerçek bir şey yapmak için bir aracı çağırır: bir kaydı getirir, kod çalıştırır, bir e-posta gönderir, bir veritabanını sorgular.
  3. Gözlemle. Sonuç ortamdan geri döner ve ajan bunu okur. Anthropic, her adımda ortamdan bu yer gerçeğini elde etmenin, ajanı kendinden emin bir şekilde uydurma yapmaktan alıkoyarak dürüst tuttuğunu vurgular.
  4. Tekrarla. Yeni bilgiyle ajan yeniden planlar ve tekrar harekete geçer, hedefe veya bir durma noktasına ulaşana kadar döngüyü sürdürür.

AWS aynı döngüyü dört aşama olarak çerçeveler: hedefleri belirle, bilgi edin, görevleri uygula ve ilerlemeyi hedeflere göre değerlendir. Google, bu döngüyü çalıştıran sistem parçasına düzenleme katmanı der ve bunun, ajan hedefine veya bir durma noktasına ulaşana kadar devam ettiğini söyler. Farklı etiketler, aynı mekanizma.

Bilmeye değer bir incelik var. IBM, gelecekteki durumları öngören ve çalıştırmadan önce eksiksiz bir eylem planı üreten planlama ajanlarını, tek seferde bir adım yanıt veren tepkisel ajanlardan ayırır. En faydalı ajanların çoğu ikisini harmanlar: bir plan çizerler, sonra gözlem adımı gerçekliği geri besledikçe onu uyarlarlar.

Model ne yapar? (beyin)

Model akıl yürütme motorudur. Google buna ajanın beyni ve merkezi karar verici der. Hedefi yorumlayan, hangi aracı kullanacağına karar veren ve son sonucun işleri ileriye taşıyıp taşımadığını değerlendiren parçadır.

Gerçekte nasıl akıl yürütür? Alanda öne çıkan birkaç köklü teknik var:

  • Düşünce zinciri (Chain-of-Thought). Model, bir yanıta atlamak yerine bir problemi ara mantıksal adımlara ayrıştırır. IBM, ajanların bu tür adım adım akıl yürütmeyi kullanarak stratejilerini ayarladığını belirtir.
  • ReAct. Model, sözel akıl yürütme ile göreve özgü eylemler arasında geçiş yapar; sıkı bir döngüde önce düşünür sonra yapar. Çoğu ajan döngüsünün üzerine kurulduğu kalıp budur.
  • Düşünce ağacı (Tree-of-Thoughts). Model, tek bir çizgi yerine dallanan bir akıl yürütme yolları ağacını keşfeder; bir problemin birçok olası yaklaşımı olduğunda işe yarar.

Bir alıcının anlaması gereken önemli nokta şu: modelde özel bir "ajan" modu yoktur. Bir sohbet penceresinde kullandığınız dil modelinin aynısıdır. Onu bir ajana dönüştüren şey, burada tarif edilen döngüye, araçlara ve belleğe sarmaladır.

Araçlar nedir? (eller ve gözler)

Kendi başına bir model yalnızca metin üretebilir. Araçlar, onun dünyaya dokunma biçimidir. Google bunlara ajanın elleri ve gözleri der ve bu benzetme tam isabettir: araçlar, ajanın hem algıladığı (veri okuduğu) hem de harekete geçtiği (bir şeyi değiştirdiği) yoldur.

Anthropic, temel yapı taşını alma, araçlar ve bellek gibi eklentilerle güçlendirilmiş bir dil modeli olarak çerçeveler. AWS günlük örnekleri sıralar: araçlar bir ajanın veri almasını, e-posta göndermesini, kod çalıştırmasını, veritabanlarını sorgulamasını ve hatta donanımı kontrol etmesini sağlar. Google bunları bilmeye değer üç türe ayırır:

  • Uzantılar (Extensions). Harici bir API'ye standartlaştırılmış bir köprü; böylece ajan, ortak bir arayüz üzerinden birçok sisteme ölçeklenebilir.
  • Fonksiyonlar (Functions). Ajanın çağırabileceği belirli yetenekler, kendi yazılımınızdaki tek bir işlem gibi.
  • Veri depoları (Data Stores). Vektör veritabanları ve alma (RAG); bunlar, ajana yalnızca modelin eğitim sırasında ezberlediğine güvenmek yerine güncel ve temellendirilmiş bilgi sağlar.

İşte teorinin gerçekle buluştuğu yer burası. Anthropic'in ajanlar için üç temel tasarım ilkesi şudur: basit tutun, şeffaf tutun (planlama adımlarını gösterin) ve ajan-bilgisayar arayüzünü (ACI) özenle tasarlayın. Bu sonuncusu, sessizce işi kuran veya bozan etkendir. Belirsiz, kötü belgelenmiş bir araç, kafası karışık ve hataya yatkın bir ajan üretir. Net bir araç tanımı ise güvenilir bir ajan üretir. Araçları iyi bağlamak bir mühendislik işidir, bir onay kutusu değil.

Ajan belleği nedir ve neden bu kadar önemli?

Çoğu açıklamanın hafife aldığı kısım budur. IBM problemi açıkça ortaya koyar: dil modelleri durumsuzdur ve doğaları gereği bir şey hatırlamazlar. Her tur boş bir sayfadan başlar. Bellek, bir ajanın geçmiş etkileşimlerden öğrenmesini, bilgiyi saklamasını ve bağlamı korumasını sağlayan katmandır. Bellek olmadan ajanınız, bağlam penceresi dolduğu anda müşterinin adını, yaptığı planı ve az önce çağırdığı aracın sonucunu unutur.

Bellek iki katmanda gelir ve uzun vadeli katmanın üç türü vardır. AWS ve IBM bu konuda aynı çizgide:

Bellek türüNe tutarGünlük örnek
Kısa vadeliCanlı bağlam penceresi, mevcut konuşmaŞu anda yürüttüğünüz görevdeki sohbet geçmişi
Uzun vadeli: epizodikBelirli geçmiş olaylarBir müşterinin önceki destek kaydında ne olduğu
Uzun vadeli: anlamsalYapılandırılmış gerçekler, tanımlar ve kurallarÜrün kataloğunuz, politikalarınız
Uzun vadeli: prosedürelÖğrenilmiş beceriler ve davranışlarİade sürecinizi adım adım nasıl işleteceği

Google belleği, durumu, akıl yürütmeyi ve planlamayı düzenleme katmanında bir araya getirir; bu katmana ajanın sinir sistemi der. Doğru zihinsel tablo budur: bellek bir eklenti değildir, döngünün içine örülmüştür.

Ve gerçek dünyadaki güvenilirlik ve maliyet aslında bellekte yatar. Anthropic, modelin özel bir bellek dizininde dosya oluşturabildiği, okuyabildiği, güncelleyebildiği ve silebildiği dosya tabanlı bir sistem olan bellek aracından sayılar yayınladı; bu dizin konuşmalar boyunca kalıcıdır ve bağlam penceresinin dışında durur. Modelin token sınırına yaklaştıkça eskimiş araç çağrılarını otomatik olarak temizleyen bağlam düzenlemeyle birleştirildiğinde, sonuçlar hiç de küçük değildi:

  • Bellek aracı artı bağlam düzenleme, Anthropic'in dahili çok adımlı değerlendirmesinde ajansal arama performansını referans değere göre %39 iyileştirdi.
  • Bağlam düzenleme tek başına aynı değerlendirmede performansı %29 iyileştirdi.
  • 100 turluk bir web arama testinde, bağlam düzenleme token tüketimini %84 azalttı ve ajanların aksi takdirde bağlam tükenmesinden başarısız olacak iş akışlarını bitirmesine olanak verdi.

Bu sayıları bir kez daha okuyun. Çalışan bir ajan ile görevin ortasında belleği tükenen bir ajan arasındaki fark, büyük ölçüde bir bellek ve bağlam yönetimi kararıdır. İşte bu yüzden belleği, bir diyagramdaki üçüncü kutu olarak değil, sistemin kahramanı olarak ele alıyoruz.

Dört kaynak nerede hemfikir?

Teknik olmayan bir alıcı için güven veren kısım uzlaşıdır. Her şirketin kelime dağarcığını bir kenara bırakırsanız, anatomi aynıdır:

ParçaAnthropicAWSGoogleIBM
Akıl yürütmeKendi sürecini yönlendiren dil modeliAkıl yürütme motoru olarak temel modelModel, beyin ve karar vericiAjansal akıl yürütme, karar verme
YapmaAraçlar ve alma eklentileriAraçlar (API'ler, kod, veritabanları)Araçlar, eller ve gözlerEylem modülü
HatırlamaBellek artı bağlam yönetimiKısa vadeli ve uzun vadeli bellekDüzenleme katmanındaki bellekBellekle durumlu hale getirilen durumsuz dil modeli
DöngüHer adımda ortamdan gelen yer gerçeğiBelirle, edin, uygula, değerlendirDüzenleme katmanı hedefe kadar dönerÖnce planla, sonra harekete geç, sonra uyarla

Aynı makine, dört lehçe. Planlayan ve akıl yürüten bir model, harekete geçen araçlar, kalıcı olan bir bellek; hepsi her adımda gerçekliği kontrol eden bir döngüde çalışır.

Peki bir ajan kurmak neden hâlâ zor?

Anatomi bu kadar netse, neden bu kadar çok ajan projesi takılıp kalıyor? Çünkü her kaynak döngüyü kendi kendine işliyormuş gibi tarif eder ve hiçbiri onu kimin çalışır tuttuğundan söz etmez.

Pratikte zor olan kısım döngü değildir. Onun etrafındaki mühendisliktir. Anthropic'in kendi rehberliği şudur: işe yarayan en basit şeyle başlayın (çoğu zaman tam özerk bir ajan değil, sabit bir iş akışı), her aracı özenle tanımlayın, her adımda ajana ortamdan dürüst geri bildirim verin ve bağlamı, görevin ortasında belleği tükenmeyecek şekilde yönetin. Bunların her biri süregelen bir iştir: araç arayüzünü tasarlamak, belleği yapılandırmak, bir bağlam yönetimi stratejisi seçmek ve ajanın daha iyiye mi gittiğini yoksa sessizce mi savrulduğunu size söyleyen değerlendirme döngüsünü kurmak.

İşte çoğu şirketin kadrosuna katamadığı boşluk tam olarak budur. Artık mekanizmayı anlıyorsunuz. Mekanizmayı, işletmenizin içinde gün be gün güvenilir biçimde çalışan bir şeye dönüştürmek başka bir iştir. Yaptığımız iş de budur: ajanları (araçları, belleği, bağlam stratejisini ve değerlendirmeleri) şirketinizin içinde biz planlar, kurar ve işletiriz; böylece bir bilim projesi yerine işleyen bir sisteme sahip olursunuz.

Kanonik zihinsel modelin çalışan bir ajana dönüşmesini istiyorsanız, aşağıdan ücretsiz bir danışma görüşmesi ayırtın; ilkini birlikte haritalandıralım.