Model yeteneklerini doğrulamak için yapay zeka şirketlerinin başvurduğu yöntem olarak kıyaslama, sektörde norm haline geldi ve metrikler şirket lehine döndüğünde rakiplerin arasından sıyrılmak ve üstünlüklerini duyurmak için kullanılıyor. Başka bir deyişle iyi kıyaslamalar neredeyse her zaman iyi bir halkla ilişkiler anlamına geliyor.
Maalesef şirketler eski kıyaslama sistemlerini atlatmayı da öğrendi. Bunların birçoğu daha eski ve modern modellerin yeteneklerini ölçmek için tasarlanmadı.
2024'te kurulan girişim Vals, bu oldukça kusurlu sistemi düzeltme misyonunda olduğunu söylüyor. İki yıldan kısa sürede teknoloji sektöründe dikkat çeken bir konuma ulaştı ve geçen yıl 8VC ve Bloomberg Beta liderliğinde bir tohum yatırım turu sağladı. Ardından geçen ay hızlı büyüme döneminin ardından Andreessen Horowitz liderliğinde 40 milyon dolarlık Seri A yatırım aldı.
Şirketin 25 yaşındaki kurucu ortağı Rayan Krishnan daha önce Palantir'de staj yaptı ve Stanford'da lisans öğrencisiyken Microsoft ve okulun çok övülen yapay zeka laboratuvarında çalıştı. Krishnan, Vals'in benchmarking'in ölçmek için tasarlandığı sektörün ilerlemesinin gerisinde kalmasıyla ilgili kendi gözlemlerinden doğduğunu söylüyor.
"Yeni ve çok yetenekli modellerin pazara hızla çıktığını görüyorduk ve akademik kıyaslamalar bu öncü gelişmeye yetişemiyordu," diye anlatıyor Krishnan. Yapay zekanın toplumun her alanına entegre edilmesiyle kıyaslamaların aslında modellerin şirketlerin reklamını yaptığı şeyi yapıp yapamadığını doğrulamak için var olması gerektiğini söyledi.
Geçen hafta genç kurucu, San Francisco'nun Folsom Caddesi'ndeki şirketin iki katlı ofisini gezdirdi. Bir asır önce büyük bir bira fabrikasına ev sahipliği yapan eski bir tuğla bina. Bira üretimi yerine tarihi yapı şimdi teknoloji sektörünün geleceğini üretmeye çalışan bir dizi girişime ev sahipliği yapıyor.
"Tarihsel olarak değerlendirmenin zekayı çok soyut bir şekilde değerlendirmek için yapıldığını düşünüyorum," diyor Krishnan. "Modellerin bir baro sınavı tarzı teste girecek kadar bilgiye sahip olup olmadığını bilmek gibi."
Burada Vals kendini farklılaştırmayı hedefliyor. Birçok kıyaslama sistemi kamuya açık testler sunuyor. Bu durum bir şirketin modelini bu testlere göre eğitmesine, dolayısıyla sınavda hile yapmasına olanak tanıyabilir. Vals ise özel test materyallerini kamuya açıklamıyor. Genel bilgiyi ölçmek yerine Vals, modelleri hukuk, finans ve kodlama gibi belirli sektörlerle ilişkili karmaşık görevleri tamamlama yeteneğine göre de değerlendiriyor.
"Biz aslında modellerin gerçek etkilerine bakıyoruz," dedi Krishnan. "Her alanda insan kalitesinde bir ürün üreten işi yapabiliyorlar mı?"
Fikir sadece olumlu sonuçlara değil olumsuz sonuçlara da bakmak, diyor. Umarız modeller dünyaya salınırsa ne gibi olumsuz etkiler doğuracağını analiz edebiliriz.
Vals'in ölçtüğü yetenekler büyüyor. Daha geleneksel sektörlerin yanı sıra girişim daha özgün alanlara da yöneliyor. "Özyinelemeli kendini geliştirme konusunda bir kıyaslamamız var. Ruh sağlığı, siber güvenlik, biyogüvenlik ve hatta Cenevre Sözleşmesi'nin nasıl uygulanacağını anlamak için silahlı çatışma hukuku alanında da çalışıyoruz," diye paylaşıyor Krishnan.
Şirketler modellerini test ettirmek için Valsa ödeme yapıyor, bu kavramı kavramak tuhaf olabilir. Bir şirket neden modelinin iyi performans göstermediğini öğrenmek için para ödesin ki? Ancak etkili bir ölçüm şirketlerin zaman içinde sorun gidermesine ve gelişmesine yardımcı oluyor. Krishnan gelir modelini bir öğrencinin SAT sınavını almak için College Board'a ödeme yapmasına benzetiyor.
Bu değerlendirmeler ise yeni yapay zeka modelleri satın almayı düşünen şirketler için kilit karar verme faktörleri haline geliyor.
Girişim yakın zamanda gelirinin şu anda geçen yıla göre sekiz kat olduğunu açıkladı. Personel de büyüyor. Yılın başında sadece sekiz kişiyle başlayan Vals, ekibi 25 kişiye üç katına çıktı. Krishnan, girişim büyüdükçe planın önemli ölçüde daha büyük bir ofise taşınmak ve ek olarak 10 ila 15 kişi daha istihdam etmek olduğunu söyledi. Şirket ayrıca federal kurumlara model değerlendirmesi sağlama odaklı bir programı da yakın zamanda başlattı.
Krishnan, şirketinin kıyaslama sistemini yapay zeka şirketlerinin işlerini büyütme ve kamu güvenini tesis etme biçimlerinin geleceği olarak görüyor.
"Yapay zeka şirketleri halka açılmaya başlıyor. SpaceX halka açıldı. Anthropic bu yılın ilerleyen döneminde planlandı. OpenAI'nin de yakında halka açılacağını düşünüyorum. Yapay zeka modelleri ekonominin temel bir parçası haline geldikçe ve daha geniş şekilde yayıldıkça, bizim yaptığımız kıyaslama ve değerlendirme türleri kullanımını yönlendirecek ve bu şirketlerin kamu dosyalarını sunma veya yapay zekaya yapacakları olası yatırımlar hakkında konuşma biçimlerinin merkezi bir parçası olacak," dedi.