SecondOS Benchmark
Bir AI'a codebase'ini vermek ne kadara mal olur
Yapı-farkında codebase hafızası için kendi açık benchmark'ımız, SecondOS'un içinde olduğu kategori. Beş gerçek repo'da, her birinde üç koşulda ölçüldü. Makineyi yalnızca toplu token sayıları terk eder; kaynağın asla (K‑S23).
Üç koşul, beş gerçek repo
Yönlenme maliyeti, bir ajanın bir codebase'i anlamak için yüklemesi gereken token'lar, üç koşul altında: ajan (hafıza yok, kaynağı yeniden okur), ajan + hafıza (elle yazılan dokümanlar, indekssiz, çabuk çürür) ve ajan + SecondOS (harita: yalnızca yapı, otomatik üretilen, sorgu-kapsamlı).
| Repo | ajan (kaynak) | + hafıza (doküman) | + SecondOS | kaynağa karşı | dokümana karşı |
|---|---|---|---|---|---|
secondos · 313 dosya | 440k | 72k | 3k | 169× | 28× |
primdb · 663 dosya | 1.4M | 213k | 3k | 550× | 82× |
tcg-terminal · 51 dosya | 168k | 3k | 700 | 240× | 4.1× |
gurulu · 1,989 dosya | 3.9M | 839k | 2k | 1695× | 365× |
adem · 2,302 dosya | 2.7M | 339k | 2k | 1205× | 154× |
Harita sınırlı kalır, repo boyutu ne olursa olsun ~2–2.6k token (51 dosya ya da 2.302), hem kaynak hem de elle yazılan dokümanlar sınırsızca büyürken: bu, bu repo'da tüm kaynaktan 193× daha küçük ve beşi genelinde 166–1.689×. Ayrıca dokümanların aksine harita sorgu-kapsamlıdır ve kod hareket ettikçe taze kalır.
Soru başına
Gerçek retrieval yolu üzerinden, search_codebase'in arkasındaki aynı motor, aynı top‑K dosya, tam kaynağa karşı harita kartları.
Yalnızca token sayısı değil, kalite
Dürüst tutuldu
Manşet, soru başına
Sınırlı harita ile tüm kaynak karşılaştırması 166–1.689×'e çıkar, ama bunu üst sınır olarak etiketleriz. Bir soruyu cevaplamak için ödediğin, dürüst sayıdır.
Aynı kaldıraç, ters etki
Bir reranker kod-arama precision'ını yükseltir ama hafıza recall'ını düşürür −12pt, o yüzden aramada açık, hafızada kapalı gönderilir. İkisini de raporlarız.
Bir precision duruşu
Graf kuyruğu, tahmin etmek yerine bilinmiyor olarak işaretlediğimiz instance-method dispatch'tir. Fixture'lar %100 çözülür, gerçek repolar daha az, gerçek sayıyı raporlarız.
Neden kendi benchmark'ımız?
LOCOMO / DMR konuşma recall'ını ölçer, farklı bir kategori. “AI'ın bu codebase'i anlıyor mu” için bir standart yok, o yüzden birini açıkta tanımlıyoruz.
Kendi repo'nda yeniden üret
Aldığın sayı senin, bizim değil.
secondos sync /path/to/your/repo
bun scripts/benchmark-3way.ts /path/to/your/repo # agent / +memory / +SecondOS
bun scripts/benchmark-context.ts /path/to/your/repo # tokens per questionTüm metodolojiyi mi istiyorsun: fixture'lar, yapısal değişmezler, hoş olmayan sayılar? Nasıl ölçtüğümüzü oku →
Şimdi kendi repo'nda çalıştır
Tek senkron ve AI'ın ~5× daha az okur. Makinende ücretsiz, kredi kartı yok.