SecondOS Benchmark

Bir AI'a codebase'ini vermek ne kadara mal olur

Yapı-farkında codebase hafızası için kendi açık benchmark'ımız, SecondOS'un içinde olduğu kategori. Beş gerçek repo'da, her birinde üç koşulda ölçüldü. Makineyi yalnızca toplu token sayıları terk eder; kaynağın asla (K‑S23).

~5–9×
soğuk bir ajana kıyasla soru başına daha az token
~2.6k
sınırlı harita, 51 ya da 2.302 dosyada aynı
100% / 0.96
kod-arama p@1 · hafıza-recall MRR

Üç koşul, beş gerçek repo

Yönlenme maliyeti, bir ajanın bir codebase'i anlamak için yüklemesi gereken token'lar, üç koşul altında: ajan (hafıza yok, kaynağı yeniden okur), ajan + hafıza (elle yazılan dokümanlar, indekssiz, çabuk çürür) ve ajan + SecondOS (harita: yalnızca yapı, otomatik üretilen, sorgu-kapsamlı).

ajan · kaynakajan + hafıza · dokümanajan + SecondOS · harita
secondos
AI hafıza (bu repo) · 313 dosya
kaynak 440kdoküman 72kSecondOS 3k
primdb
altyapı platformu · 663 dosya
kaynak 1.4Mdoküman 213kSecondOS 3k
tcg-terminal
koleksiyon uygulaması · 51 dosya
kaynak 168kdoküman 3kSecondOS 700
gurulu
ürün analitiği · 1,989 dosya
kaynak 3.9Mdoküman 839kSecondOS 2k
adem
eng-ops platformu · 2,302 dosya
kaynak 2.7Mdoküman 339kSecondOS 2k
Repoajan (kaynak)+ hafıza (doküman)+ SecondOSkaynağa karşıdokümana karşı
secondos · 313 dosya440k72k3k169×28×
primdb · 663 dosya1.4M213k3k550×82×
tcg-terminal · 51 dosya168k3k700240×4.1×
gurulu · 1,989 dosya3.9M839k2k1695×365×
adem · 2,302 dosya2.7M339k2k1205×154×

Harita sınırlı kalır, repo boyutu ne olursa olsun ~2–2.6k token (51 dosya ya da 2.302), hem kaynak hem de elle yazılan dokümanlar sınırsızca büyürken: bu, bu repo'da tüm kaynaktan 193× daha küçük ve beşi genelinde 166–1.689×. Ayrıca dokümanların aksine harita sorgu-kapsamlıdır ve kod hareket ettikçe taze kalır.

Soru başına

Gerçek retrieval yolu üzerinden, search_codebase'in arkasındaki aynı motor, aynı top‑K dosya, tam kaynağa karşı harita kartları.

4.7×
secondos · 313 dosya
5.6×
gurulu · 1.989 dosya
8.8×
tcg-terminal · 51 dosya · ürün üzerinden canlı cevaplandı

Yalnızca token sayısı değil, kalite

100%
kod arama precision@1 · MRR 1.000 (34-sembol fixture, rerank açık)
92%
hafıza recall precision@1 · MRR 0.960 (48 distractor, yalnızca vektör)
4 / 4
hafıza değişmezleri: taze > bayat · süre & çelişki etiketli
7 repos
graf çözümü: Python 60 · PHP 57 · Rust 51 · Java 45 · TS 40 · Go 24 · Ruby 9 (kararlaştırılabilir çağrıların %'si, asla tahmin edilmez)

Dürüst tutuldu

Manşet, soru başına

Sınırlı harita ile tüm kaynak karşılaştırması 166–1.689×'e çıkar, ama bunu üst sınır olarak etiketleriz. Bir soruyu cevaplamak için ödediğin, dürüst sayıdır.

Aynı kaldıraç, ters etki

Bir reranker kod-arama precision'ını yükseltir ama hafıza recall'ını düşürür −12pt, o yüzden aramada açık, hafızada kapalı gönderilir. İkisini de raporlarız.

Bir precision duruşu

Graf kuyruğu, tahmin etmek yerine bilinmiyor olarak işaretlediğimiz instance-method dispatch'tir. Fixture'lar %100 çözülür, gerçek repolar daha az, gerçek sayıyı raporlarız.

Neden kendi benchmark'ımız?

LOCOMO / DMR konuşma recall'ını ölçer, farklı bir kategori. “AI'ın bu codebase'i anlıyor mu” için bir standart yok, o yüzden birini açıkta tanımlıyoruz.

Kendi repo'nda yeniden üret

Aldığın sayı senin, bizim değil.

secondos sync /path/to/your/repo
bun scripts/benchmark-3way.ts     /path/to/your/repo   # agent / +memory / +SecondOS
bun scripts/benchmark-context.ts  /path/to/your/repo   # tokens per question

Tüm metodolojiyi mi istiyorsun: fixture'lar, yapısal değişmezler, hoş olmayan sayılar? Nasıl ölçtüğümüzü oku →

Şimdi kendi repo'nda çalıştır

Tek senkron ve AI'ın ~5× daha az okur. Makinende ücretsiz, kredi kartı yok.