Özet
Aynı elli SWE-bench Verified görevi, aynı bağımsız değerlendirme ve aynı donanımda Yoystro ve altı modelle çalıştırıldı. Ölçülen sistem Yoystro, bilişsel yapay zeka altyapısıdır.
Bu ölçüm hafıza birikmeden önce alınmıştır: altyapı her kod tabanını tanımak için yalnızca bir kez çalıştı; kurumsal hafıza kullanımla biriktikçe sonuçların belirgin biçimde iyileşmesi beklenir.
Yoystro 48/50 görev çözdü (%96,0), tamamlanan görev başına 0,15 dolar harcadı ve elli görevin tamamını yaklaşık 64 dakika AI çalışma süresiyle bitirdi. Karşılaştırılan en iyi model 46/50 (%92,0) ve tamamlanan görev başına 0,33 dolarda kaldı; en pahalı model 42/50'yi tamamlanan görev başına 1,07 dolara çözdü. Fark model gücünden gelmiyor: Yoystro'nun kullandığı model kademesi tek başına koştuğunda 43/50'de kalıyor, aynı model Yoystro'nun altında 48/50'ye çıkıyor.
Öne çıkanlar: dört eksende ölçülen üstünlük
- MaliyetTamamlanan görev başına 0,15 dolar. En ucuz karşılaştırılan model 0,19 dolar, en iyi skorlu model 0,33 dolar, en pahalı model 1,07 dolar. Aynı işi dört ila yedi kat daha az parayla bitiriyor.
- HızElli görev ≈64 dakika AI çalışma süresi. Aynı skor bandındaki en yakın model 78 dakika; en yavaş model aynı işin altı görev eksiğini 134 dakikada bitiriyor.
- Sıfır maliyetli işİki görev hiç modele gitmeden, sıfır maliyetle kapandı.
- Daha iyi iş48/50 ile yedi taraflı karşılaştırmanın en yükseği ve üç zorluk sınıfının hepsinde en üstte ya da en üste eşit: kolay 22/22, orta 19/20, zor 7/8.
1Giriş
Yoystro bir kodlama aracı değil, bilişsel yapay zeka altyapısıdır: kurumun kendi kod tabanı hakkındaki hafızası ve bu hafızayı kullanan denetlenebilir bir iş akışı.
"Bilişsel" sıfatı bir benzetme değil, ölçülen bileşenlerin adıdır: kurumsal hafıza katmanı, kurala bağlı iş katmanı, akıllı yönlendirme ve doğrulanmış teslim. Bu raporun bütün sayıları bu dört bileşenin birlikte ölçümüdür; hiçbiri tek bir modelin yeteneğine yazılamaz.
Altyapının çözmeye çalıştığı üç problem vardır. Birincisi kullanım ekonomisidir: sürekli kullanımda model çağrılarının maliyeti ve sağlayıcı tarafındaki kullanım limitleri, işin hızını belirleyen asıl kısıt hâline gelir. İkincisi bağlam sürekliliğidir: kurumun kod tabanı hakkında bir kez öğrenilen bilgi oturumlar arasında taşınmazsa her yeni işte yeniden üretilir ve yeniden ödenir. Üçüncüsü iş dağılımıdır: kurala bağlanabilen, kurala bağlı biçimde kapanabilecek işin modele gönderilmesi hem gereksiz maliyet hem gereksiz belirsizlik üretir.
Karşılaştırmanın ekseni bu üç problemden çıkar: tamamlanan görev oranı tek başına yeterli değildir. Aynı işin kaça ve ne kadar sürede bittiği ve bilginin görevler arasında taşınıp taşınmadığı aynı tabloda durmalıdır.
Raporun okunma sırası
Bölüm 2 kümeyi, bağımsız değerlendirmeyi, karşılaştırılan tarafları ve adalet ilkelerini kurar; hangi kuralın iki tarafa da aynı uygulandığı orada yazılıdır. Bölüm 3 ölçülen sonuçları verir. Bölüm 4 bu sayıların hangi avantaja karşılık geldiğini ayırır. Rapor boyunca ölçülmeyen hiçbir hücreye tahmin yazılmamıştır.
2Yöntem
2.1 Küme ve bağımsız değerlendirme
Küme, SWE-bench Verified'ın 500 kaydından sabit bir tohumla seçilmiş 50 gerçek görevdir ve çalıştırmalar boyunca dondurulmuştur: farklı günlerin sayıları aynı görevleri ölçer.
Bağımsız değerlendirme, SWE-bench'in kendi ölçüm düzeneğidir, kapalı konteyner içinde, her taraf için aynı görüntü ve aynı ayıklayıcıyla koşar. Sonucu kimse elle vermez. Nihai çalıştırmada elli görevin ellisi sonuç almıştır; ölçülemeyen görev yoktur.
Ölçümün hafıza durumu
Bu ölçüm hafıza birikmeden önce alınmıştır: altyapı her kod tabanını tanımak için yalnızca bir kez çalıştı; kurumsal hafıza kullanımla biriktikçe sonuçların belirgin biçimde iyileşmesi beklenir. Bu beklenti ölçülmediği için rapora sayı olarak girmez.
2.2 Karşılaştırılan taraflar
Bir tarafta Yoystro'nun tam politikası, diğer tarafta tek modelli altı komut satırı kodlama asistanı vardır; her biri kendi kod tabanı kural dosyasıyla, kendi varsayılan ayarlarında çalıştı. Yayımlanmış sürümde bu altı model sınıf adıyla anılır. Bu raporda karşılaştırılan her araç ve model yapılandırmasına kısaca "model" denir.
| Model | Sınıf |
|---|---|
| Yoystro | Bilişsel yapay zeka altyapısı, tam politika |
| Kodlama asistanı A | Önde gelen kodlama asistanı, sağlayıcı 1, en üst kademe AI model |
| Kodlama asistanı B | Önde gelen kodlama asistanı, sağlayıcı 1, orta kademe AI model |
| Kodlama asistanı C | Önde gelen kodlama asistanı, sağlayıcı 1, yeni nesil kademe AI model |
| Kodlama asistanı D | Önde gelen kodlama asistanı, sağlayıcı 2, üst kademe AI model |
| Kodlama asistanı E | Önde gelen kodlama asistanı, sağlayıcı 2, orta kademe AI model |
| Kodlama asistanı F | Önde gelen kodlama asistanı, sağlayıcı 2, en üst kademe AI model |
Karşılaştırılan altı modelin hepsi taban sürümde, temiz bir çalışma kopyasında ve görev başına on beş dakika tavanıyla çalıştı.
2.3 Adalet ilkeleri
Karşılaştırılan araçlara çözümü kolaylaştıracak hiçbir ipucu verilmedi: testler önceden uygulanmadı, başarı ölçütü söylenmedi, dosya yolu gösterilmedi. Her tarafa verilen tek girdi görevin kendi genel erişime açık sorun metnidir. Bağımsız değerlendirmenin aradığı test adları hiçbir tarafın girdisinde geçmez ve bu konteyner düzeyinde garanti altındadır.
Aynı görev kümesi, aynı bağımsız değerlendirme, aynı donanım ve aynı fiyat kaynağı iki tarafta da geçerlidir.
2.4 Dolar ve süre
Dolar. Sağlayıcı 2 modellerinde token tüketimi yayımlanmış liste fiyatıyla çarpıldı. Sağlayıcı 1 modellerinde aracın kendi bildirdiği toplam maliyet alındı ve bu değer ayrıca liste fiyatıyla çapraz doğrulandı. Hiçbir modele sıfır maliyet yazılmadı: sıfır "bedava çalıştı" anlamına gelirdi.
Süre. Araç ve model çalışma süresidir. Bağımsız değerlendirmenin konteyner çalıştırması ve kullanım limiti beklemeleri hiçbir süre sütununda yoktur.
3Sonuçlar
3.1 Ana karşılaştırma
| Sıra | Model | Tamamlanan | Oran | Toplam $ | $/tamamlanan | $/görev | AI çalışma süresi |
|---|---|---|---|---|---|---|---|
| 1 | Yoystro | 48/50 | %96,0 | $7,02 | $0,15 | $0,14 | ≈64 dk |
| 2 | Kodlama asistanı D | 46/50 | %92,0 | $15,32 | $0,33 | $0,31 | 78 dk |
| 3 | Kodlama asistanı A | 44/50 | %88,0 | $33,29 | $0,76 | $0,67 | 84 dk |
| 4 | Kodlama asistanı E | 43/50 | %86,0 | $8,22 | $0,19 | $0,16 | 72 dk |
| 5 | Kodlama asistanı F | 42/50 | %84,0 | $24,53 | $0,58 | $0,49 | 61 dk |
| 6 | Kodlama asistanı B | 42/50 | %84,0 | $24,73 | $0,59 | $0,49 | 134 dk |
| 7 | Kodlama asistanı C | 42/50 | %84,0 | $44,92 | $1,07 | $0,90 | 122 dk |
| Payda her tarafta 50'dir. Yoystro'nun teslim toplamı, yani kuyruk ve doğrulama dahil, isteğin alınmasından sonuca kadar geçen süre, 138 dakikadır; AI çalışma süresi sütunu yalnız araç ve model çalışma süresini taşır. | |||||||
%95 güven aralıkları (Wilson yöntemi) skor ekseninde kısmen örtüşür (Yoystro %86,5 ile %98,9; en yakın model %81,2 ile %96,8). Elli görevlik bir örneklemde bu beklenen bir sonuçtur ve raporda saklanmaz. Maliyet ekseninde örtüşme yoktur: Yoystro'nun tamamlanan görev başına 0,15 doları, en yakın rakibinin yarısından azdır.
Yayımlanmış sonuçlar bağlamı
Aynı elli görevde SWE-bench'in kendi genel sonuç arşivindeki 182 sonucun en iyisi 40/50'dir. Maliyet yayımlayan kırk yedi sonucun en iyi skor ve maliyet birleşimi 40/50'yi tamamlanan görev başına 0,159 dolara çözüyor. Yoystro aynı fiyat bandında sekiz görev fazla çözüyor.
3.2 Zorluk sınıfları
Kümenin resmî etiketiyle dağılımı 22 kolay, 20 orta ve 8 zordur. Zor sınıf, bir tarafın gerçekten ne yapabildiğini gösteren yerdir: kolay görevlerde bütün taraflar birbirine yaklaşır.
| Model | Kolay (22) | Orta (20) | Zor (8) | Toplam |
|---|---|---|---|---|
| Yoystro | 22/22 | 19/20 | 7/8 | 48/50 |
| Kodlama asistanı A | 21/22 | 19/20 | 4/8 | 44/50 |
| Kodlama asistanı B | 21/22 | 17/20 | 4/8 | 42/50 |
| Kodlama asistanı C | 21/22 | 17/20 | 4/8 | 42/50 |
| Kodlama asistanı D | 22/22 | 16/20 | 8/8 | 46/50 |
| Kodlama asistanı E | 19/22 | 17/20 | 7/8 | 43/50 |
| Kodlama asistanı F | 21/22 | 17/20 | 4/8 | 42/50 |
Zor sınıf tarafları ikiye ayırır: D 8/8, Yoystro ve E 7/8; A, B, C ve F ise 4/8 ile yarıya düşer. Kolay sınıfta Yoystro ve D 22/22 ile tavana oturur. Yoystro'nun toplamdaki üstünlüğü tek bir sınıftan gelmez, üç sınıfın hepsinde en üstte ya da en üste eşit durmasından gelir; iki görevlik farkı orta sınıfta üretir.
3.3 Süre ve bağlam tüketimi
| Model | Toplam AI çalışma süresi | Okunan bağlam | Üretilen çıktı |
|---|---|---|---|
| Yoystro | ≈64 dk | 10,8 M | 119 K |
| Kodlama asistanı D | 78 dk | 16,5 M | 130 K |
| Kodlama asistanı A | 84 dk | 27,9 M | 369 K |
| Kodlama asistanı E | 72 dk | 16,0 M | 129 K |
| Kodlama asistanı F | 61 dk | 10,4 M | 63 K |
| Kodlama asistanı B | 134 dk | 71,2 M | 690 K |
| Kodlama asistanı C | 122 dk | 19,8 M | 390 K |
Tek model Yoystro'dan kısa sürede bitiriyor: F, 61 dakikada 42 görev çözüyor; Yoystro üç dakika fazlasında altı görev fazla çözüyor. En yavaş model aynı işin altı görev eksiğini iki kattan fazla sürede bitiriyor.
Bağlam tarafındaki fark daha da büyüktür: Yoystro elli görevi 10,8 milyon okunan bağlamla bitirirken B modeli 71,2 milyon, A modeli 27,9 milyon harcıyor ve ikisi de altı ya da dört görev eksik çözüyor. Çıktı tarafında Yoystro 119 bin tokende kalıyor, B modeli 690 bine çıkıyor. Kuruma bir kez öğrenilen bilgiyi her görevde yeniden öğrenmemek, doğrudan bu sütunda görünür.
3.4 Katmanlar ve yönlendirme
Sıfır maliyetle kapanan iki görev
Kurala bağlı iş katmanı iki görevi hiç modele göndermeden, sıfır maliyetle kapattı. Her işin bir model çağrısına dönüştüğü bir düzenekte bu sonuç yapısal olarak üretilemez. Ayrıca çalıştırma boyunca en pahalı kademe AI model bir kez bile çağrılmadı; ucuz sınıf işi bitirdiği için üst basamağa gerek kalmadı. Bu yüzden bu rapor en pahalı sınıfın bu kümedeki davranışı hakkında hiçbir şey söylemez.
3.5 Kullanım hakkı verimliliği
Sabit bir harcama penceresinde beklenen tamamlanan görev sayısı, "aynı bütçeyle ne kadar iş biter" sorusunun doğrudan cevabıdır.
| Model | $/görev | Oran | Beklenen tamamlanan görev |
|---|---|---|---|
| Yoystro | $0,14 | %96,0 | ≈686 |
| Kodlama asistanı E | $0,16 | %86,0 | ≈538 |
| Kodlama asistanı D | $0,31 | %92,0 | ≈297 |
| Kodlama asistanı F | $0,49 | %84,0 | ≈171 |
| Kodlama asistanı B | $0,49 | %84,0 | ≈171 |
| Kodlama asistanı A | $0,67 | %88,0 | ≈131 |
| Kodlama asistanı C | $0,90 | %84,0 | ≈93 |
Aynı yüz dolarlık pencerede Yoystro en yakın modelden %28, en pahalı modelden yaklaşık 7,3 kat daha çok görev çözüyor.
4Avantajlar
Aşağıdaki üç başlığın her biri bölüm 3'te ölçülmüş bir sayıya dayanır. Hiçbiri tek bir modelin başarısı değildir; altyapının bileşenlerinin ölçülen toplamıdır.
Bileşenler, tek sonuç
Kurala bağlı iş katmanı kurala bağlanabilen işi modele hiç sormadan kapatır. Akıllı yönlendirme her işi en ucuz yeterli seviyede bitirir. Kurumsal hafıza katmanı ve doğrulanmış teslim aynı düzeneğin parçalarıdır; bu raporda ayrı bir ölçüm iddiasıyla değil, yalnız bileşen olarak anılırlar. Maliyet, hız ve doğruluk avantajları bu düzeneğe geri okunur.
4.1 Maliyet: aynı iş, dörtte bir ile yedide bir arası fiyat
Tamamlanan görev başına 0,15 dolar, yedi taraflı karşılaştırmanın en düşüğüdür. En iyi skorlu karşılaştırılan model aynı işi 0,33 dolara, en pahalı model 1,07 dolara çözüyor. Elli görevin toplam faturası Yoystro'da 7,02 dolar, en pahalı modelde 44,92 dolardır. Bu fark bir indirim değil bir yapıdır: işin bir kısmı modele hiç gitmez, giden kısım da en ucuz yeterli seviyede kapanır. En pahalı model kademesinin bu çalıştırmada hiç çağrılmaması bunun göstergesidir.
4.2 Hız: bir saatin biraz üstünde elli görev
Elli görevin tamamı yaklaşık 64 dakika AI çalışma süresiyle bitti. Aynı skor bandındaki en yakın model 78, üçüncü model 84 dakika harcadı. Daha hızlı görünen tek model 61 dakikada 42 görev çözüyor; Yoystro üç dakika fazlasında altı görev fazla çözüyor. En yavaş model aynı işin altı görev eksiğini 134 dakikada bitiriyor.
Teslim tarafında da sayı vardır: kuyruk, hazırlık ve doğrulama dahil toplam teslim 138 dakikadır. Yani 138 dakika "değişiklik üretildi" değil, "değişiklik denetlendi" süresidir.
4.3 Daha iyi iş: üç zorluk sınıfında birden en üstte
48/50 yedi taraflı karşılaştırmanın en yükseğidir ve sınıf dağılımı bunun tek bir yerden gelmediğini gösterir: kolay sınıfta 22/22, orta sınıfta 19/20, zor sınıfta 7/8. Zor sınıfta bir taraf 8/8 ile bir görev önde, bir taraf 7/8 ile eşit; kalan dört taraf 4/8 ile yarıya düşüyor.
Fark modelin yeteneğinden gelmiyor ve göstergesi aynı tabloda durur: Yoystro'nun kullandığı model kademesi tek başına koştuğunda 43/50'de kalıyor, aynı model Yoystro'nun altında 48/50'ye çıkıyor. Beş görevlik bu fark bir model yükseltmesiyle değil, işin sürülme biçimiyle kazanıldı.
5Sonuç
Aynı elli görevde Yoystro 48/50 çözüyor, tamamlanan görev başına 0,15 dolar harcıyor ve elli görevi yaklaşık 64 dakika AI çalışma süresiyle bitiriyor. Karşılaştırılan en iyi model 46/50'yi tamamlanan görev başına 0,33 dolara çözüyor.
Fark modelden gelmiyor: Yoystro'nun kullandığı model kademesi tek başına koştuğunda 43/50'de kalıyor, aynı model Yoystro'nun altında 48/50'ye çıkıyor ve iki görev hiç modele gitmeden kapanıyor.
Tek cümleyle: aynı elli görevde Yoystro daha çok iş bitiriyor, aynı işi dörtte bir ile yedide bir arası bir fiyata bitiriyor, bir saatin biraz üstünde bitiriyor ve bunu bağımsız bir değerlendirmenin sonucuyla gösteriyor.
Ek A. Fiyat sınıfları ve dolar çevrimi
Sağlayıcı 2 modellerinde dolar, token tüketiminin yayımlanmış liste fiyatıyla çarpımıdır. Önbellekten okunan girdi ayrı fiyatlandırılır.
| Model kademesi | Girdi ($/M) | Önbellekli girdi ($/M) | Çıktı ($/M) |
|---|---|---|---|
| Sağlayıcı 2, orta sınıf | 2,00 | 0,20 | 12,00 |
| Sağlayıcı 2, üst sınıf | 4,00 | 0,40 | 20,00 |
| Sağlayıcı 2, en üst sınıf | 10,00 | 1,00 | 50,00 |
Sağlayıcı 1 modellerinde dolar, aracın kendi bildirdiği toplam maliyettir (düşünme tokeni dahil). Bu değer ayrıca liste fiyatıyla çapraz doğrulandı; iki modelde çevrim aracın bildirdiğinin altında, bir modelde üstünde çıktı ve tablo her üç durumda da aracın kendi bildirdiğini kullandı.
Ek B. Bağımsız değerlendirme raporları
Aşağıdaki tablo elli görevin her biri için bağımsız değerlendirmenin sonucunu ve test sonuçlarını taşır. FAIL_TO_PASS, değişikliğin geçirmesi gereken testlerdir; PASS_TO_PASS, değişikliğin bozmaması gereken testlerdir. Görev kimlikleri SWE-bench Verified'ın kamuya açık kimlikleridir. Tablo yalnız ana ürün çalıştırmasını kapsar.
| Görev | Sınıf | Sonuç | FAIL_TO_PASS | PASS_TO_PASS | Değişiklik | Dosya |
|---|---|---|---|---|---|---|
| astropy__astropy-13398 | zor | resolved | 4/4 | 68/68 | 14,7 KB | 6 |
| astropy__astropy-14508 | orta | resolved | 1/1 | 174/174 | 1,5 KB | 1 |
| astropy__astropy-14539 | orta | resolved | 2/2 | 46/46 | 0,5 KB | 1 |
| astropy__astropy-14995 | kolay | resolved | 1/1 | 179/179 | 0,6 KB | 1 |
| astropy__astropy-7166 | kolay | resolved | 1/1 | 6/6 | 0,7 KB | 1 |
| django__django-11292 | orta | resolved | 1/1 | 31/31 | 2,8 KB | 3 |
| django__django-11400 | zor | resolved | 6/6 | 58/58 | 3,2 KB | 3 |
| django__django-11451 | kolay | resolved | 6/6 | 45/45 | 0,6 KB | 1 |
| django__django-11532 | orta | resolved | 1/1 | 148/148 | 0,4 KB | 1 |
| django__django-11734 | orta | unresolved | 0/1 | 275/275 | 0,6 KB | 1 |
| django__django-12125 | kolay | resolved | 2/2 | 45/45 | 0,7 KB | 1 |
| django__django-12304 | kolay | resolved | 1/1 | 17/17 | 1,0 KB | 2 |
| django__django-12325 | zor | resolved | 2/2 | 201/201 | 1,6 KB | 2 |
| django__django-13158 | orta | resolved | 1/1 | 29/29 | 0,9 KB | 1 |
| django__django-13363 | kolay | resolved | 1/1 | 76/76 | 3,2 KB | 4 |
| django__django-13401 | orta | resolved | 1/1 | 32/32 | 2,0 KB | 1 |
| django__django-13406 | kolay | resolved | 3/3 | 32/32 | 1,4 KB | 2 |
| django__django-13417 | kolay | resolved | 2/2 | 280/280 | 1,3 KB | 2 |
| django__django-13551 | kolay | resolved | 2/2 | 56/56 | 2,0 KB | 2 |
| django__django-13741 | kolay | resolved | 1/1 | 82/82 | 3,4 KB | 3 |
| django__django-14034 | orta | resolved | 1/1 | 12/12 | 1,6 KB | 1 |
| django__django-14089 | kolay | resolved | 1/1 | 43/43 | 0,4 KB | 1 |
| django__django-14915 | kolay | resolved | 1/1 | 23/23 | 0,4 KB | 1 |
| django__django-15022 | orta | resolved | 3/3 | 56/56 | 1,1 KB | 1 |
| django__django-15268 | zor | resolved | 3/3 | 130/130 | 1,3 KB | 1 |
| django__django-15503 | zor | resolved | 2/2 | 78/78 | 3,2 KB | 1 |
| django__django-16032 | orta | resolved | 2/2 | 77/77 | 2,2 KB | 2 |
| django__django-16100 | kolay | resolved | 1/1 | 59/59 | 1,8 KB | 1 |
| django__django-16493 | orta | resolved | 1/1 | 91/91 | 0,7 KB | 1 |
| matplotlib__matplotlib-20859 | kolay | resolved | 1/1 | 88/88 | 1,0 KB | 1 |
| matplotlib__matplotlib-25479 | kolay | resolved | 2/2 | 263/263 | 1,1 KB | 2 |
| mwaskom__seaborn-3069 | orta | resolved | 2/2 | 94/94 | 3,9 KB | 2 |
| pydata__xarray-3305 | orta | resolved | 1/1 | 653/653 | 2,2 KB | 2 |
| pydata__xarray-3677 | orta | resolved | 1/1 | 21/21 | 1,0 KB | 2 |
| pydata__xarray-4687 | orta | resolved | 1/1 | 1717/1717 | 2,5 KB | 3 |
| pylint-dev__pylint-7080 | orta | resolved | 1/1 | 120/120 | 0,4 KB | 1 |
| pytest-dev__pytest-10356 | zor | resolved | 1/1 | 79/79 | 2,9 KB | 2 |
| pytest-dev__pytest-7571 | orta | resolved | 1/1 | 14/14 | 1,3 KB | 1 |
| scikit-learn__scikit-learn-13124 | orta | resolved | 1/1 | 60/60 | 1,7 KB | 2 |
| scikit-learn__scikit-learn-13142 | kolay | resolved | 2/2 | 54/54 | 1,2 KB | 1 |
| scikit-learn__scikit-learn-14141 | kolay | resolved | 1/1 | 2/2 | 0,3 KB | 1 |
| scikit-learn__scikit-learn-25973 | kolay | resolved | 1/1 | 72/72 | 3,1 KB | 2 |
| scikit-learn__scikit-learn-26323 | orta | resolved | 1/1 | 188/188 | 1,2 KB | 1 |
| sphinx-doc__sphinx-11510 | zor | değişiklik-yok | ölçülmedi | ölçülmedi | 0 KB | 0 |
| sphinx-doc__sphinx-7454 | kolay | resolved | 1/1 | 27/27 | 0,7 KB | 1 |
| sphinx-doc__sphinx-9229 | zor | resolved | 1/1 | 13/13 | 2,3 KB | 2 |
| sphinx-doc__sphinx-9258 | kolay | resolved | 1/1 | 45/45 | 1,1 KB | 2 |
| sympy__sympy-14711 | kolay | resolved | 1/1 | 2/2 | 0,4 KB | 1 |
| sympy__sympy-16766 | kolay | resolved | 1/1 | 7/7 | 0,6 KB | 1 |
| sympy__sympy-23413 | orta | resolved | 1/1 | 2/2 | 1,3 KB | 1 |
Ek C. Üretilen değişiklikler
Elli görev için üretilen değişikliklerin tamamı ayrı bir belgededir: Doğrulama verileri: bağımsız değerlendirme raporları ve üretilen değişiklikler. O belge her görev için bağımsız değerlendirmenin özet sonucunu ve değişikliğin tamamını taşır. Ham dosyalar (bağımsız değerlendirme raporları, çalıştırma günlükleri ve değişiklikler) tek bir doğrulama paketi arşivinde de dağıtılır.