Onderzoek
Uitzoeken wat er werkelijk staat
Een onderwerp uitpluizen tot de bewering en het bewijs uit elkaar te houden zijn. Elk stuk hier zegt wat er gemeten is, wat daaruit volgt, en waar het ophoudt — met de bronnen erbij, zodat je het kunt natrekken zonder mij te geloven. En met een prompt eronder, zodat je kunt zien of je eigen systeem er iets mee kan.
- Agents & pijplijnen
Context is een eindige hulpbron, geen emmer
Waarom een groter contextvenster een agent niet betrouwbaarder maakt, en welke vier technieken de aandacht van een model wél efficiënt besteden.Lees het stuk → - Modellen & evaluatie
Een groene testsuite bewijst niet dat de patch klopt
Bijna een derde van de patches die op SWE-bench Verified slagen, gedraagt zich anders dan de referentie. Wat dat betekent voor wie agents in een pijplijn zet.Lees het stuk → - Modellen & evaluatie
Modelkeuze is een architectuurbeslissing, geen prijsvergelijking
Tien keer prijsverschil tussen het duurste en het goedkoopste model, drie redenen waarom dat getal misleidt, en wat een gepinde model-ID betekent voor je pijplijn.Lees het stuk →
Waar dit over gaat
- Agents & pijplijnenTechnieken om autonome systemen bruikbaar te houden over lange taken, en wat dat vraagt van de machinerie eromheen.
- Modellen & evaluatieWat er uit de modellen en de benchmarks komt, en wat daarvan overeind blijft zodra je het op echt werk loslaat.
Nieuwe stukken verschijnen ook in de RSS-feed.