Project HydraFusion is een research preview binnen GitHub Copilot die gebruikmaakt van runtime-orchestratie om de beste AI-modellen te koppelen aan specifieke codeertaken. In plaats van één vast model, kiest het systeem adaptief tussen drie uitvoeringspatronen: Single (directe oplossing), Cascade (efficiënt model met een quality gate) en Critique (schrijvend model met een onafhankelijke reviewer).
De belangrijkste doelstelling is het balanceren van kwaliteit, kosten en latentie. Uit offline evaluaties op benchmarks zoals TerminalBench 2.1 blijkt dat HydraFusion de kwaliteit van Claude Opus 5 kan matchen of overtreffen, terwijl de geschatte kosten aanzienlijk lager liggen (tot 67% besparing).
Het systeem is gebouwd op vijf technische principes:
- Volledige boekhouding van kosten en gebruik.
- Begrensde uitvoering via time-outs.
- Geïsoleerde review in een read-only context.
- Fail-safe toepassing van patches.
- Gevalideerde routing vóór uitvoering.
Ontwikkelaars kunnen HydraFusion momenteel testen via de /experimental modus in de GitHub Copilot CLI.
Project HydraFusion: Frontier-kwaliteit via multi-model orchestratie
Ons doel is altijd geweest om ontwikkelaars het beste model voor de specifieke taak bij de hand te geven. Begin dit jaar hebben we dit vereenvoudigd door de lancering van Auto model selection, die jouw taak analyseert en koppelt aan het best geschikte model.
Vandaag introduceren we Project HydraFusion, een research preview die frontier-intelligentie levert via runtime-orchestratie. Het systeem stelt een volledig uitvoeringsplan op en kiest uit modellen van verschillende providers om concepten te schrijven, te bekritiseren en te herzien, of schaalt op naar krachtigere modellen om de taak te voltooien.
HydraFusion vervult een sleutelrol in onze algemene strategie om geautomatiseerde semantische routing tussen lokale, cloud- en compound-modellen te realiseren. Voor ontwikkelaars blijft deze complexiteit op de achtergrond: je selecteert HydraFusion zoals elk ander model, waarna het systeem een workflow kiest die prestaties, kosten en latentie voor elke taak in balans brengt.
Nu beschikbaar als research preview
HydraFusion is beschikbaar voor gebruikers op alle GitHub Copilot-abonnementen via /experimental in de GitHub Copilot CLI. Het gebruik is gebaseerd op de tokens die worden verbruikt door de modellen die HydraFusion aanroept, geprijsd tegen het standaardtarief van elk model.
Om HydraFusion in Copilot CLI te proberen:
- Voer
/update uit om de nieuwste versie te installeren.
- Voer
/experimental on uit.
- Voer
/model uit en selecteer vervolgens HydraFusion (Research Preview).
Feedback kan worden geplaatst in de GitHub Community.
Hoe HydraFusion werkt
HydraFusion benadert de selectie van workflows als een optimalisatieprobleem. Het maakt gebruik van capaciteitssignalen voor redeneren, codegeneratie, debugging en toolgebruik om het meest efficiënte uitvoeringspatroon te kiezen dat aan de kwaliteitsnorm voldoet.
Voor elk verzoek kiest HydraFusion momenteel een van de drie uitvoeringspatronen:
- Single (Enkelvoudig): Eén geselecteerd model lost de taak direct op.
- Cascade (Cascadering): Een efficiënt model schrijft een conceptoplossing en een kwaliteitscontrole (quality gate) bepaalt of dit wordt geaccepteerd of dat het verzoek wordt geëscaleerd naar een sterker model.
- Critique (Kritiek): Eén model schrijft een resultaat, een onafhankelijke read-only critic uit een andere modelfamilie beoordeelt dit (volgens hetzelfde reviewpatroon als Rubber Duck), en het schrijvende model voert vervolgens één revisie uit.
Elk patroon speelt in op een andere afweging tussen kwaliteit en kosten. Single behoudt snelheid en efficiëntie wanneer één model de taak direct kan oplossen. Cascade geeft een efficiënt model de eerste kans, terwijl er een route naar sterkere inferentie blijft bestaan als het concept niet door de acceptatiepoort komt. Critique voegt een onafhankelijk perspectief toe voor taken waarbij een review nuttiger is dan een tweede onbegeleide poging.
In offline evaluaties over drie agentic coding benchmarks toonde HydraFusion consequent frontier-niveau kwaliteit met aanzienlijke geschatte kostenbesparingen. Op TerminalBench 2.1 verbeterde het de geverifieerde taakkwaliteit met 4,9 procentpunt bij 67% lagere geschatte kosten vergeleken met Claude Opus 5.
Adaptieve multi-model orchestratie
Ontwikkelaars coördineren modellen al handmatig: ze kiezen één model voor een taak, vragen een ander om het werk te reviewen, of escaleren een moeilijk probleem naar een krachtiger model. HydraFusion integreert dit bekende proces in de runtime. Je kiest één keer voor HydraFusion en blijft gefocust op je taak, terwijl het systeem de modellen en de workflow op de achtergrond beheert.
De sleutel is selectiviteit. Sommige codeertaken kunnen direct worden opgelost, terwijl andere profiteren van review, revisie of escalatie. HydraFusion evalueert elk verzoek en kiest de minst complexe workflow die naar verwachting aan de behoeften voldoet. Extra modelaanroepen worden alleen gebruikt wanneer deze waarschijnlijk het resultaat verbeteren. Deze adaptieve aanpak balanceert kwaliteit, kosten en latentie over de verschillende modellen.
Naarmate de frontier van modellen vordert, evolueert HydraFusion mee. Wanneer nieuwe modellen beschikbaar komen in GitHub Copilot, kunnen we deze evalueren en integreren in de modelpool, zodat hun sterke punten worden ingezet voor de taken die daar het best bij passen.
De bouw van HydraFusion
Om adaptieve multi-model orchestratie om te zetten in een betrouwbare codeerervaring is strikte controle over uitvoering, review, kosten en de staat van de repository vereist. HydraFusion is gebouwd rond vijf werkingsprincipes:
- Volledige boekhouding: Aggregatie van kosten en gebruik over elk onderdeel van de workflow, inclusief conceptversie, kritiek, revisie, escalatie, herpoging en fallback.
- Begrensde uitvoering: Elk onderdeel krijgt expliciet gedrag voor time-out en annulering om de uitvoering en kosten binnen gedefinieerde limieten te houden.
- Geïsoleerde review: Review-stappen worden uitgevoerd in geïsoleerde contexten zonder tools, terwijl solver-stappen de gedeelde workspace en de normale permission-aware agent loop gebruiken. Hierdoor kunnen modellen het werk onafhankelijk beoordelen zonder de repository te wijzigen.
- Fail-safe toepassing: Er wordt geen patch toegepast wanneer de workflow wordt geannuleerd of faalt bij de validatie, waardoor wordt voorkomen dat onvolledige wijzigingen in de repository terechtkomen.
- Gevalideerde routing: Workflowdefinities, modelbindingen, fallback-gedrag en modelbeschikbaarheid worden geverifieerd voordat de uitvoering begint.
Samen maken deze principes multi-model orchestratie praktisch voor werk op repository-niveau. Intern registreert de runtime de rol, uitkomst, kosten, latentie en diagnostiek van elk onderdeel. Extern ontvangt de ontwikkelaar één coherent antwoord en één set wijzigingen waarvoor de juiste rechten zijn gecontroleerd.
Voortgang tonen zonder onafgemaakt werk
- Huidige status: HydraFusion toont de fasen van de workflow, maar houdt tussenliggende concepten vast tot er één coherent resultaat wordt teruggegeven.
- Reden: Deze concepten kunnen worden beoordeeld, herzien of verworpen. Het live tonen ervan zou kunnen betekenen dat onafgemaakt werk als definitief wordt ervaren.
- Leerpunt: Wachten zonder voldoende zichtbaarheid is een reële afweging voor ontwikkelaars.
- Volgende stap: We onderzoeken actief betere updates over de voortgang, gestuurd door feedback uit de research preview.
Benchmarkresultaten
Vaste HydraFusion-policies werden geëvalueerd over drie agentic coding benchmarks — TerminalBench 2.1, DeepSWE en CheckpointBench (een interne benchmark gebaseerd op echte GitHub Copilot-sessies) — met Claude Opus 5 en GPT-5.6 Sol als referentiepunten.
Elke policy gebruikte dezelfde taak-inputs, tools, uitvoeringslimieten, prijsveronderstellingen en graderingsvoorwaarden. De evaluatie mat de geverifieerde taakkwaliteit (het aandeel correct beantwoordde taken) en de totale geschatte workflowkosten.
Tabel 1. Kwaliteit en kosten van HydraFusion over drie agentic benchmarks, relatief ten opzichte van Opus 5.
| Benchmark | Kosten vs. Opus 5 | Kwaliteit vs. Opus 5 |
| TerminalBench 2.1 | 67% lager | +4,9 punten |
| DeepSWE | 36% lager | -1,5 punten |
| CheckpointBench | 65% lager | -0,1 punten |
Deze gecontroleerde offline resultaten zijn specifiek voor de geëvalueerde benchmarkversies, workflowconfiguraties, modelpool en prijsveronderstellingen, waarbij alle modellen op hetzelfde gemiddelde redeneringsniveau zijn geëvalueerd. Via deze research preview zullen we valideren hoe deze resultaten vertalen naar echte workloads van ontwikkelaars.
TerminalBench 2.1
TerminalBench 2.1 evalueert coding agents op complexe, meerstaps taken in terminalomgevingen. De resultaten tonen een aanzienlijke verbetering in zowel kwaliteit als kosten ten opzichte van Opus 5.
DeepSWE
DeepSWE evalueert uitdagende software engineering-taken op repository-niveau die vereisen dat men door grote codebases navigeert, cross-file afhankelijkheden begrijpt en end-to-end fixes produceert. Hier komt HydraFusion binnen 1,5 procentpunt van Opus 5, terwijl de kosten met 36% dalen.
CheckpointBench
CheckpointBench is een interne multi-turn benchmark gecureerd uit echte GitHub Copilot-sessies. Elke conversatie is gekoppeld aan een specifieke publieke repository en een onveranderlijke commit. Op deze benchmark komt HydraFusion binnen 0,1 procentpunt van Opus 5 tegen 65% lagere kosten.
Interne tests bevestigen dit: "Tot nu toe is de redeneer- en taakoplossingscapaciteit [van HydraFusion] gelijk aan of beter dan Opus," aldus een Principal Software Engineer bij Microsoft.
"Hill-climbing" van HydraFusion
De routing-policies van HydraFusion zijn gevormd door hoe ontwikkelaars GitHub Copilot gebruiken bij echte codeertaken. Om deze workflows reproduceerbaar te maken, is CheckpointBench gecureerd uit echte Copilot-trajecten.
In plaats van handmatig drempelwaarden af te stellen, werd beam search gebruikt om de optimale beslissingspolicy op te bouwen. Elke kandidaat werd gemeten tegen een bevroren baseline op kwaliteit, kosten en foutmodi.
De ontwikkeling was niet lineair. Tussen 11 en 25 augustus zorgden twee operationele fouten in de evaluatieharness voor ongeldige runs; deze zijn uit de trend verwijderd en gecorrigeerd. Tegen 25 augustus had HydraFusion zijn sterkste operationele punten in de geregistreerde reeks bereikt.
Probeer de research preview
Voor deze preview zijn coding-taken met één prompt in de eerste beurt het beste startpunt. We zullen ons vervolgens richten op sterke multi-turn prestaties bij langere, iteratieve sessies.
Deze preview is bedoeld om te leren welke taken profiteren van compound-workflows en hoe orchestratie in de praktijk invloed heeft op latentie en kosten. Voor de beste ervaring start je met substantiële, goed afgebakende codeertaken die je in autopilot-modus via één prompt aan Copilot kunt overhandigen.
HydraFusion blijft een actieve research-inspanning. Resultaten, modellen, workflows, beschikbaarheid, namen en productgedrag kunnen veranderen naarmate we leren van de preview. We geloven dat de volgende grote winst in coding agents zal komen uit de combinatie van frontier-intelligentie met runtime-orchestratie.
Erkenningen
Een grote dank aan de onderzoekers, ingenieurs, productmanagers en designers van GitHub en Microsoft. In het bijzonder aan de teams van GitHub Copilot CLI, Copilot API en VS Code voor het mogelijk maken van deze research preview.
Het Team
- Aashna Garg, Principal Applied Scientist, Code AI
- Shengyu Fu, Partner Applied Science Manager, Code AI
- Carlos Castro, Partner Architect, GitHub Copilot
- Siddharth Singha Roy, Research Scientist II, Code AI
- Andy Salerno, Principal Software Engineer, GitHub Copilot
Project HydraFusion: Frontier-kwaliteit via multi-model orchestratie
Ons doel is altijd geweest om ontwikkelaars het beste model voor de specifieke taak bij de hand te geven. Begin dit jaar hebben we dit vereenvoudigd door de lancering van Auto model selection, die jouw taak analyseert en koppelt aan het best geschikte model.
Vandaag introduceren we Project HydraFusion, een research preview die frontier-intelligentie levert via runtime-orchestratie. Het systeem stelt een volledig uitvoeringsplan op en kiest uit modellen van verschillende providers om concepten te schrijven, te bekritiseren en te herzien, of schaalt op naar krachtigere modellen om de taak te voltooien.
HydraFusion vervult een sleutelrol in onze algemene strategie om geautomatiseerde semantische routing tussen lokale, cloud- en compound-modellen te realiseren. Voor ontwikkelaars blijft deze complexiteit op de achtergrond: je selecteert HydraFusion zoals elk ander model, waarna het systeem een workflow kiest die prestaties, kosten en latentie voor elke taak in balans brengt.
Nu beschikbaar als research preview
HydraFusion is beschikbaar voor gebruikers op alle GitHub Copilot-abonnementen via /experimental in de GitHub Copilot CLI. Het gebruik is gebaseerd op de tokens die worden verbruikt door de modellen die HydraFusion aanroept, geprijsd tegen het standaardtarief van elk model.
Om HydraFusion in Copilot CLI te proberen:
- Voer
/update uit om de nieuwste versie te installeren.
- Voer
/experimental on uit.
- Voer
/model uit en selecteer vervolgens HydraFusion (Research Preview).
Feedback kan worden geplaatst in de GitHub Community.
Hoe HydraFusion werkt
HydraFusion benadert de selectie van workflows als een optimalisatieprobleem. Het maakt gebruik van capaciteitssignalen voor redeneren, codegeneratie, debugging en toolgebruik om het meest efficiënte uitvoeringspatroon te kiezen dat aan de kwaliteitsnorm voldoet.
Voor elk verzoek kiest HydraFusion momenteel een van de drie uitvoeringspatronen:
- Single (Enkelvoudig): Eén geselecteerd model lost de taak direct op.
- Cascade (Cascadering): Een efficiënt model schrijft een conceptoplossing en een kwaliteitscontrole (quality gate) bepaalt of dit wordt geaccepteerd of dat het verzoek wordt geëscaleerd naar een sterker model.
- Critique (Kritiek): Eén model schrijft een resultaat, een onafhankelijke read-only critic uit een andere modelfamilie beoordeelt dit (volgens hetzelfde reviewpatroon als Rubber Duck), en het schrijvende model voert vervolgens één revisie uit.
Elk patroon speelt in op een andere afweging tussen kwaliteit en kosten. Single behoudt snelheid en efficiëntie wanneer één model de taak direct kan oplossen. Cascade geeft een efficiënt model de eerste kans, terwijl er een route naar sterkere inferentie blijft bestaan als het concept niet door de acceptatiepoort komt. Critique voegt een onafhankelijk perspectief toe voor taken waarbij een review nuttiger is dan een tweede onbegeleide poging.
In offline evaluaties over drie agentic coding benchmarks toonde HydraFusion consequent frontier-niveau kwaliteit met aanzienlijke geschatte kostenbesparingen. Op TerminalBench 2.1 verbeterde het de geverifieerde taakkwaliteit met 4,9 procentpunt bij 67% lagere geschatte kosten vergeleken met Claude Opus 5.
Adaptieve multi-model orchestratie
Ontwikkelaars coördineren modellen al handmatig: ze kiezen één model voor een taak, vragen een ander om het werk te reviewen, of escaleren een moeilijk probleem naar een krachtiger model. HydraFusion integreert dit bekende proces in de runtime. Je kiest één keer voor HydraFusion en blijft gefocust op je taak, terwijl het systeem de modellen en de workflow op de achtergrond beheert.
De sleutel is selectiviteit. Sommige codeertaken kunnen direct worden opgelost, terwijl andere profiteren van review, revisie of escalatie. HydraFusion evalueert elk verzoek en kiest de minst complexe workflow die naar verwachting aan de behoeften voldoet. Extra modelaanroepen worden alleen gebruikt wanneer deze waarschijnlijk het resultaat verbeteren. Deze adaptieve aanpak balanceert kwaliteit, kosten en latentie over de verschillende modellen.
Naarmate de frontier van modellen vordert, evolueert HydraFusion mee. Wanneer nieuwe modellen beschikbaar komen in GitHub Copilot, kunnen we deze evalueren en integreren in de modelpool, zodat hun sterke punten worden ingezet voor de taken die daar het best bij passen.
De bouw van HydraFusion
Om adaptieve multi-model orchestratie om te zetten in een betrouwbare codeerervaring is strikte controle over uitvoering, review, kosten en de staat van de repository vereist. HydraFusion is gebouwd rond vijf werkingsprincipes:
- Volledige boekhouding: Aggregatie van kosten en gebruik over elk onderdeel van de workflow, inclusief conceptversie, kritiek, revisie, escalatie, herpoging en fallback.
- Begrensde uitvoering: Elk onderdeel krijgt expliciet gedrag voor time-out en annulering om de uitvoering en kosten binnen gedefinieerde limieten te houden.
- Geïsoleerde review: Review-stappen worden uitgevoerd in geïsoleerde contexten zonder tools, terwijl solver-stappen de gedeelde workspace en de normale permission-aware agent loop gebruiken. Hierdoor kunnen modellen het werk onafhankelijk beoordelen zonder de repository te wijzigen.
- Fail-safe toepassing: Er wordt geen patch toegepast wanneer de workflow wordt geannuleerd of faalt bij de validatie, waardoor wordt voorkomen dat onvolledige wijzigingen in de repository terechtkomen.
- Gevalideerde routing: Workflowdefinities, modelbindingen, fallback-gedrag en modelbeschikbaarheid worden geverifieerd voordat de uitvoering begint.
Samen maken deze principes multi-model orchestratie praktisch voor werk op repository-niveau. Intern registreert de runtime de rol, uitkomst, kosten, latentie en diagnostiek van elk onderdeel. Extern ontvangt de ontwikkelaar één coherent antwoord en één set wijzigingen waarvoor de juiste rechten zijn gecontroleerd.
Voortgang tonen zonder onafgemaakt werk
- Huidige status: HydraFusion toont de fasen van de workflow, maar houdt tussenliggende concepten vast tot er één coherent resultaat wordt teruggegeven.
- Reden: Deze concepten kunnen worden beoordeeld, herzien of verworpen. Het live tonen ervan zou kunnen betekenen dat onafgemaakt werk als definitief wordt ervaren.
- Leerpunt: Wachten zonder voldoende zichtbaarheid is een reële afweging voor ontwikkelaars.
- Volgende stap: We onderzoeken actief betere updates over de voortgang, gestuurd door feedback uit de research preview.
Benchmarkresultaten
Vaste HydraFusion-policies werden geëvalueerd over drie agentic coding benchmarks — TerminalBench 2.1, DeepSWE en CheckpointBench (een interne benchmark gebaseerd op echte GitHub Copilot-sessies) — met Claude Opus 5 en GPT-5.6 Sol als referentiepunten.
Elke policy gebruikte dezelfde taak-inputs, tools, uitvoeringslimieten, prijsveronderstellingen en graderingsvoorwaarden. De evaluatie mat de geverifieerde taakkwaliteit (het aandeel correct beantwoordde taken) en de totale geschatte workflowkosten.
Tabel 1. Kwaliteit en kosten van HydraFusion over drie agentic benchmarks, relatief ten opzichte van Opus 5.
| Benchmark | Kosten vs. Opus 5 | Kwaliteit vs. Opus 5 |
| TerminalBench 2.1 | 67% lager | +4,9 punten |
| DeepSWE | 36% lager | -1,5 punten |
| CheckpointBench | 65% lager | -0,1 punten |
Deze gecontroleerde offline resultaten zijn specifiek voor de geëvalueerde benchmarkversies, workflowconfiguraties, modelpool en prijsveronderstellingen, waarbij alle modellen op hetzelfde gemiddelde redeneringsniveau zijn geëvalueerd. Via deze research preview zullen we valideren hoe deze resultaten vertalen naar echte workloads van ontwikkelaars.
TerminalBench 2.1
TerminalBench 2.1 evalueert coding agents op complexe, meerstaps taken in terminalomgevingen. De resultaten tonen een aanzienlijke verbetering in zowel kwaliteit als kosten ten opzichte van Opus 5.
DeepSWE
DeepSWE evalueert uitdagende software engineering-taken op repository-niveau die vereisen dat men door grote codebases navigeert, cross-file afhankelijkheden begrijpt en end-to-end fixes produceert. Hier komt HydraFusion binnen 1,5 procentpunt van Opus 5, terwijl de kosten met 36% dalen.
CheckpointBench
CheckpointBench is een interne multi-turn benchmark gecureerd uit echte GitHub Copilot-sessies. Elke conversatie is gekoppeld aan een specifieke publieke repository en een onveranderlijke commit. Op deze benchmark komt HydraFusion binnen 0,1 procentpunt van Opus 5 tegen 65% lagere kosten.
Interne tests bevestigen dit: "Tot nu toe is de redeneer- en taakoplossingscapaciteit [van HydraFusion] gelijk aan of beter dan Opus," aldus een Principal Software Engineer bij Microsoft.
"Hill-climbing" van HydraFusion
De routing-policies van HydraFusion zijn gevormd door hoe ontwikkelaars GitHub Copilot gebruiken bij echte codeertaken. Om deze workflows reproduceerbaar te maken, is CheckpointBench gecureerd uit echte Copilot-trajecten.
In plaats van handmatig drempelwaarden af te stellen, werd beam search gebruikt om de optimale beslissingspolicy op te bouwen. Elke kandidaat werd gemeten tegen een bevroren baseline op kwaliteit, kosten en foutmodi.
De ontwikkeling was niet lineair. Tussen 11 en 25 augustus zorgden twee operationele fouten in de evaluatieharness voor ongeldige runs; deze zijn uit de trend verwijderd en gecorrigeerd. Tegen 25 augustus had HydraFusion zijn sterkste operationele punten in de geregistreerde reeks bereikt.
Probeer de research preview
Voor deze preview zijn coding-taken met één prompt in de eerste beurt het beste startpunt. We zullen ons vervolgens richten op sterke multi-turn prestaties bij langere, iteratieve sessies.
Deze preview is bedoeld om te leren welke taken profiteren van compound-workflows en hoe orchestratie in de praktijk invloed heeft op latentie en kosten. Voor de beste ervaring start je met substantiële, goed afgebakende codeertaken die je in autopilot-modus via één prompt aan Copilot kunt overhandigen.
HydraFusion blijft een actieve research-inspanning. Resultaten, modellen, workflows, beschikbaarheid, namen en productgedrag kunnen veranderen naarmate we leren van de preview. We geloven dat de volgende grote winst in coding agents zal komen uit de combinatie van frontier-intelligentie met runtime-orchestratie.
Erkenningen
Een grote dank aan de onderzoekers, ingenieurs, productmanagers en designers van GitHub en Microsoft. In het bijzonder aan de teams van GitHub Copilot CLI, Copilot API en VS Code voor het mogelijk maken van deze research preview.
Het Team
- Aashna Garg, Principal Applied Scientist, Code AI
- Shengyu Fu, Partner Applied Science Manager, Code AI
- Carlos Castro, Partner Architect, GitHub Copilot
- Siddharth Singha Roy, Research Scientist II, Code AI
- Andy Salerno, Principal Software Engineer, GitHub Copilot