MultiMatte is een model voor het verwijderen van achtergronden dat is gebouwd op Meta's SAM 3. In tegenstelling tot de binaire maskers van SAM 3, maakt MultiMatte gebruik van alpha mattes, waardoor continue opaciteitswaarden aan pixels worden toegekend. Dit resulteert in een veel nauwkeuriger segmentatie van complexe details zoals haar of doorschijnende objecten.
Technische details:
- Het model is getraind via low-rank fine-tuning (LoRA), waarbij slechts 2,27% van de modelparameters is aangepast. Hierdoor blijft de oorspronkelijke tekstuitlijning van SAM 3 behouden.
- De training omvatte 19.953 afbeeldingen en maakte gebruik van focal loss en Dice loss.
Resultaten: MultiMatte scoort consistent hoger dan SAM 3 op diverse benchmarks (zoals DIS-VD en DAVIS-S) wat betreft de S-measure, wat wijst op een superieure vormbehoud en detailweergave.
Implementatie: Het model is beschikbaar via de nobg bibliotheek, waarbij gebruikers via een eenvoudige Python-interface specifieke objecten in een foto kunnen benoemen om deze te isoleren.
MultiMatte: Behoud wat je wilt, verwijder de rest
MultiMatte is een model voor het verwijderen van achtergronden dat kan worden aangestuurd met woorden. MultiMatte behoudt het object dat je benoemt en verwijdert alles overig.
MultiMatte is gebouwd op SAM 3 (Meta, 2025). Er is gebruikgemaakt van low-rank fine-tuning om 19,49 miljoen van de 860 miljoen parameters aan te passen. Deze update raakt slechts 2,27% van de modelgewichten, maar MultiMatte verbetert de beeldsegmentatie aanzienlijk. Op de DIS-VD benchmark behaalt het een S-measure van 0,901, tegenover 0,667 voor SAM 3.
Van segmentatie naar matting
SAM 3 is een concept-promptable detector. Wanneer er een tekstfragment wordt ingevoerd, geeft het model binaire maskers terug voor elk overeenkomend object. Deze maskers classificeren elke pixel als onderdeel van het object of niet. Deze binaire benadering schiet tekort bij fijne of doorschijnende elementen met vage grenzen, zoals haar of een wazig scherm.
MultiMatte lost dit probleem op met alpha mattes. In plaats van een booleaanse waarde aan elke pixel toe te kennen, wijst een alpha matte een continue opaciteitswaarde toe aan elke pixel. Hierdoor kunnen vage grenzen worden beschreven zoals ze in werkelijkheid verschijnen.
Alpha mattes bewijzen hun waarde in benchmarks. Over vijf high-resolution DIS-splits scoort SAM 3 tussen 0,649 en 0,703, terwijl MultiMatte scoort tussen 0,893 en 0,923.
Het trainen van MultiMatte
SAM 3 is niet één enkel netwerk, maar bestaat uit verschillende uitgelijnde onderdelen: een vision tower, een CLIP text tower, een geometry encoder, een detection encoder en decoder, en een mask decoder. Het vermogen om het model aan te sturen met een tekstfragment komt voort uit de uitlijning tussen deze onderdelen. Het doel was om dit vermogen over te dragen naar matting.
Het model is getraind met PEFT, gebruikmakend van LoRA (Hu et al., 2021). Elke gerichte lineaire laag behield zijn vooraf getrainde gewicht (bevroren) en leerde twee kleine matrices die een low-rank update toevoegden. Door op deze manier te trainen, kon de tekstuitlijning en de oorspronkelijke woordenschat van SAM 3 behouden blijven, terwijl de segmentatiecapaciteiten werden verbeterd.
De rank-16 adapter volgde de configuratieprincipes uit de LoRA-analyse van Thinking Machines (2025). Deze was gericht op de attention en MLP projections in elke tower, inclusief de CLIP text tower. De uiteindelijke adapter is samengevoegd met de gepubliceerde gewichten, zodat inferentie geen aparte adapter-bibliotheek vereist.
De trainingsronde maakte gebruik van 19.953 afbeeldingen, bestaande uit prominente objecten, camouflage, high-resolution onderwerpen, haar en maritieme scènes. Er is getraind gedurende 14.000 stappen met het semantische segmentatiedoel dat SAM 3 al gebruikt: focal loss (Lin et al., 2017) gecombineerd met Dice loss.
Voor prompt-supervisie zijn 4.949 afbeeldingen met door mensen geschreven labels gebruikt; 24,8% van de trainingsset benoemde dus het specifieke object in elke afbeelding. Dit was voldoende om de nieuwe matte head te leren gebruikmaken van de tekstuitlijning die SAM 3 al bezat.
Resultaten
De resultaten worden gerapporteerd in de S-measure (waarbij volledige onderwerpen en getrouwe vormen worden beloond op een schaal van 0 tot 1) en de mean absolute error (MAE) over de opaciteitswaarden, waarbij een lagere score beter is.
Prompt-vrije S-measure vergelijking
| Split | SAM 3 | MultiMatte | Verschil |
| DIS-VD | 0,667 | 0,901 | +0,233 |
| DIS-TE1 | 0,667 | 0,901 | +0,234 |
| DIS-TE2 | 0,703 | 0,923 | +0,220 |
| DIS-TE3 | 0,685 | 0,921 | +0,235 |
| DIS-TE4 | 0,649 | 0,893 | +0,244 |
| DAVIS-S (geen sibling in training mix) | 0,913 | 0,979 | +0,066 |
| HRSOD-TE | 0,930 | 0,969 | +0,039 |
| UHRSD-TE | 0,877 | 0,961 | +0,084 |
| DUTS-TE | 0,892 | 0,954 | +0,062 |
| DUT-OMRON (geen sibling in training mix) | 0,792 | 0,901 | +0,109 |
| COD10K-TE | 0,787 | 0,934 | +0,148 |
| CAMO-TE | 0,827 | 0,914 | +0,086 |
Hoger is beter.
MultiMatte verbetert SAM 3 in elke split. Wij beschouwen veranderingen onder de 0,002 S-measure of 0,0005 MAE als meetruis.
DAVIS-S en DUT-OMRON zijn de sterkste generalisatiecontroles, aangezien geen van beide een 'sibling' heeft in de trainingsmix. MultiMatte bereikt zijn hoogste absolute score op DAVIS-S (0,979) en tilt DUT-OMRON op van 0,792 naar 0,901.
Conceptnamen helpen zelfs zonder fine-tuning. Op DIS-VD voegt een echte conceptnaam 0,150 S-measure toe aan SAM 3 zonder gradiëntstappen, en nog steeds 0,036 toe aan MultiMatte. Het prompt-pad is overleefd tijdens het hertrainen en draagt zelfstandig bij. De scores voor CAMO maken gebruik van dezelfde formuleringstijl van de annotator als tijdens de training; dat resultaat meet dus in-family prompt-generalisatie in plaats van cross-domain prompting.
MultiMatte gebruiken
MultiMatte is gebouwd met NoBg, dezelfde bibliotheek die is gebruikt om FeyNoBg te trainen. Installatie kan via pip install nobg:
from nobg import AutoModel, AutoProcessor
model = AutoModel.from_pretrained("feyninc/multimatte")
processor = AutoProcessor.from_pretrained("feyninc/multimatte")
# Gebruikt de generieke standaardprompt van het model
cutout = model.predict(processor, "photo.jpg")
cutout.save("output.png")
# Benoemt het concept dat behouden moet blijven
cutout = model.predict(processor, "photo.jpg", "the dog")
De functie predict geeft een RGBA-uitgesneden afbeelding terug. Gebruik return_type="tensor" voor de ruwe matte. De adapter is reeds samengevoegd met de gepubliceerde gewichten voor gebruiksgemak.
Erkenningen
MultiMatte is gebouwd op SAM 3 van Meta. FlowDIS (Sargsyan and Navasardyan, 2026) leverde de door mensen geschreven DIS5K-frasen die zijn gebruikt voor training en evaluatie. De LoRA-analyse van Thinking Machines diende als basis voor de adapterconfiguratie. Wij zijn dankbaar aan de auteurs van de datasets wiens gepubliceerde werk de trainingsmix en evaluatie mogelijk hebben gemaakt.
Referenties
[1] Meta. "SAM 3: Segment Anything with Concepts." arXiv:2511.16719 (2025). [2] Hu et al. "LoRA: Low-Rank Adaptation of Large Language Models." arXiv:2106.09685 (2021). [3] Thinking Machines Lab. "LoRA Without Regret" (2025). https://thinkingmachines.ai/blog/lora/ [4] Lin et al. "Focal Loss for Dense Object Detection." arXiv:1708.02002 (2017). [5] Sargsyan and Navasardyan. "FlowDIS: Language-Guided Dichotomous Image Segmentation with Flow Matching." CVPR 2026. arXiv:2605.05077.
MultiMatte: Behoud wat je wilt, verwijder de rest
MultiMatte is een model voor het verwijderen van achtergronden dat kan worden aangestuurd met woorden. MultiMatte behoudt het object dat je benoemt en verwijdert alles overig.
MultiMatte is gebouwd op SAM 3 (Meta, 2025). Er is gebruikgemaakt van low-rank fine-tuning om 19,49 miljoen van de 860 miljoen parameters aan te passen. Deze update raakt slechts 2,27% van de modelgewichten, maar MultiMatte verbetert de beeldsegmentatie aanzienlijk. Op de DIS-VD benchmark behaalt het een S-measure van 0,901, tegenover 0,667 voor SAM 3.
Van segmentatie naar matting
SAM 3 is een concept-promptable detector. Wanneer er een tekstfragment wordt ingevoerd, geeft het model binaire maskers terug voor elk overeenkomend object. Deze maskers classificeren elke pixel als onderdeel van het object of niet. Deze binaire benadering schiet tekort bij fijne of doorschijnende elementen met vage grenzen, zoals haar of een wazig scherm.
MultiMatte lost dit probleem op met alpha mattes. In plaats van een booleaanse waarde aan elke pixel toe te kennen, wijst een alpha matte een continue opaciteitswaarde toe aan elke pixel. Hierdoor kunnen vage grenzen worden beschreven zoals ze in werkelijkheid verschijnen.
Alpha mattes bewijzen hun waarde in benchmarks. Over vijf high-resolution DIS-splits scoort SAM 3 tussen 0,649 en 0,703, terwijl MultiMatte scoort tussen 0,893 en 0,923.
Het trainen van MultiMatte
SAM 3 is niet één enkel netwerk, maar bestaat uit verschillende uitgelijnde onderdelen: een vision tower, een CLIP text tower, een geometry encoder, een detection encoder en decoder, en een mask decoder. Het vermogen om het model aan te sturen met een tekstfragment komt voort uit de uitlijning tussen deze onderdelen. Het doel was om dit vermogen over te dragen naar matting.
Het model is getraind met PEFT, gebruikmakend van LoRA (Hu et al., 2021). Elke gerichte lineaire laag behield zijn vooraf getrainde gewicht (bevroren) en leerde twee kleine matrices die een low-rank update toevoegden. Door op deze manier te trainen, kon de tekstuitlijning en de oorspronkelijke woordenschat van SAM 3 behouden blijven, terwijl de segmentatiecapaciteiten werden verbeterd.
De rank-16 adapter volgde de configuratieprincipes uit de LoRA-analyse van Thinking Machines (2025). Deze was gericht op de attention en MLP projections in elke tower, inclusief de CLIP text tower. De uiteindelijke adapter is samengevoegd met de gepubliceerde gewichten, zodat inferentie geen aparte adapter-bibliotheek vereist.
De trainingsronde maakte gebruik van 19.953 afbeeldingen, bestaande uit prominente objecten, camouflage, high-resolution onderwerpen, haar en maritieme scènes. Er is getraind gedurende 14.000 stappen met het semantische segmentatiedoel dat SAM 3 al gebruikt: focal loss (Lin et al., 2017) gecombineerd met Dice loss.
Voor prompt-supervisie zijn 4.949 afbeeldingen met door mensen geschreven labels gebruikt; 24,8% van de trainingsset benoemde dus het specifieke object in elke afbeelding. Dit was voldoende om de nieuwe matte head te leren gebruikmaken van de tekstuitlijning die SAM 3 al bezat.
Resultaten
De resultaten worden gerapporteerd in de S-measure (waarbij volledige onderwerpen en getrouwe vormen worden beloond op een schaal van 0 tot 1) en de mean absolute error (MAE) over de opaciteitswaarden, waarbij een lagere score beter is.
Prompt-vrije S-measure vergelijking
| Split | SAM 3 | MultiMatte | Verschil |
| DIS-VD | 0,667 | 0,901 | +0,233 |
| DIS-TE1 | 0,667 | 0,901 | +0,234 |
| DIS-TE2 | 0,703 | 0,923 | +0,220 |
| DIS-TE3 | 0,685 | 0,921 | +0,235 |
| DIS-TE4 | 0,649 | 0,893 | +0,244 |
| DAVIS-S (geen sibling in training mix) | 0,913 | 0,979 | +0,066 |
| HRSOD-TE | 0,930 | 0,969 | +0,039 |
| UHRSD-TE | 0,877 | 0,961 | +0,084 |
| DUTS-TE | 0,892 | 0,954 | +0,062 |
| DUT-OMRON (geen sibling in training mix) | 0,792 | 0,901 | +0,109 |
| COD10K-TE | 0,787 | 0,934 | +0,148 |
| CAMO-TE | 0,827 | 0,914 | +0,086 |
Hoger is beter.
MultiMatte verbetert SAM 3 in elke split. Wij beschouwen veranderingen onder de 0,002 S-measure of 0,0005 MAE als meetruis.
DAVIS-S en DUT-OMRON zijn de sterkste generalisatiecontroles, aangezien geen van beide een 'sibling' heeft in de trainingsmix. MultiMatte bereikt zijn hoogste absolute score op DAVIS-S (0,979) en tilt DUT-OMRON op van 0,792 naar 0,901.
Conceptnamen helpen zelfs zonder fine-tuning. Op DIS-VD voegt een echte conceptnaam 0,150 S-measure toe aan SAM 3 zonder gradiëntstappen, en nog steeds 0,036 toe aan MultiMatte. Het prompt-pad is overleefd tijdens het hertrainen en draagt zelfstandig bij. De scores voor CAMO maken gebruik van dezelfde formuleringstijl van de annotator als tijdens de training; dat resultaat meet dus in-family prompt-generalisatie in plaats van cross-domain prompting.
MultiMatte gebruiken
MultiMatte is gebouwd met NoBg, dezelfde bibliotheek die is gebruikt om FeyNoBg te trainen. Installatie kan via pip install nobg:
from nobg import AutoModel, AutoProcessor
model = AutoModel.from_pretrained("feyninc/multimatte")
processor = AutoProcessor.from_pretrained("feyninc/multimatte")
# Gebruikt de generieke standaardprompt van het model
cutout = model.predict(processor, "photo.jpg")
cutout.save("output.png")
# Benoemt het concept dat behouden moet blijven
cutout = model.predict(processor, "photo.jpg", "the dog")
De functie predict geeft een RGBA-uitgesneden afbeelding terug. Gebruik return_type="tensor" voor de ruwe matte. De adapter is reeds samengevoegd met de gepubliceerde gewichten voor gebruiksgemak.
Erkenningen
MultiMatte is gebouwd op SAM 3 van Meta. FlowDIS (Sargsyan and Navasardyan, 2026) leverde de door mensen geschreven DIS5K-frasen die zijn gebruikt voor training en evaluatie. De LoRA-analyse van Thinking Machines diende als basis voor de adapterconfiguratie. Wij zijn dankbaar aan de auteurs van de datasets wiens gepubliceerde werk de trainingsmix en evaluatie mogelijk hebben gemaakt.
Referenties
[1] Meta. "SAM 3: Segment Anything with Concepts." arXiv:2511.16719 (2025). [2] Hu et al. "LoRA: Low-Rank Adaptation of Large Language Models." arXiv:2106.09685 (2021). [3] Thinking Machines Lab. "LoRA Without Regret" (2025). https://thinkingmachines.ai/blog/lora/ [4] Lin et al. "Focal Loss for Dense Object Detection." arXiv:1708.02002 (2017). [5] Sargsyan and Navasardyan. "FlowDIS: Language-Guided Dichotomous Image Segmentation with Flow Matching." CVPR 2026. arXiv:2605.05077.