Quinze modelos de fundo foram testados como extratores de características em mamografia, treinados em três conjuntos de dados e avaliados em doze conjuntos fora de distribuição após harmonização de rótulos.
Entre os modelos de visão‑linguagem, Mammo‑FM e MaMA lideraram o desempenho médio OOD, mas a exposição a mamografia sozinha não explica a robustez. O baseline vision‑only DINOv3 também se manteve competitivo.
Desempenho e generalização
Os 15 backbones foram avaliados com um protocolo de probe linear e backbone congelado, treinado em três conjuntos de dados de origem e testado em 12 conjuntos OOD compatíveis com a tarefa. A análise em nível de conjunto mostrou heterogeneidade significativa, mesmo entre os melhores modelos, chamando atenção para a necessidade de avaliações mais granulares.

O pré‑treinamento adaptado à mamografia não trouxe melhora consistente na generalização. A inspeção do espaço de características indica que representações úteis preservam sinal clínico, mas ainda carregam estruturas de aquisição e conjunto de dados.
Contexto e disponibilidade
O estudo foi submetido em 11 de julho de 2026 e revisado pela última vez em 27 de agosto de 2026. Foi aceito no workshop Deep‑Bre3th de 2026, em conjunto com a MICCAI 2026. O código está disponível publicamente.
- Mammo‑FM e MaMA: melhor desempenho médio OOD
- DINOv3: baseline vision‑only ainda competitivo
- 12 conjuntos OOD avaliados após harmonização de rótulos
- 15 backbones: todos treinados em três conjuntos de dados de origem


