Nieuwe methode verbetert kalibratie van tabulaire AI-classificatie
Een nieuwe techniek genaamd LWCal verbetert de waarschijnlijkheidskalibratie voor tabulaire classificatiemodellen wanneer de gebruikte labels onbetrouwbaar of ruizelig zijn. De methode corrigeert voor fouten in de kalibratiedata door voorbeelden met tegenstrijdige labels minder zwaar mee te wegen.
Bij het trainen en evalueren van machine learning-modellen wordt vaak optimistisch aangenomen dat de gebruikte data en labels foutloos zijn. In de praktijk blijken labels in datasets echter regelmatig onzuiver te zijn doordat ze afkomstig zijn van historische beslissingen of automatische heuristieken. Dit beïnvloedt niet alleen de training, maar verstoort ook de post-hoc waarschijnlijkheidskalibratie van modellen die werken met gestructureerde tabulaire data.
De voorgestelde methode, genaamd LWCal, is specifiek ontworpen om dit probleem aan te pakken op reguliere computerprocessors. Door voorbeelden waarvan de labels worden tegengesproken door het onderliggende model lager te waarderen, zorgt de techniek voor betrouwbaardere voorspellingen in situaties met imperfecte trainingsdata. Dit soort verbeteringen zijn relevant voor toepassingen in sectoren waar gestructureerde data dominant is en foutloze annotaties schaars zijn.
Deze samenvatting is gebaseerd op een origineel artikel van arXiv (cs.LG). Lees het volledige, originele bericht bij de bron.
Lees het originele artikel