‹ Cultura 3.14 · Qué nos preguntamos
Pregunta · Decisiones
¿Cuándo aporta más valor un modelo tabular que un modelo lingüístico?
Sobre datos tabulares con etiquetas y coste de error conocido, el gradient boosting sigue ganando en precisión, coste y capacidad de análisis.
La pregunta llega a menudo en forma de propuesta: «esto podría resolverlo un modelo lingüístico». A veces sí. En clasificación y priorización sobre datos tabulares, en nuestras pruebas, casi nunca.
Montamos una comparación sobre un conjunto tabular con etiquetas históricas y coste de error conocido. Un modelo de gradient boosting entrenado sobre las variables disponibles, frente a un modelo lingüístico al que se le entrega la misma fila serializada y una instrucción cuidada.
El modelo tabular obtuvo mejor rendimiento con un coste por inferencia varios órdenes de magnitud menor, y sobre todo permitió analizar por qué. Importancia de variables, calibración por segmento y matriz de costes son herramientas que en el otro caso no tenemos.
El modelo lingüístico fue mejor en una cosa: los casos con texto libre que ninguna variable recogía. Ahí aportó señal real, y la incorporamos como una variable más en lugar de sustituir el modelo.
La conclusión que nos llevamos no es sobre CatBoost. Es sobre el orden de las preguntas: primero qué decisión debe mejorar y qué información hay disponible cuando se toma; después la técnica. Cuando hay etiquetas, la tarea es estable y el coste del error se conoce, el modelo aprendido sobre esos datos sigue siendo difícil de batir.