Entrenamiento y pruebas de modelos
Comprender cómo se entrenan, evalúan, sirven, experimentan y promocionan los modelos de pago de Athia.
En esta página
Athia considera que un modelo entrenado es un candidato, no una decisión de producción. La calidad de los datos, la evaluación fuera de línea, la compatibilidad de los artefactos, la preparación para el servicio y la evidencia en vivo controlada deben pasar antes de que un modelo reciba tráfico significativo.
Dos sistemas, un ciclo de vida#
Athia separa el desarrollo de modelos fuera de línea de las operaciones de modelos en línea.
| Responsabilidad | Pistas y flujos de entrenamiento | Plataforma Athia |
|---|---|---|
| Preparar los datos de entrenamiento | Consultar datos de Snowflake, validarlos y construir características específicas del modelo | Rastrear el conjunto de datos y el contexto de entrenamiento expuesto con una versión del modelo |
| Entrenar y evaluar | Entrenar candidatos, ejecutar evaluaciones temporales o basadas en cohortes y empaquetar artefactos | Registrar versiones del modelo y evidencia de evaluación |
| Probar la compatibilidad | Validar esquemas de características, codificadores, metadatos y contratos de artefactos | Verificar la capacidad de carga, la salud y la preparación para el servicio |
| Ejecutar experimentos | Producir artefactos candidatos y métricas esperadas | Asignar tráfico de sombra o controlado, recopilar resultados y comparar variantes |
| Promover y operar | Reproducir el entrenamiento y conservar la evidencia | Promover la mejor opción, realizar un "hot reload" o desplegarla, supervisarla y revertir cuando sea necesario |
El código de entrenamiento y las tuberías que interactúan con Snowflake se encuentran en DATA-Athena-SnowflakeLos controles de registro, experimento, servicio y ejecución se encuentran en athena-platformEsta delimitación separa el acceso a los datos de entrenamiento de los servicios que realizan predicciones en línea.
Desde datos controlados hasta un modelo de producción#
Modelos de pago soportados por el ciclo de vida#
El mismo ciclo de vida se puede utilizar para varias familias de decisiones, dependiendo de la configuración de la cuenta y la disponibilidad:
Algunas familias de decisiones utilizan un único predictor; otras entrenan varias salidas relacionadas o combinan la evidencia del modelo con reglas de elegibilidad y seguridad.
Qué se prueba#
1. Puertas de datos
Antes de comenzar el entrenamiento, la tubería verifica que la fuente es utilizable: frescura, volumen mínimo, campos requeridos, disponibilidad de etiquetas, equilibrio de clases y distribuciones de características. Los splits y comprobaciones de fugas temporales evitan que la información futura entre en ejemplos pasados.
2. Calidad del modelo fuera de línea
La evaluación es específica para la decisión. Puede incluir discriminación, precisión y recuerdo, calibración, calidad de clasificación, error por cohortes y el efecto comercial esperado. Los "holdouts" temporales muestran si un candidato se generaliza más allá del período en el que se entrenó.
Las pruebas de "replay" y basadas en políticas comparan las decisiones del modelo con resultados históricos o observados en vivo, siempre que los datos lo permitan. Ninguna métrica por sí sola es suficiente para la promoción.
3. Contratos de artefactos y características
El paquete del modelo incluye el artefacto del modelo, así como los metadatos necesarios para reproducir sus entradas y salidas. Las pruebas validan el orden y los tipos de características, los codificadores, los identificadores de modelo admitidos, el esquema de salida y la compatibilidad con el entorno de ejecución.
4. Preparación para el servicio
Una versión registrada debe cargarse correctamente, exponer la salud y la preparación para el servicio, responder a solicitudes representativas y cumplir con las expectativas de latencia y errores. La preparación es independiente de la calidad del modelo: un candidato sólido que no se puede servir de forma segura no avanza.
5. Evidencia en tiempo real
El modo "shadow" registra lo que habría decidido el modelo sin modificar la transacción. Los experimentos controlados asignan una parte acordada del tráfico elegible a un candidato y lo comparan con una línea base. Los "guardrails" supervisan tanto los resultados de los pagos como la salud operativa.
Puertas de promoción#
| Puerta | Evidencia requerida |
|---|---|
| Datos | Entrada de entrenamiento válida, suficientemente reciente y representativa |
| Evaluación fuera de línea | Umbrales específicos del modelo, junto con un comportamiento y calibración aceptables del grupo |
| Contrato | Artefactos reproducibles, metadatos, esquema de características y pruebas de carga |
| Servicio | Despliegue saludable con latencia y comportamiento de error aceptables |
| Experimento | Evidencia controlada contra la línea base activa y sin violar ningún "guardrail" |
| Aprobación | Decisión de promoción autorizada con un registro de auditoría conservado |
Un modelo promocionado es reversible. Se pueden reducir los pesos de tráfico, se puede restaurar el modelo anterior y se puede volver a utilizar el modo "shadow" mientras se investiga un nuevo candidato.
Lo que ves en Athia#
El área de operaciones del modelo integra: