Saltar al contenido principal
En esta página

Athia considera que un modelo entrenado es un candidato, no una decisión de producción. La calidad de los datos, la evaluación fuera de línea, la compatibilidad de los artefactos, la preparación para el servicio y la evidencia en vivo controlada deben pasar antes de que un modelo reciba tráfico significativo.

Datos ilustrativos
ATHIAML de pagos

Modelos, experimentos y serving

Modelos registrados8
Experimentos activos3
Listos para serving6
Cola de entrenamiento2
ModeloVersiónEstadoTráfico
Processor selectorv36Activo65%
Retry predictorv12Sombra10%
Installment optimizerv7Listo—

Dos sistemas, un ciclo de vida#

Athia separa el desarrollo de modelos fuera de línea de las operaciones de modelos en línea.

ResponsabilidadPistas y flujos de entrenamientoPlataforma Athia
Preparar los datos de entrenamientoConsultar datos de Snowflake, validarlos y construir características específicas del modeloRastrear el conjunto de datos y el contexto de entrenamiento expuesto con una versión del modelo
Entrenar y evaluarEntrenar candidatos, ejecutar evaluaciones temporales o basadas en cohortes y empaquetar artefactosRegistrar versiones del modelo y evidencia de evaluación
Probar la compatibilidadValidar esquemas de características, codificadores, metadatos y contratos de artefactosVerificar la capacidad de carga, la salud y la preparación para el servicio
Ejecutar experimentosProducir artefactos candidatos y métricas esperadasAsignar tráfico de sombra o controlado, recopilar resultados y comparar variantes
Promover y operarReproducir el entrenamiento y conservar la evidenciaPromover la mejor opción, realizar un "hot reload" o desplegarla, supervisarla y revertir cuando sea necesario

El código de entrenamiento y las tuberías que interactúan con Snowflake se encuentran en DATA-Athena-SnowflakeLos controles de registro, experimento, servicio y ejecución se encuentran en athena-platformEsta delimitación separa el acceso a los datos de entrenamiento de los servicios que realizan predicciones en línea.

Desde datos controlados hasta un modelo de producción#

Diagrama de flujo
YesNo1Governed payment data2Data quality gates3Feature preparation4Train candidate5Offline and replayevaluation6Register artifacts andmetadata7Serving readiness8Shadow or controlledexperiment9Evidence passes?10Promote and monitor11Reject or roll back12Outcome feedback
Excepción o detención

Modelos de pago soportados por el ciclo de vida#

El mismo ciclo de vida se puede utilizar para varias familias de decisiones, dependiendo de la configuración de la cuenta y la disponibilidad:

Algunas familias de decisiones utilizan un único predictor; otras entrenan varias salidas relacionadas o combinan la evidencia del modelo con reglas de elegibilidad y seguridad.

Qué se prueba#

1. Puertas de datos

Antes de comenzar el entrenamiento, la tubería verifica que la fuente es utilizable: frescura, volumen mínimo, campos requeridos, disponibilidad de etiquetas, equilibrio de clases y distribuciones de características. Los splits y comprobaciones de fugas temporales evitan que la información futura entre en ejemplos pasados.

2. Calidad del modelo fuera de línea

La evaluación es específica para la decisión. Puede incluir discriminación, precisión y recuerdo, calibración, calidad de clasificación, error por cohortes y el efecto comercial esperado. Los "holdouts" temporales muestran si un candidato se generaliza más allá del período en el que se entrenó.

Las pruebas de "replay" y basadas en políticas comparan las decisiones del modelo con resultados históricos o observados en vivo, siempre que los datos lo permitan. Ninguna métrica por sí sola es suficiente para la promoción.

3. Contratos de artefactos y características

El paquete del modelo incluye el artefacto del modelo, así como los metadatos necesarios para reproducir sus entradas y salidas. Las pruebas validan el orden y los tipos de características, los codificadores, los identificadores de modelo admitidos, el esquema de salida y la compatibilidad con el entorno de ejecución.

4. Preparación para el servicio

Una versión registrada debe cargarse correctamente, exponer la salud y la preparación para el servicio, responder a solicitudes representativas y cumplir con las expectativas de latencia y errores. La preparación es independiente de la calidad del modelo: un candidato sólido que no se puede servir de forma segura no avanza.

5. Evidencia en tiempo real

El modo "shadow" registra lo que habría decidido el modelo sin modificar la transacción. Los experimentos controlados asignan una parte acordada del tráfico elegible a un candidato y lo comparan con una línea base. Los "guardrails" supervisan tanto los resultados de los pagos como la salud operativa.

Puertas de promoción#

PuertaEvidencia requerida
DatosEntrada de entrenamiento válida, suficientemente reciente y representativa
Evaluación fuera de líneaUmbrales específicos del modelo, junto con un comportamiento y calibración aceptables del grupo
ContratoArtefactos reproducibles, metadatos, esquema de características y pruebas de carga
ServicioDespliegue saludable con latencia y comportamiento de error aceptables
ExperimentoEvidencia controlada contra la línea base activa y sin violar ningún "guardrail"
AprobaciónDecisión de promoción autorizada con un registro de auditoría conservado

Un modelo promocionado es reversible. Se pueden reducir los pesos de tráfico, se puede restaurar el modelo anterior y se puede volver a utilizar el modo "shadow" mientras se investiga un nuevo candidato.

Lo que ves en Athia#

El área de operaciones del modelo integra: