Ir al contenido principal
FromNine
Menú

IA y datos

Ingeniería de IA generativa para empresas, preparada para producción

Desarrollamos aplicaciones de IA generativa sobre su propio conocimiento y sus datos, con una recuperación que respeta los permisos, una evaluación que condiciona cada versión y un coste, una calidad y una latencia siempre visibles.

Para empresas y organismos en España que quieren pasar del piloto de IA generativa a un servicio en producción, con su conocimiento en español y bajo su control.

Ingeniería de IA e IA generativa: capas de capacidadCuatro capas superpuestas en profundidad. De arriba abajo: la recuperación sobre sus fuentes, la pasarela de modelos, la evaluación y las salvaguardas, y la aplicación con la que trabajan sus usuarios. Un único recorrido va de las fuentes a la aplicación.01Recuperación sobre sus fuentes02Pasarela y enrutamiento de modelos03Evaluación y salvaguardas04Aplicación en producción
  1. 01Respuestas que citan sus fuentes y se abstienen cuando falta la evidencia
  2. 02Un conjunto de referencia y controles de regresión acordados con sus equipos antes de la puesta en producción
  3. 03Enrutamiento de modelos y presupuestos que mantienen visibles el coste y la latencia de cada petición

01 Problemas

Dónde se atasca la IA generativa

El modelo rara vez es lo difícil. Lo que frena la mayoría de los programas es todo lo que lo rodea.

  1. 01

    El piloto convenció, pero nadie sabe decir si es bueno

    La calidad la juzgaron unas pocas personas con unas pocas preguntas. No hay un conjunto de pruebas, así que cada cambio de prompt o de modelo es una apuesta.

  2. 02

    El asistente muestra documentos que el usuario no debería ver

    El contenido se indexó sin sus permisos de acceso. El equipo de seguridad y la representación de los trabajadores paralizan el despliegue, y con razón.

  3. 03

    Los costes crecen más deprisa que el uso

    Cada petición va al modelo más grande con el contexto más largo. Nadie conoce el coste de una respuesta, así que nadie puede gestionarlo.

  4. 04

    Las respuestas suenan bien y no lo están

    La recuperación devuelve resultados que casi aciertan, el modelo rellena los huecos con soltura y los usuarios pierden la confianza tras el tercer error dicho con aplomo.

02 Qué entregamos

Qué entregamos

  1. 01 Recuperación de información y sistemas de conocimiento corporativo

    Una recuperación diseñada fuente a fuente: cómo se analiza y fragmenta el contenido, cómo se combinan la búsqueda léxica y la vectorial y cómo los permisos de acceso acompañan a cada pasaje. Es la base de los asistentes de conocimiento corporativo.

    Qué hacemos

    • Inventario de fuentes con sus responsables, formatos y modelos de acceso
    • Estrategia de fragmentación y metadatos por tipo de documento
    • Búsqueda híbrida léxica y vectorial con reordenación
    • Recuperación sujeta a permisos, que hereda los derechos de acceso de la fuente

    Qué recibe

    • Pipelines de ingesta con detección de cambios
    • Servicio de recuperación con citas y reglas de abstención
    • Informe de calidad de la recuperación por fuente
  2. 02 Estrategia de modelos sin dependencia de proveedor

    Una pasarela de modelos entre sus aplicaciones y los modelos, para enrutar por tarea, recurrir a una alternativa cuando un proveedor falla y cambiar de modelo a medida que evolucionan precios y capacidades.

    Qué hacemos

    • Opciones entre modelos de frontera alojados, despliegues alojados en la UE y modelos de pesos abiertos autoalojados
    • Enrutamiento por tarea, sensibilidad y coste
    • Alternativas de respaldo, tiempos de espera, caché y límites de uso
    • Condiciones de tratamiento de datos revisadas con sus equipos jurídico y de seguridad

    Qué recibe

    • Pasarela de modelos con la política de enrutamiento como configuración
    • Registro de decisión de modelo por caso de uso
    • Presupuesto de coste y latencia por tipo de petición
  3. 03 La evaluación como disciplina de ingeniería

    Criterios de calidad acordados con los responsables del proceso y convertidos en conjuntos de pruebas que se ejecutan con cada cambio. Las evaluaciones realizadas por modelos se calibran frente a la revisión humana antes de confiar en ellas.

    Qué hacemos

    • Conjuntos de referencia por caso de uso, elaborados con expertos del negocio
    • Evaluación offline de la recuperación y de la generación por separado
    • Ejercicios de red team frente a la inyección de prompts y la fuga de datos
    • Evaluación online a partir del uso real en producción y de revisiones por muestreo

    Qué recibe

    • Batería de evaluación integrada en CI como control previo a cada versión
    • Criterios de calidad aprobados por el responsable de negocio
    • Hallazgos del red team y medidas de mitigación
  4. 04 LLMOps y observabilidad

    Trazabilidad desde la pregunta hasta los pasajes recuperados, la llamada al modelo y la respuesta, con prompts y modelos versionados como el código y presupuestos que se aplican en producción.

    Qué hacemos

    • Trazas y registros estructurados de cada petición
    • Versionado de prompts, modelos e índices
    • Caché semántica y exacta allí donde es seguro
    • Supervisión de la deriva y de la calidad, con alertas

    Qué recibe

    • Cuadros de mando de calidad, coste y latencia
    • Procedimiento de respuesta a incidentes específicos de la IA
    • Runbook para actualizar modelos e índices
  5. 05 Gobernanza desde el diseño

    Diseñamos teniendo presente el Reglamento Europeo de IA, desde la clasificación del riesgo y su papel como proveedor o responsable del despliegue hasta el registro de actividad, la supervisión humana y la documentación. La valoración jurídica corresponde a sus propios asesores legales.

    Qué hacemos

    • Clasificación del caso de uso y obligaciones según el papel de cada parte
    • Aportaciones a las evaluaciones de impacto relativas a la protección de datos conforme al RGPD
    • Diseño del registro de actividad y de la supervisión humana
    • Documentación del modelo y del sistema mantenida junto al código

    Qué recibe

    • Dossier de documentación del sistema
    • Diseño de registro y conservación
    • Procedimiento de supervisión para cada caso de uso
  6. 06 Ajuste fino y comprensión de documentos, cuando la evaluación lo justifica

    El ajuste fino, la destilación y la comprensión multimodal de documentos son herramientas para carencias concretas. Las empleamos cuando la batería de evaluación demuestra que la recuperación y los prompts no bastan, y no antes.

    Qué hacemos

    • Análisis de carencias a partir de los resultados de la evaluación
    • Plan de preparación y etiquetado de datos
    • Destilación a modelos más pequeños por coste o latencia
    • Extracción que respeta la maquetación en documentos escaneados y complejos

    Qué recibe

    • Evaluación comparativa del antes y el después
    • Trazabilidad de los datos de entrenamiento
    • Decisión de mantener, revertir o retirar

03 Arquitectura

Una arquitectura de referencia ilustrativa

La mayoría de los sistemas empresariales de IA generativa que desarrollamos comparten una misma forma: recuperación sobre sus fuentes, una pasarela de modelos, salvaguardas a ambos lados del modelo y, por debajo, un ciclo de evaluación y observabilidad que decide qué puede pasar a producción.

El filtro de permisos está dentro de la recuperación, no en la interfaz de usuario. Si una persona no puede abrir un documento en el sistema de origen, sus pasajes nunca llegan al modelo en su nombre.

Capas del diagrama

Fuentes
Repositorios documentales, wikis y sistemas de negocio, además del proveedor de identidad que sabe quién puede ver qué.
Recuperación
Ingesta, un índice híbrido, reordenación y el filtro de permisos.
Modelos
Una pasarela que enruta entre modelos alojados, alojados en la UE y autoalojados, con alternativas de respaldo y caché.
Aplicación
Respuestas con citas, abstención cuando falta evidencia y salvaguardas sobre la entrada y la salida.
Operación y mejora
Conjuntos de referencia, controles de regresión, trazas y presupuestos. Las trazas de producción alimentan el siguiente conjunto de pruebas.
Ejemplo ilustrativo
  1. Fuentes

    • Repositorios documentales y wikis
    • Sistemas de negocio
    • Proveedor de identidad
  2. Recuperación

    • Ingesta y fragmentación
    • Índice híbrido
    • Filtro de permisos
    • Recuperación y reordenación
  3. Modelos

    • Pasarela de modelos
    • Modelos alojados, alojados en la UE y autoalojados
    • Salvaguardas de entrada y salida
  4. Aplicación

    • Aplicación con citas
  5. Operación y mejora

    • Conjuntos de referencia y controles de regresión
    • Trazas y presupuestos de coste y latencia
Recuperación, pasarela de modelos y ciclo de evaluación

Arquitectura ilustrativa, no corresponde a ningún sistema de cliente.

Leer el diagrama como texto

El recorrido principal va desde los repositorios documentales, pasando por la ingesta, un índice híbrido, la recuperación con reordenación y la pasarela de modelos, hasta la aplicación.

Los sistemas de negocio también alimentan la ingesta. El proveedor de identidad alimenta un filtro de permisos que acota la recuperación. Las salvaguardas comprueban la entrada y la salida de la aplicación. La pasarela enruta hacia modelos de frontera alojados, despliegues alojados en la UE y modelos de pesos abiertos autoalojados.

Por debajo, una batería de evaluación con conjuntos de referencia y controles de regresión, y la observabilidad con trazas y presupuestos de coste y latencia. Las trazas de producción alimentan la batería de evaluación.

04 Consideraciones y límites

Consideraciones de ingeniería y límites

  • La calidad se mide, no se promete

    Cómo lo abordamos

    Acordamos los criterios de calidad con los responsables de sus procesos y contrastamos los resultados de la IA con ellos antes y después de cada versión.

    La recuperación y la generación se evalúan por separado, de modo que cada fallo apunta a su causa.

    Límites y dependencias

    La IA puede equivocarse. Por eso diseñamos pasos de revisión para los casos dudosos y la abstención cuando falta evidencia.

    Un conjunto de pruebas vale lo que valen los expertos que ayudan a elaborarlo. Necesitamos su tiempo desde el principio.

  • Los permisos acompañan al contenido

    Cómo lo abordamos

    Los derechos de acceso se capturan en la ingesta y se aplican en el momento de la consulta frente a su proveedor de identidad.

    Límites y dependencias

    Cuando un sistema de origen gestiona los permisos de forma que no pueden leerse con fiabilidad, dejamos ese contenido fuera del alcance hasta que sea posible.

    El contenido compartido en exceso en el origen sigue estándolo. La recuperación lo hace más fácil de encontrar, por lo que a veces el primer paso es una depuración.

  • El coste y la latencia son datos de diseño

    Cómo lo abordamos

    Cada tipo de petición tiene un presupuesto. El enrutamiento, la caché y el tamaño del contexto se ajustan a él, y los cuadros de mando muestran adónde va el gasto.

    Límites y dependencias

    Los precios y los límites de uso de los proveedores cambian sin que usted pueda evitarlo. La pasarela le permite reaccionar, pero no hace desaparecer una subida de precios.

  • Los modelos cambian bajo sus pies

    Cómo lo abordamos

    Los modelos se fijan por versión, y cada actualización pasa la batería de evaluación completa antes de llegar a los usuarios.

    Límites y dependencias

    Los modelos alojados se retiran a veces con poca antelación. Planificamos una alternativa por caso de uso, y ese plan requiere la aprobación del responsable.

05 Cómo trabajamos

Cómo trabajamos

El orden importa: decidimos cómo medir antes de decidir qué construir.

  1. 01

    Delimitar el caso de uso

    Quién lo utiliza, qué decisiones respalda, a qué fuentes puede acceder y qué cuesta una respuesta errónea.

    ResultadoFicha del caso de uso y clasificación del riesgo

  2. 02

    Elaborar el conjunto de referencia

    Preguntas reales y respuestas esperadas, recopiladas con sus expertos, incluidas las que el sistema debe rechazar.

    ResultadoConjunto de pruebas versionado

  3. 03

    Construir primero la recuperación

    Ingesta, índice y filtro de permisos, ajustados hasta que la calidad de la recuperación alcanza el umbral acordado.

    ResultadoInforme de calidad de la recuperación

  4. 04

    Publicar tras superar los controles

    La generación, las salvaguardas y la pasarela entran en producción solo cuando la batería de evaluación se supera en CI.

    ResultadoVersión acompañada de evidencias de evaluación

  5. 05

    Operar y mejorar

    Las trazas, la revisión por muestreo y las valoraciones de los usuarios alimentan el siguiente conjunto de pruebas y la siguiente versión.

    ResultadoRevisión mensual de calidad, coste y latencia

06 Control humano

Dónde mantienen el control las personas

La IA generativa redacta, recupera y sugiere. Las personas deciden qué puede ver, qué se considera un buen resultado y qué ocurre cuando no hay certeza.

  • Los responsables aprueban la calidad

    El responsable de negocio de cada caso de uso aprueba los criterios de calidad y las evidencias de cada versión, no solo el equipo de desarrollo.

  • Las respuestas dudosas pasan a una persona

    Por debajo de un umbral de confianza acordado, el sistema se abstiene o deriva la pregunta a un equipo identificado.

  • El acceso se decide en el origen

    Quién puede ver un documento se decide en el sistema de origen y en su proveedor de identidad, nunca dentro de la capa de IA.

  • Las valoraciones cambian el sistema

    Los usuarios pueden señalar respuestas. Las señales las revisan personas, y los fallos confirmados se convierten en casos de prueba.

07 Tecnologías

Tecnologías con las que trabajamos

Recuperación
  • OpenSearch y Elasticsearch
  • PostgreSQL con pgvector
  • Azure AI Search
  • Reordenadores de tipo cross-encoder
Modelos
  • Modelos de frontera alojados
  • Servicios gestionados de modelos en regiones de la UE
  • Modelos de pesos abiertos sobre vLLM
  • Modelos de embeddings por idioma
Evaluación y operación
  • Trazas con OpenTelemetry
  • Baterías de evaluación integradas en CI
  • Registros de prompts y modelos
  • Langfuse o equivalente
Aplicación
  • Servicios en TypeScript y Python
  • API con respuesta en streaming
  • Portales existentes y front-ends de Salesforce, SAP y Odoo

La mención de una tecnología refleja nuestra experiencia de ingeniería. No implica ninguna asociación con su fabricante ni su respaldo.

08 Ejemplo

Un ejemplo ilustrativo

Ejemplo ilustrativo

Un asistente para la asesoría jurídica de una aseguradora

01Situación
Una aseguradora con sede en Madrid quiere que su asesoría jurídica consulte condicionados, circulares y criterios internos en español, pero el piloto da respuestas sin fuente y nadie sabe medir su calidad.
02Qué construiríamos
Recuperación sobre los repositorios documentales con los permisos de cada usuario, respuestas que citan el documento vigente y un conjunto de evaluación que se ejecuta con cada cambio.
03Dónde deciden las personas
Los abogados validan el conjunto de evaluación y cada versión que modifica las respuestas; las preguntas fuera de alcance se derivan a un letrado.
04Qué mediríamos
Porcentaje de respuestas que citan la fuente correcta, tasa de abstención justificada y coste por respuesta.

09 Por sectores

En su sector

  • Asistentes para el personal tramitador y para la ciudadanía que citan la fuente normativa, funcionan en todas las lenguas oficiales y registran qué se recuperó y para quién.

  • Asistentes sobre políticas y procedimientos con permisos estrictos, trazabilidad completa y documentación del riesgo de modelo que su segunda línea de defensa puede revisar.

  • Recuperación sobre protocolos y documentación de producto con límites claros: ninguna decisión clínica y los datos sensibles en entornos aprobados.

España

IA generativa bajo el Reglamento de IA, en España

España fue de los primeros Estados miembros en crear una autoridad específica: la AESIA vigila la aplicación del Reglamento Europeo de IA y ha impulsado un entorno controlado de pruebas para sistemas de alto riesgo. Para una organización española, eso significa que la documentación técnica, la evaluación y los registros de un sistema de IA generativa deben poder mostrarse, no solo describirse.

Diseñamos con ese objetivo: conjuntos de evaluación en el idioma de sus usuarios, validados por sus expertos, residencia de los datos decidida caso por caso conforme al RGPD y a la LOPDGDD, y una documentación que responde a las preguntas de su delegado de protección de datos.

Preguntas sobre ingeniería de IA

¿Qué modelo nos recomiendan?

Depende de la tarea, de los datos implicados y de sus requisitos de alojamiento. Lo habitual es combinar modelos: uno potente para los pasos que exigen razonamiento, modelos más pequeños o autoalojados para la clasificación y la extracción, y despliegues alojados en la UE cuando los datos deben permanecer en la UE.

La pasarela mantiene esa elección reversible, de modo que la respuesta puede cambiar a medida que cambian los modelos y los precios.

¿Qué precisión tendrá?

No damos cifras de precisión antes de haberla medido con sus datos. Acordamos con ustedes los criterios de calidad, elaboramos un conjunto de pruebas y presentamos los resultados frente a él antes de la puesta en producción y después de cada cambio.

La IA puede equivocarse, así que el diseño siempre contempla qué ocurre cuando lo hace: abstención, pasos de revisión y derivación a una persona.

¿Se utilizarán nuestros datos para entrenar el modelo de un tercero?

No en las arquitecturas que diseñamos. Elegimos servicios de modelos cuyas condiciones excluyen el entrenamiento con sus datos de entrada, o alojamos los modelos nosotros mismos en su entorno, y documentamos la elección para cada caso de uso con su equipo de seguridad.

¿Se aplica el Reglamento Europeo de IA a nuestro caso de uso?

Le ayudamos a entender qué obligaciones pueden aplicarse, en función del caso de uso y de su papel como proveedor o responsable del despliegue, y diseñamos el registro de actividad, la supervisión y la documentación en consecuencia. La valoración jurídica corresponde a sus propios asesores legales.

¿Cómo gestionan la seguridad y los datos sensibles?

FromNine cuenta con la certificación ISO/IEC 27001. Los límites de acceso, la residencia de los datos y su conservación se acuerdan antes de empezar a construir, y los ejercicios de red team frente a la inyección de prompts y la fuga de datos forman parte del proceso de publicación que establecemos.

¿Cuál es un primer paso razonable?

Un caso de uso con un responsable claro, un conjunto limitado de fuentes y un conjunto de pruebas elaborado con sus expertos. Así obtiene un sistema que funciona y evidencias sobre calidad, coste y latencia, que es lo que necesita la siguiente decisión de inversión.

Traiga un caso de uso y sus preguntas más difíciles

Le mostraremos cómo lo mediríamos antes de hablar de construirlo.