Agentes de IA para empresas, con tus datos y en tu propio equipo
Construimos asistentes y agentes que responden con el dato de tu empresa: ventas, inventario, cumplimiento, reportes. Las cifras las calculan funciones de código y el modelo de lenguaje sólo las explica. El agente cita la fuente de cada respuesta y dice «no sé» cuando no tiene el dato.
Corre en un computador del cliente con modelos abiertos, sin enviar datos afuera. Antes de entregar se le pone nota con preguntas reales; si no gana la prueba, no se entrega.
Lo que ya medimos, sin nombres de clientes
Cifras de nuestras propias pruebas (septiembre de 2026), con un modelo abierto de 8 mil millones de parámetros corriendo en un computador con tarjeta gráfica de 8 GB. Son notas de prueba, no de uso en producción.
El asistente del laboratorio está en etapa de prueba con el cliente; todavía no está instalado en su operación diaria.
Un asistente de datos con IA que no entrega cifras sin respaldo
El error típico de un chat con IA sobre datos de negocio es que suma mal, confunde meses o rellena con un número plausible. Por eso separamos el trabajo: las funciones de código leen la planilla o el sistema del cliente y calculan; el modelo de lenguaje elige qué función llamar y redacta la respuesta con lo que la función devolvió.
- Cada cifra de la respuesta se contrasta con lo que devolvieron las funciones. Si una no aparece ahí, se saca o se vuelve a preguntar.
- Los juicios («está bajo la meta», «hay sobrestock») también los calcula el código, con los umbrales que define el cliente.
- Toda respuesta termina con su fuente: qué archivo, qué entrega, qué mes.
- Si el dato no está en lo que el cliente entregó (margen, proyecciones, un mes que no llegó), responde «no lo tengo» y dice qué dato faltaría.
- Responde según quién pregunta: no es lo mismo el gerente comercial que el ejecutivo de una cadena.
Otro ejemplo del mismo método: un revisor de cargas de datos para una empresa de consumo masivo, que avisa qué llegó raro en cada entrega con su monto. Sobre el set de 16 errores reales de septiembre, las reglas que existían antes detectaban 7 de 16.
IA local, sin enviar datos afuera
El agente corre en un computador del cliente con modelos abiertos, como Qwen. Los datos de ventas, clientes o pacientes no pasan por servicios de IA de terceros: no hay que negociar con el área legal qué sale de la empresa, porque no sale nada.
Un equipo con tarjeta gráfica de 8 GB alcanza para un modelo de 8 mil millones de parámetros respondiendo en segundos. El tamaño del modelo no se elige por prestigio sino por la nota: en una prueba, un modelo de 14 mil millones no subió la nota y tardaba el doble, así que se quedó el de 8.
Evaluación con nota antes de entregar
Antes de escribir una línea se arma, con el cliente, un set de preguntas reales de su área, incluidas las que no tienen respuesta en sus datos. Cada versión del agente se corre contra ese set, varias veces, y recibe una nota de 0 a 1. Un cambio que no sube la nota no entra.
| Qué se mide | Peso |
|---|---|
| La respuesta es correcta | 40 % |
| Usó la función adecuada | 15 % |
| Cita la fuente | 10 % |
| No inventa cifras | 15 % |
| Forma: breve, en viñetas, en el tono del cliente | 20 % |
El set de prueba se puede entregar junto con el agente, para que el cliente pueda volver a medirlo cuando cambien sus datos o el modelo.
Fine-tuning de modelos de lenguaje con LoRA, sólo cuando sube la nota
El ajuste fino (fine-tuning) enseña al modelo el formato, el vocabulario y las reglas de una tarea con ejemplos propios. Usamos LoRA en 4 bits (QLoRA), que entrena una capa pequeña sobre un modelo abierto y cabe en un equipo común: un modelo de 4 mil millones de parámetros con 123 ejemplos se ajustó en unos 15 minutos con menos de 5 GB de memoria gráfica.
Ese ajuste subió la nota de 0,76 a 0,87 en 51 casos, contra el mismo modelo con las mismas instrucciones sin ajustar. Pero en otra tarea —el resumen diario— el modelo ajustado se salía del formato, así que ahí se quedó el modelo sin ajustar. El fine-tuning es una herramienta más, no un paso obligatorio: primero se prueba con buenas instrucciones y buenas funciones, y se ajusta sólo si la nota lo justifica.
Los ejemplos de entrenamiento se revisan para que no lleven claves, RUT ni datos que el cliente no quiera en el modelo.
Skills para agentes: habilidades que entregan trabajo hecho
Además de responder preguntas, el agente tiene habilidades: tareas completas que el código arma y valida, con cada número respaldado por el dato.
Resumen ejecutivo
Cinco viñetas con lo que importa, distintas según el cargo de quien lo pide.
Plan de acción
Qué hacer, con responsable, plazo propuesto y el monto en juego en cada punto.
Preparar una reunión
Para una reunión con un cliente o sobre un producto: qué decir, qué pedir y qué llevar.
Presentación
Un archivo de PowerPoint de cuatro láminas: resumen, gráfico con leyenda, plan y fuentes.
RAG y memoria: que el agente sepa dónde está cada cosa
Para documentos, actas, manuales y notas internas usamos RAG (búsqueda sobre los propios archivos del cliente) y memoria: el agente busca en el archivo antes de contestar y dice de dónde sacó la respuesta. En una prueba de 12 preguntas del tipo «¿dónde está tal cosa?», el modelo pasó de 0,08 a 0,92 al darle esa memoria.
Para cifras de negocio no basta con buscar trozos de texto: un buscador no suma. Por eso las preguntas numéricas van a funciones y los documentos van a RAG.
Una fábrica de guías, aplicaciones y agentes
Los agentes salen de la misma fábrica con la que construimos guías, aplicaciones web y herramientas de trabajo con IA: un método repetible con pruebas automáticas, revisión de secretos antes de publicar y medición de uso. El catálogo tiene 128 proyectos construidos con IA; algunos están en producción y muchos son prototipos o demos.
Ver el catálogo de proyectos con IA → · Ver todos los servicios →
Preguntas frecuentes sobre agentes de IA y fine-tuning
¿Qué es el fine-tuning de un modelo de lenguaje?
Es entrenar un modelo abierto con ejemplos propios para que aprenda el formato, el vocabulario y las reglas de una tarea. Usamos LoRA en 4 bits (QLoRA): entrena una capa pequeña sobre el modelo y cabe en un equipo común. En una prueba, un modelo de 4 mil millones de parámetros con 123 ejemplos se ajustó en unos 15 minutos y su nota subió de 0,76 a 0,87.
¿Fine-tuning o RAG: cuál conviene?
Depende de la pregunta. Las cifras de negocio van a funciones de código, porque un buscador no suma. Los documentos, actas y manuales van a RAG, que busca en los archivos del cliente y cita de dónde sacó la respuesta. El fine-tuning se agrega sólo si sube la nota: primero se prueba con buenas instrucciones y buenas funciones.
¿Qué equipo se necesita para un agente de IA local?
Un computador con tarjeta gráfica de 8 GB alcanza para un modelo abierto de 8 mil millones de parámetros, como Qwen servido con Ollama, respondiendo en 5 a 8 segundos. Para ajustar con fine-tuning un modelo de ese tamaño hacen falta 12 GB o más; con 8 GB se ajustan modelos de hasta unos 4 mil millones.
¿Los datos de la empresa salen a servicios de IA externos?
No. El agente corre en un computador del cliente con modelos abiertos. Los datos de ventas, clientes o pacientes no pasan por servicios de IA de terceros.
¿Cómo se evita que el agente invente cifras?
Las cifras las calculan funciones de código y el modelo sólo las explica. Cada número de la respuesta se contrasta con lo que devolvieron las funciones y el que no aparece ahí se bloquea. En 315 respuestas ninguna cifra sin respaldo llegó al usuario; el filtro rechazó entre 8 y 23 borradores por corrida. Si el dato no está, el agente dice «no sé» y qué dato faltaría.
¿Cómo se sabe si el agente funciona antes de entregarlo?
Con el cliente se arma un set de preguntas reales de su área, incluidas las que sus datos no pueden responder. Cada versión del agente se corre varias veces contra ese set y recibe una nota de 0 a 1. Si no gana la prueba, no se entrega, y el set queda para volver a medirlo cuando cambien los datos o el modelo.
Lo que conviene saber antes
- Las notas de esta página salen de sets de prueba de 12 a 51 preguntas. Diferencias de 0,02 o 0,03 son ruido; la prueba de verdad es con los usuarios del cliente.
- El agente responde con lo que el cliente entrega. Si el dato viene incompleto o cortado, lo dice, pero no lo puede reconstruir.
- El control de cifras detecta números sin respaldo, pero no todos los errores de juicio sin cifra; por eso los juicios importantes los calcula el código.
- Ajustar un modelo de 8 mil millones de parámetros exige una tarjeta gráfica de 12 GB o más; con 8 GB se ajustan modelos de hasta unos 4 mil millones.
- Cada proyecto se cotiza según los datos disponibles, las preguntas y el equipo del cliente. No publicamos precios ni plazos fijos.
¿Tienes datos y preguntas que se repiten?
Cuéntanos qué preguntas le hace tu equipo a sus planillas o reportes. Revisamos si un agente local las puede responder y cómo lo mediríamos.