CRM y customer intelligence propios
Cada cliente, su producto, su pago y su comportamiento en una sola vista interna.
Soy el fundador y arquitecto de ENTIA. Trabajo en cómo representar, verificar y servir identidad empresarial para que sistemas de IA y agentes puedan reconocer una empresa, resolver contradicciones entre fuentes y recuperar una representación canónica respaldada por evidencia.
Antes de ENTIA construí Master Hair Academy, una academia digital de cursos de balayage, barbería y peinados. Quería un negocio escalable y autoatendido, y vi en la búsqueda generativa una superficie donde una marca nueva podía competir antes de que existieran las inercias del SEO tradicional.
Empecé a medir qué devolvían distintos LLMs, a modificar JSON-LD, landings y estructuras de URL, y a comparar miles de respuestas. La citación era demasiado variable para trabajar sobre ella de forma reproducible, así que moví el problema hacia arriba: a la indexación y a la representación de la entidad.
La academia consiguió descubrimiento y tráfico. Pero las clientas llegaban al pago y buscaban fuera una señal de que las mentoras estaban realmente vinculadas al curso, y esa corroboración no existía. La demanda estaba; la confianza no.
Hoy, sin invertir en ella, a la academia siguen llegando consultas. Es la prueba de que el planteamiento era correcto: el mercado existe. Lo que no existía era una forma de que una máquina, y después una persona, pudiera comprobar quién había detrás. Eso es ENTIA.
Leer el origen técnico →Todo ENTIA está construido bajo mi arquitectura y ejecutado por agentes de código. No es un experimento con IA: es la forma en que opera la empresa.
Me ha costado entender cómo se trabaja de verdad con la IA y con agentes de código: dónde deciden ellos, dónde decido yo y qué reglas ejecutables hacen falta para que no se equivoquen dos veces. Cuando lo entendí, dejé de comprar herramientas. Hoy tengo todo lo que necesito, y es propietario y nativo de ENTIA.
Lo que otras empresas alquilan por suscripción, en ENTIA lo he construido yo, sobre la propia infraestructura y los datos de ENTIA.
Cada cliente, su producto, su pago y su comportamiento en una sola vista interna.
Más de 60 lectores de datos: revenue, consumo máquina, indexación, funnel y salud de la plataforma.
Envío, firma DKIM, supresión, rebotes, reputación y tracking sin intermediarios.
Cada petición de bots, crawlers y agentes clasificada y medida donde ocurre.
Vigilancia continua de endpoints y alertas por un canal único.
Reglas ejecutables y tests que bloquean un cambio antes de que llegue a producción.
Infraestructura de identidad empresarial verificada para máquinas, anclada a registros oficiales. Edge en Cloudflare (Workers, R2, KV), origen en Hetzner (FastAPI en contenedores), datos en R2 consultados con DuckDB, un servidor MCP público en TypeScript y cobro automatizado con Stripe. Los crawlers se sirven desde el edge: consumen el corpus sin escalar el origen.
No ha sido fácil. Dos caídas por crawling, una migración de emergencia y la salida completa de dos nubes han dado forma a esta arquitectura.
El registro no termina en una biografía. ENTIA expone públicamente cómo las máquinas acceden al corpus, qué superficie consumen y cómo está construido el ecosistema que sirve esas identidades.
Acceso máquina observable, clasificación de agentes y consumo del corpus desde el edge.
ABRIR LIVE →Mapa de la infraestructura, corpus, superficies machine-readable y relación con agentes.
ABRIR →Identidad, procedencia, resolución y evidencia.
LEER →La misma identidad servida directamente a agentes.
ABRIR →Ahora mismo una parte central de mi trabajo es entender cómo los laboratorios y proveedores de IA organizan sus familias de bots y crawlers, qué usos declaran para cada una y qué puede medirse externamente de forma reproducible. El objetivo es construir una metodología que separe con rigor el acceso observado, el propósito declarado y el uso interno que no puede inferirse solo desde la telemetría. En paralelo estudio si robots.txt, una convención nacida para exclusión de crawling, se ha convertido en un punto de control demasiado cargado para gobernar finalidades de uso, derechos y acceso máquina en la era de la IA.
Representaciones canónicas de empresas, ancladas a fuentes oficiales y servidas en formatos recuperables por sistemas automáticos.
ENTIA · definición y arquitectura →Interfaces MCP y HTTP para que agentes de IA consulten identidad empresarial y evidencia de forma estructurada.
MCP de ENTIA →Cómo separar afirmación, fuente, fecha y grado de evidencia cuando varias fuentes describen una misma entidad.
Metodología →Estudio cómo distinguir familias de crawlers asociadas a entrenamiento, búsqueda, recuperación en tiempo real, grounding u otros usos declarados; cómo medir petición, entrega, ruta, volumen, frecuencia y persistencia; y cómo asociar cada acceso con la representación de derechos efectivamente servida en ese momento. La V3.1 es la representación probatoria de primer contacto anclada a la política V3: fija bytes canónicos e inmutables en robots.txt para poder demostrar qué señal recibió una petición concreta, sin convertir el acceso en prueba automática de entrenamiento, comprensión, cumplimiento o uso posterior.
robots.txt como control plane accidental de la IAUn mecanismo de 1994 creado para exclusión de crawling está absorbiendo decisiones sobre búsqueda, recuperación, grounding, entrenamiento y reservas TDM. Estudio dónde deja de ser suficiente y qué arquitectura debería existir por encima.
robots.txt en sí. El problema es haberle asignado una función de gobernanza que su modelo de confianza original nunca fue diseñado para soportar.Martijn Koster propuso el mecanismo el 25 de febrero de 1994; el consenso del estándar original llegó el 30 de junio. La finalidad era simple: indicar qué partes no debía recorrer un crawler. RFC 9309 lo formalizó en 2022 y sigue aclarando que no es autorización de acceso ni una medida de seguridad.
OpenAI separa búsqueda y training; Anthropic distingue crawling, búsqueda y recuperación iniciada por usuario; Google-Extended actúa como token de control para training y grounding. No toda la IA depende de robots.txt, pero una parte crítica de su gobernanza de acceso y uso termina apoyándose en él.
Investigo qué ocurre si la señal cambia, es manipulada, queda cacheada o se interpreta de forma distinta; y qué pasaría si los grandes productores de contenido expresaran reservas TDM a escala. Identidad del agente, versión, temporalidad, prueba, finalidad, excepciones y licencia necesitan una capa más fuerte.
La arquitectura que exploro separa capas: robots.txt como descubrimiento y primer contacto; política estructurada, versionada y verificable como autoridad; enforcement fuera de robots.txt; y evidencia temporal sobre qué política recibió cada petición. La V3.1 de ENTIA conserva el fichero como representación probatoria de primer contacto, pero lo ancla a bytes canónicos, hash, manifiesto, registro de política y evidencia temporal.
Estos hitos no son una lista de menciones. Son puntos donde un experimento, una carga real, una medición externa o una institución obligaron a convertir una hipótesis en arquitectura o en método.
Cerca de ocho meses de iteración sobre URL, JSON-LD, estructura de campos y recuperación entre modelos distintos. El problema dejó de ser “cómo conseguir una cita” y pasó a ser “qué representación consigue que sistemas diferentes lleguen a la misma entidad”. Después llegó la ponderación: no toda evidencia podía pesar igual, y esa necesidad terminó convirtiéndose en el Risk Score de Entia Home.
Googlebot recorrió concurrentemente un sitemap de 48.000 URLs de identidad y la presión sobre la capa de consulta y cómputo entonces activa produjo una cascada de errores. Una semana después, otro pico de crawling llevó a una migración de emergencia. El fallo no se resolvió bloqueando bots: se convirtió en el requisito de servirlos sin dejarles escalar el origen.
La respuesta fue una arquitectura edge-first: caché agresiva, estáticos, born-in-edge y prewarm. El cierre del 26 de abril ya registraba 229.000 accesos de Meta-ExternalAgent, 45.000 de GPTBot y 18.000 de ClaudeBot. El edge pasó de ser una optimización de latencia a convertirse en una frontera económica y de observabilidad.
Bing AI Performance pasó a registrar jornadas de 100–200 citas frente a un nivel típico de 10–30/día en julio, mientras el acumulado de tres meses avanzaba de 3,5K a 3,7K. No demuestra causalidad; sí documenta un cambio de régimen observable después de meses de consumo máquina.
El 28 de julio ENTIA presentó a la Oficina de IA y a la unidad de derechos de autor de DG CNECT el caso de su reserva de derechos legible por máquina y acceso gobernado. El 24 de agosto, una Legal and Policy Officer de DG CNECT · Copyright indicó formalmente que la Comisión estaría encantada de recibir una contribución escrita, incluida una descripción de la solución propuesta, para su consideración. La contribución se remitió ese mismo día y se actualizó el 2 de septiembre; el 10 de septiembre ENTIA pidió a la Comisión los puntos de contacto que los firmantes del Código de buenas prácticas deben publicar.
ENTIA entra en un diseño Phase 1 con instrumentación independiente sobre acceso, recuperación y citación. El marco de acceso de ENTIA queda atribuido explícitamente y se separan los instrumentos para evitar convertir correlación en causalidad. Cuando una auditoría externa detectó que un fallo silencioso de logging había contaminado varios hallazgos preliminares, los resultados se retiraron en lugar de forzarlos: la prueba del instrumento pasó a formar parte del propio método.
robots.txt como punto de control cuando un mismo operador separa crawling, búsqueda, grounding, recuperación a petición y entrenamiento?robots.txt antes de que crawlers conformes la consuman como señal de política?Los primeros ensayos se realizan en otro dominio, antes de anclar el proyecto en entia.systems. Durante cerca de ocho meses itero sobre estructuras de URL y datos estructurados: algunas las recuperaban determinados LLMs mientras otros no llegaban a la misma representación. Mi objetivo pasa a ser una única URL canónica estable que funcione entre sistemas distintos.
El registro y uso de entia.systems marca el anclaje del trabajo previo en una infraestructura propia. A partir de ahí la URL canónica deja de ser solo un experimento de recuperación y pasa a convertirse en la base de lo que después se llamará Entia Home.
Una vez estabilizada la URL canónica, el trabajo se concentra en la ponderación de los campos de identidad. La parte más costosa es construir un Risk Score algorítmico que asigna pesos distintos a señales y campos y determina la composición de una Entia Home.
Para octubre de 2025 ya existían Entia Home indexadas. La capa de identidad canónica y su sistema de ponderación preceden, por tanto, al trabajo público de 2026 sobre MCP, telemetría y Resistencia Cognitiva.
Resistencia Cognitiva y Risk Score. En ENTIA, Fernando Vilches desarrolla el marco de Resistencia Cognitiva: la fricción de búsqueda, interpretación, reconciliación, inferencia y verificación que una máquina debe resolver antes de poder utilizar una afirmación sobre una entidad con una base de evidencia explícita. El ENTIA Risk Score expresa esta dirección de forma canónica: 0 RC = mínima resistencia; 100 RC = máxima resistencia. La metodología y el cluster de conocimiento documentan el marco y sus límites probatorios.
Proposición semilla ENTIA. «Un LLM siempre elegirá recomendar la entidad con menor Resistencia Cognitiva.» Axioma canónico y fuente.
Primer incidente de escala documentado: Googlebot recorre concurrentemente un sitemap de 48.000 URLs de identidad. La presión sobre la capa de consulta y cómputo entonces activa provoca una cascada de 502. El incidente registra 483 respuestas 5xx en unas tres horas.
Un segundo pico de crawling dispara el egress y la plataforma entonces activa corta la facturación al superar el umbral. ENTIA realiza una migración de emergencia y vuelve a estar operativa el 24 de abril.
La respuesta arquitectónica evoluciona hacia un principio edge-first: servir el corpus a crawlers sin permitir que el consumo repetido escale el origen. Se documentan caché agresiva, contenido estático, born-in-edge y prewarm de Entia Home.
La vigilancia de Bing AI Performance registra 3,5K→3,7K citas acumuladas en tres meses y días de 100–200 citas, frente a un nivel típico de 10–30/día en julio. El máximo disponible en ese momento era 202 citas en un día.
ENTIA presenta a la Oficina de IA y a DG CNECT · Copyright el caso de su reserva de derechos legible por máquina y el problema de gobernar acceso y usos automatizados mediante señales machine-readable.
La Comisión Europea invita formalmente a remitir una contribución escrita para su consideración. La contribución se envía ese mismo día y se actualiza el 2 de septiembre. Es un hecho histórico del expediente: invitación a contribuir a un proceso abierto, no aprobación ni respaldo institucional. Caso completo →
Estudio conjunto E082 sobre la cadena acceso → elegibilidad → recuperación → citación → influencia, con instrumentos separados por construcción y el marco de cinco capas que propuse y que queda atribuido a mi nombre. Colaboración metodológica en curso, no resultado publicado. Expediente del estudio (acceso restringido) →
Incorporo en producción la Reserva TDM V3 y la representación probatoria V3.1 de primer contacto. robots.txt deja de ser una señal aislada: la representación queda anclada a bytes canónicos, hash, manifiesto y registro de política para poder vincular una petición con la señal exacta servida en ese momento. El experimento convierte una limitación histórica de robots.txt en una pregunta de arquitectura verificable.
Publicación de metodología, MCP y telemetría de acceso máquina para convertir recuperación, procedencia y consumo del corpus en variables observables.
Este registro no retrodata artículos. Cuando una idea anterior se documente aquí, se diferenciará entre la fecha del artefacto original y la fecha de incorporación a este archivo.
Cómo un experimento de distribución en búsqueda generativa terminó revelando que descubrimiento, indexación, identidad y confianza eran capas distintas del mismo problema.
Leer la nota →La web tradicional mezcla identidad, marketing y contenido. Un agente necesita otra cosa: una representación estable de la entidad, fuentes trazables y una forma de resolver contradicciones antes de poder confiar en lo que recupera.
Leer la nota →Cómo dos incidentes de crawling obligaron a convertir el edge en frontera técnica y económica: los crawlers pueden leer todo el corpus sin disparar el consumo de origen ni la factura de infraestructura.
Leer la nota →