Entidad personal canónica · registro técnico público

Fernando
Vilches

Soy el fundador y arquitecto de ENTIA. Trabajo en cómo representar, verificar y servir identidad empresarial para que sistemas de IA y agentes puedan reconocer una empresa, resolver contradicciones entre fuentes y recuperar una representación canónica respaldada por evidencia.

ENTIA · entia.systems Madrid / Tallinn PERSON ID · /#founder
01 / CANONICALHTML
02 / STRUCTUREDJSON-LD
03 / EVIDENCEBOE · BORME · VIES
04 / AGENTSMCP
05 / OBSERVEEDGE TELEMETRY
OPERADORES QUE CONSUMEN O CITAN EL CORPUSIDENTIDAD → RECUPERACIÓN → MEDICIÓN
FV
PERSON ENTITY
#founder
OpenAI
Anthropic
Google
Perplexity
xAI
DeepSeek
Microsoft
Meta
Mistral AI
Apple
Amazon
ByteDance
Cohere
CCBot

De dónde sale ENTIA

Pre-ENTIA · masterhair.academy

No me equivoqué con la demanda. Me faltaba la capa de confianza.

Antes de ENTIA construí Master Hair Academy, una academia digital de cursos de balayage, barbería y peinados. Quería un negocio escalable y autoatendido, y vi en la búsqueda generativa una superficie donde una marca nueva podía competir antes de que existieran las inercias del SEO tradicional.

Empecé a medir qué devolvían distintos LLMs, a modificar JSON-LD, landings y estructuras de URL, y a comparar miles de respuestas. La citación era demasiado variable para trabajar sobre ella de forma reproducible, así que moví el problema hacia arriba: a la indexación y a la representación de la entidad.

La academia consiguió descubrimiento y tráfico. Pero las clientas llegaban al pago y buscaban fuera una señal de que las mentoras estaban realmente vinculadas al curso, y esa corroboración no existía. La demanda estaba; la confianza no.

Hoy, sin invertir en ella, a la academia siguen llegando consultas. Es la prueba de que el planteamiento era correcto: el mercado existe. Lo que no existía era una forma de que una máquina, y después una persona, pudiera comprobar quién había detrás. Eso es ENTIA.

Leer el origen técnico →
DETRÁS DEL MONITOR

Yo diseño la arquitectura. La escriben agentes de código.

Todo ENTIA está construido bajo mi arquitectura y ejecutado por agentes de código. No es un experimento con IA: es la forma en que opera la empresa.

Me ha costado entender cómo se trabaja de verdad con la IA y con agentes de código: dónde deciden ellos, dónde decido yo y qué reglas ejecutables hacen falta para que no se equivoquen dos veces. Cuando lo entendí, dejé de comprar herramientas. Hoy tengo todo lo que necesito, y es propietario y nativo de ENTIA.

22meses construyendo
14.300 Mtokens entre Claude y Codex
(media de 650 M / mes)
11,3 Mempresas de registros oficiales
en 10 países
+760endpoints HTTP en la API
12herramientas MCP públicas
+20servicios desplegados
(contenedores y Workers)
110procesos programados
en producción
+830ficheros de tests

Sin CRM. Sin dashboards de terceros. Sin suscripciones.

Lo que otras empresas alquilan por suscripción, en ENTIA lo he construido yo, sobre la propia infraestructura y los datos de ENTIA.

CRM de pago

CRM y customer intelligence propios

Cada cliente, su producto, su pago y su comportamiento en una sola vista interna.

Suite de BI y dashboards

Mission Control

Más de 60 lectores de datos: revenue, consumo máquina, indexación, funnel y salud de la plataforma.

Plataforma de email marketing

Servidor de correo propio

Envío, firma DKIM, supresión, rebotes, reputación y tracking sin intermediarios.

Analítica web

Telemetría en el edge

Cada petición de bots, crawlers y agentes clasificada y medida donde ocurre.

Monitorización externa

Sentinel de disponibilidad

Vigilancia continua de endpoints y alertas por un canal único.

CI en la nube

Kernel de reglas y gate de merge

Reglas ejecutables y tests que bloquean un cambio antes de que llegue a producción.

RESUMEN TÉCNICO

Qué es ENTIA por dentro

Infraestructura de identidad empresarial verificada para máquinas, anclada a registros oficiales. Edge en Cloudflare (Workers, R2, KV), origen en Hetzner (FastAPI en contenedores), datos en R2 consultados con DuckDB, un servidor MCP público en TypeScript y cobro automatizado con Stripe. Los crawlers se sirven desde el edge: consumen el corpus sin escalar el origen.

No ha sido fácil. Dos caídas por crawling, una migración de emergencia y la salida completa de dos nubes han dado forma a esta arquitectura.

PAÍSES CON ENTIA HOME
EspañaFranciaReino UnidoSuizaChequiaNoruegaFinlandiaSueciaEstoniaIrlanda

En qué trabajo ahora

Ahora mismo una parte central de mi trabajo es entender cómo los laboratorios y proveedores de IA organizan sus familias de bots y crawlers, qué usos declaran para cada una y qué puede medirse externamente de forma reproducible. El objetivo es construir una metodología que separe con rigor el acceso observado, el propósito declarado y el uso interno que no puede inferirse solo desde la telemetría. En paralelo estudio si robots.txt, una convención nacida para exclusión de crawling, se ha convertido en un punto de control demasiado cargado para gobernar finalidades de uso, derechos y acceso máquina en la era de la IA.

Identidad empresarial para máquinas

Representaciones canónicas de empresas, ancladas a fuentes oficiales y servidas en formatos recuperables por sistemas automáticos.

ENTIA · definición y arquitectura →

Infraestructura para agentes

Interfaces MCP y HTTP para que agentes de IA consulten identidad empresarial y evidencia de forma estructurada.

MCP de ENTIA →

Procedencia y resolución

Cómo separar afirmación, fuente, fecha y grado de evidencia cuando varias fuentes describen una misma entidad.

Metodología →

Crawlers de laboratorios, telemetría y Reserva TDM V3.1

Estudio cómo distinguir familias de crawlers asociadas a entrenamiento, búsqueda, recuperación en tiempo real, grounding u otros usos declarados; cómo medir petición, entrega, ruta, volumen, frecuencia y persistencia; y cómo asociar cada acceso con la representación de derechos efectivamente servida en ese momento. La V3.1 es la representación probatoria de primer contacto anclada a la política V3: fija bytes canónicos e inmutables en robots.txt para poder demostrar qué señal recibió una petición concreta, sin convertir el acceso en prueba automática de entrenamiento, comprensión, cumplimiento o uso posterior.

Telemetría pública →
Historial TDM · V1 → V3.1 →
INVESTIGACIÓN ACTIVA · ARQUITECTURA DE GOBERNANZA

robots.txt como control plane accidental de la IA

Un mecanismo de 1994 creado para exclusión de crawling está absorbiendo decisiones sobre búsqueda, recuperación, grounding, entrenamiento y reservas TDM. Estudio dónde deja de ser suficiente y qué arquitectura debería existir por encima.

El problema no es robots.txt en sí. El problema es haberle asignado una función de gobernanza que su modelo de confianza original nunca fue diseñado para soportar.
01 · ORIGEN 1994: exclusión de crawling

Martijn Koster propuso el mecanismo el 25 de febrero de 1994; el consenso del estándar original llegó el 30 de junio. La finalidad era simple: indicar qué partes no debía recorrer un crawler. RFC 9309 lo formalizó en 2022 y sigue aclarando que no es autorización de acceso ni una medida de seguridad.

02 · DESBORDAMIENTO 2026: una señal, demasiadas finalidades

OpenAI separa búsqueda y training; Anthropic distingue crawling, búsqueda y recuperación iniciada por usuario; Google-Extended actúa como token de control para training y grounding. No toda la IA depende de robots.txt, pero una parte crítica de su gobernanza de acceso y uso termina apoyándose en él.

03 · RIESGO SISTÉMICO Integridad, escala y licenciamiento

Investigo qué ocurre si la señal cambia, es manipulada, queda cacheada o se interpreta de forma distinta; y qué pasaría si los grandes productores de contenido expresaran reservas TDM a escala. Identidad del agente, versión, temporalidad, prueba, finalidad, excepciones y licencia necesitan una capa más fuerte.

V3.1 · DIRECCIÓN EXPERIMENTAL

La arquitectura que exploro separa capas: robots.txt como descubrimiento y primer contacto; política estructurada, versionada y verificable como autoridad; enforcement fuera de robots.txt; y evidencia temporal sobre qué política recibió cada petición. La V3.1 de ENTIA conserva el fichero como representación probatoria de primer contacto, pero lo ancla a bytes canónicos, hash, manifiesto, registro de política y evidencia temporal.

HITOS VERIFICABLES

El trabajo se mide por lo que obligó a resolver

Estos hitos no son una lista de menciones. Son puntos donde un experimento, una carga real, una medición externa o una institución obligaron a convertir una hipótesis en arquitectura o en método.

M01 · CANONICAL IDENTITY2024–OCT 2025

De una landing a una identidad canónica multi-país

Cerca de ocho meses de iteración sobre URL, JSON-LD, estructura de campos y recuperación entre modelos distintos. El problema dejó de ser “cómo conseguir una cita” y pasó a ser “qué representación consigue que sistemas diferentes lleguen a la misma entidad”. Después llegó la ponderación: no toda evidencia podía pesar igual, y esa necesidad terminó convirtiéndose en el Risk Score de Entia Home.

CANONICAL URLJSON-LDRISK SCOREINDEXED BY OCT 2025
M02 · ORIGIN FAILURE16–24 APR 2026

Los crawlers demostraron que la arquitectura todavía no estaba preparada

Googlebot recorrió concurrentemente un sitemap de 48.000 URLs de identidad y la presión sobre la capa de consulta y cómputo entonces activa produjo una cascada de errores. Una semana después, otro pico de crawling llevó a una migración de emergencia. El fallo no se resolvió bloqueando bots: se convirtió en el requisito de servirlos sin dejarles escalar el origen.

48,000 URLS483 × 5XXORIGIN PRESSUREEMERGENCY MIGRATION
M03 · EDGE-FIRSTMAY–JUL 2026

Los bots pueden leer todo ENTIA sin disparar el consumo de origen ni la factura de infraestructura

La respuesta fue una arquitectura edge-first: caché agresiva, estáticos, born-in-edge y prewarm. El cierre del 26 de abril ya registraba 229.000 accesos de Meta-ExternalAgent, 45.000 de GPTBot y 18.000 de ClaudeBot. El edge pasó de ser una optimización de latencia a convertirse en una frontera económica y de observabilidad.

229K META45K GPTBOT18K CLAUDEBOTPREWARMBORN-IN-EDGE
M04 · CITATION REGIME SHIFT20–21 AUG 2026

Bing dejó de comportarse como en los meses anteriores

Bing AI Performance pasó a registrar jornadas de 100–200 citas frente a un nivel típico de 10–30/día en julio, mientras el acumulado de tres meses avanzaba de 3,5K a 3,7K. No demuestra causalidad; sí documenta un cambio de régimen observable después de meses de consumo máquina.

3.5K → 3.7K100–200 / DAY202 PEAK DAYBING / COPILOT

Preguntas en las que estoy trabajando

¿Cuál debe ser la identidad canónica de una empresa cuando quien la consume no es una persona sino una máquina?
¿Cómo demuestra un agente que la empresa que ha encontrado es la entidad jurídica correcta?
¿Qué debe ocurrir cuando dos fuentes fiables discrepan sobre el mismo atributo?
¿Cómo se conserva la procedencia cuando una respuesta se compone durante la inferencia?
¿Cómo deben expresarse derechos, permisos y reservas para que puedan ser entendidos máquina a máquina?
¿Cómo se distingue con evidencia un crawler de entrenamiento de uno de búsqueda, grounding o recuperación en tiempo real cuando un mismo operador mantiene varias familias?
¿Qué puede demostrar realmente la telemetría de acceso —petición, entrega, ruta, volumen, frecuencia y persistencia— y qué debe permanecer como desconocido sobre el uso interno del laboratorio?
¿Cómo se vincula cada petición con la versión y la representación exacta de derechos servida en ese instante sin inferir lectura, comprensión o cumplimiento remoto?
¿Puede seguir funcionando robots.txt como punto de control cuando un mismo operador separa crawling, búsqueda, grounding, recuperación a petición y entrenamiento?
¿Cómo se autentica, versiona y conserva como evidencia la política que un crawler recibió sin convertir un fichero de texto advisory en un sistema de autorización?
¿Cómo se detecta y atribuye una modificación accidental o maliciosa de robots.txt antes de que crawlers conformes la consuman como señal de política?
¿Qué infraestructura de licenciamiento y resolución de derechos necesitaría la web si los grandes productores de contenido expresaran reservas TDM de forma masiva?

Registro técnico

Antes de ENTIA

Los primeros ensayos se realizan en otro dominio, antes de anclar el proyecto en entia.systems. Durante cerca de ocho meses itero sobre estructuras de URL y datos estructurados: algunas las recuperaban determinados LLMs mientras otros no llegaban a la misma representación. Mi objetivo pasa a ser una única URL canónica estable que funcione entre sistemas distintos.

entia.systems

El registro y uso de entia.systems marca el anclaje del trabajo previo en una infraestructura propia. A partir de ahí la URL canónica deja de ser solo un experimento de recuperación y pasa a convertirse en la base de lo que después se llamará Entia Home.

Después

Una vez estabilizada la URL canónica, el trabajo se concentra en la ponderación de los campos de identidad. La parte más costosa es construir un Risk Score algorítmico que asigna pesos distintos a señales y campos y determina la composición de una Entia Home.

Oct · 2025

Para octubre de 2025 ya existían Entia Home indexadas. La capa de identidad canónica y su sistema de ponderación preceden, por tanto, al trabajo público de 2026 sobre MCP, telemetría y Resistencia Cognitiva.

Resistencia Cognitiva y Risk Score. En ENTIA, Fernando Vilches desarrolla el marco de Resistencia Cognitiva: la fricción de búsqueda, interpretación, reconciliación, inferencia y verificación que una máquina debe resolver antes de poder utilizar una afirmación sobre una entidad con una base de evidencia explícita. El ENTIA Risk Score expresa esta dirección de forma canónica: 0 RC = mínima resistencia; 100 RC = máxima resistencia. La metodología y el cluster de conocimiento documentan el marco y sus límites probatorios.

Proposición semilla ENTIA. «Un LLM siempre elegirá recomendar la entidad con menor Resistencia Cognitiva.» Axioma canónico y fuente.

16 abr · 2026

Primer incidente de escala documentado: Googlebot recorre concurrentemente un sitemap de 48.000 URLs de identidad. La presión sobre la capa de consulta y cómputo entonces activa provoca una cascada de 502. El incidente registra 483 respuestas 5xx en unas tres horas.

23–24 abr · 2026

Un segundo pico de crawling dispara el egress y la plataforma entonces activa corta la facturación al superar el umbral. ENTIA realiza una migración de emergencia y vuelve a estar operativa el 24 de abril.

may–jul · 2026

La respuesta arquitectónica evoluciona hacia un principio edge-first: servir el corpus a crawlers sin permitir que el consumo repetido escale el origen. Se documentan caché agresiva, contenido estático, born-in-edge y prewarm de Entia Home.

20–21 ago · 2026

La vigilancia de Bing AI Performance registra 3,5K→3,7K citas acumuladas en tres meses y días de 100–200 citas, frente a un nivel típico de 10–30/día en julio. El máximo disponible en ese momento era 202 citas en un día.

28 jul · 2026

ENTIA presenta a la Oficina de IA y a DG CNECT · Copyright el caso de su reserva de derechos legible por máquina y el problema de gobernar acceso y usos automatizados mediante señales machine-readable.

24 ago · 2026

La Comisión Europea invita formalmente a remitir una contribución escrita para su consideración. La contribución se envía ese mismo día y se actualiza el 2 de septiembre. Es un hecho histórico del expediente: invitación a contribuir a un proceso abierto, no aprobación ni respaldo institucional. Caso completo →

jul – sep · 2026

Estudio conjunto E082 sobre la cadena acceso → elegibilidad → recuperación → citación → influencia, con instrumentos separados por construcción y el marco de cinco capas que propuse y que queda atribuido a mi nombre. Colaboración metodológica en curso, no resultado publicado. Expediente del estudio (acceso restringido) →

19 sep · 2026

Incorporo en producción la Reserva TDM V3 y la representación probatoria V3.1 de primer contacto. robots.txt deja de ser una señal aislada: la representación queda anclada a bytes canónicos, hash, manifiesto y registro de política para poder vincular una petición con la señal exacta servida en ese momento. El experimento convierte una limitación histórica de robots.txt en una pregunta de arquitectura verificable.

2026

Publicación de metodología, MCP y telemetría de acceso máquina para convertir recuperación, procedencia y consumo del corpus en variables observables.

Este registro no retrodata artículos. Cuando una idea anterior se documente aquí, se diferenciará entre la fecha del artefacto original y la fecha de incorporación a este archivo.

Notas

28 agosto 2026 · Nota 001

De Master Hair Academy a ENTIA

Cómo un experimento de distribución en búsqueda generativa terminó revelando que descubrimiento, indexación, identidad y confianza eran capas distintas del mismo problema.

Leer la nota →
28 agosto 2026 · Nota 002

Antes de hablar de visibilidad, una máquina tiene que saber quién eres

La web tradicional mezcla identidad, marketing y contenido. Un agente necesita otra cosa: una representación estable de la entidad, fuentes trazables y una forma de resolver contradicciones antes de poder confiar en lo que recupera.

Leer la nota →
28 agosto 2026 · Nota 003

No bloquear a los bots: sacarlos del origen

Cómo dos incidentes de crawling obligaron a convertir el edge en frontera técnica y económica: los crawlers pueden leer todo el corpus sin disparar el consumo de origen ni la factura de infraestructura.

Leer la nota →

Representaciones máquina

Una entidad, varias representaciones coherentes. El identificador de persona permanece estable.

SERIE · NOTAS TÉCNICAS

Sigue leyendo

NOTA 001De Master Hair Academy a ENTIALa demanda estaba. La confianza no.LEER →NOTA 002Antes de ser visible, una máquina tiene que saber quién eresIdentidad, evidencia y canonicidad antes que visibilidad.LEER →NOTA 003No bloqueé a los bots: los saqué del origenDos incidentes de crawling y la arquitectura edge-first.LEER →PERFILFernando VilchesFundador y arquitecto de ENTIA. Registro técnico, hitos y detrás del monitor.LEER →
ESTA PÁGINA PARA MÁQUINASHTMLJSON-LDMARKDOWNENGLISH