Resumen
Los editores de contenido web pueden observar cada vez más las solicitudes automatizadas de rastreadores, agentes, sistemas de búsqueda y servicios relacionados con modelos. Sin embargo, la telemetría del lado del servidor no revela por sí sola si un recurso fue admitido en un sistema, recuperado para una tarea concreta, citado en una respuesta o influyó materialmente en el resultado generado. Este paper introduce un marco de cinco capas que separa: (1) Acceso, la solicitud o entrega observable de un recurso web; (2) Elegibilidad, el estado técnico o de política del recurso como candidato para su procesamiento o selección; (3) Recuperación, la selección del recurso o de una representación derivada para una tarea o evento de generación concreto; (4) Citación, la presentación explícita del recurso como fuente; y (5) Influencia, una contribución causal o contrafactual de la fuente al contenido, la estructura o la decisión expresados en un resultado. Para cada capa, el marco define la unidad de análisis, la evidencia admisible, las métricas candidatas, los límites inferenciales y el lenguaje de afirmación recomendado. También distingue las señales observables por el editor de la evidencia interna del operador y de la evidencia experimental controlada. El marco está diseñado para la investigación sobre modelos de lenguaje de gran escala, generación aumentada por recuperación, motores de respuesta, agentes autónomos, rastreadores web y otros sistemas de información mediados por máquinas. ENTIA se presenta como un contexto de implementación: un corpus estructurado de identidad empresarial con telemetría de borde, recursos versionados y agregación reproducible. La regla metodológica central es conservadora: no debe afirmarse ninguna transición entre capas por el mero hecho de haberse observado una capa anterior.
Palabras clave: modelos de lenguaje de gran escala; agentes web; acceso máquina; generación aumentada por recuperación; atribución de fuentes; citación; procedencia; telemetría; límites evidenciales; medición web
Resumen ejecutivo
El marco aborda un error de medición recurrente: tratar una solicitud máquina a un servidor web como prueba de que el contenido solicitado fue usado por un modelo o agente.
Las cinco capas no son intercambiables. Un recurso puede ser accedido pero nunca seleccionado; seleccionado pero no citado; citado pero no usado con fidelidad; o influyente sin ser visiblemente citado.
La telemetría del lado del editor es más sólida en la capa de Acceso. Las afirmaciones sobre Recuperación e Influencia generalmente requieren logs del operador, intervenciones controladas, URLs instrumentadas, variantes de contenido o pruebas contrafactuales.
El marco separa por tanto la observación directa, la inferencia corroborada, la evidencia experimental y la atribución no respaldada.
ENTIA puede usar este marco para publicar investigación de acceso máquina sin sobredimensionar lo que prueba su telemetría, preservando a la vez una base rigurosa para experimentos posteriores y discusiones de licenciamiento.
1. Introducción
La web es consumida cada vez más por sistemas que hacen algo más que indexar páginas para la búsqueda convencional. Los clientes automatizados pueden descubrir recursos, refrescar corpus, construir índices de búsqueda, dar soporte a la generación aumentada por recuperación, ejecutar investigación dirigida por el usuario, evaluar modelos o realizar otras tareas internas. Desde la perspectiva del editor, muchas de estas actividades producen trazas similares en el lado del servidor: solicitudes HTTP, códigos de respuesta, bytes transferidos, resultados de caché, patrones de tiempo e identidades de cliente declaradas o inferidas.
El problema analítico es que trazas similares pueden surgir de comportamientos de sistema materialmente distintos. Una solicitud puede representar el descubrimiento inicial, un rerastreo periódico, una adquisición masiva, una inspección de metadatos, una recuperación en tiempo de respuesta, una validación de enlaces, un análisis de seguridad o una acción de agente disparada por el usuario. Incluso cuando un recurso es citado después, la citación puede ser irrelevante, no respaldada, a posteriori o solo débilmente relacionada con la afirmación generada. A la inversa, una fuente puede afectar a una respuesta sin aparecer en las citaciones visibles.
La investigación sobre generación aumentada por recuperación distingue explícitamente el conocimiento paramétrico del modelo de la memoria no paramétrica recuperada, mientras que trabajos posteriores muestran que la recuperación puede ser selectiva y que las citaciones generadas pueden no reflejar el uso real del contexto. Estos hallazgos motivan un modelo de medición que separa la observación en el servidor web de la atribución a nivel de respuesta, en lugar de colapsarlas en un único concepto de «uso».
Este paper propone dicho modelo. Está pensado como un vocabulario común para editores, operadores de modelos, investigadores, auditores, equipos jurídicos y de política, y proveedores comerciales de datos. Su propósito no es inferir arquitectura propietaria a partir de logs externos. Su propósito es identificar qué puede y qué no puede establecer cada clase de evidencia.
1.1 Pregunta de investigación
Pregunta de investigación principal ¿Cómo deberían los investigadores distinguir y medir el acceso máquina a una fuente web, su elegibilidad para el uso del sistema, la recuperación específica de una tarea, la citación visible y la influencia sustantiva en una respuesta generada? |
|---|
1.2 Contribuciones
Un vocabulario de cinco capas que separa Acceso, Elegibilidad, Recuperación, Citación e Influencia.
Definiciones operacionales y unidades de análisis para cada capa.
Una jerarquía de evidencia que distingue la telemetría del editor, la evidencia del operador y los experimentos controlados.
Una matriz de inferencias permitidas y no permitidas entre capas.
Métricas candidatas y requisitos mínimos de reporte para estudios reproducibles.
Un protocolo conservador de lenguaje de afirmación diseñado para reducir el sobredimensionamiento evidencial.
2. Alcance y Límites Conceptuales
El marco se aplica a sistemas que interactúan con recursos accesibles por web, incluyendo rastreadores, servicios de indexación, motores de respuesta, sistemas de recuperación, servicios de evaluación de modelos, agentes basados en navegador, agentes de investigación autónomos y sistemas híbridos. Es agnóstico respecto a si el modelo subyacente es propietario o abierto, si la recuperación es dispersa o densa, y si el recurso relevante es HTML, JSON, JSON-LD, una respuesta de API, un documento u otra representación legible por máquina.
El marco no asume que todo sistema implemente las cinco capas como componentes técnicos discretos. Las capas son categorías analíticas. Una única operación de sistema puede abarcar varias capas, y algunas arquitecturas internas pueden fusionarlas o saltárselas. Su valor reside en evitar la equivalencia no respaldada entre eventos observables y afirmaciones sobre el uso posterior.
2.1 Distinciones clave
| Distinción | Significado |
|---|---|
| Observación vs inferencia | Una observación se registra directamente mediante un instrumento. Una inferencia es una conclusión extraída de una o más observaciones bajo supuestos declarados. |
| Recurso vs representación | Un recurso web recuperado puede transformarse en texto, fragmentos, embeddings, resúmenes, índices o copias en caché. Operaciones posteriores pueden actuar sobre la representación en lugar de sobre el recurso original. |
| Evento a nivel de sistema vs a nivel de respuesta | La adquisición e indexación del corpus son procesos a nivel de sistema; la recuperación, la citación y la influencia pueden evaluarse para una consulta o respuesta específica. |
| Atribución vs procedencia | La atribución vincula una afirmación o resultado a una fuente; la procedencia registra las entidades, actividades y agentes implicados en producir o transformar un artefacto. |
| Correlación vs influencia | La asociación temporal o textual no establece que una fuente haya causado un cambio material en un resultado. |
3. El Marco de las Cinco Capas
El marco consta de cinco capas analíticas distintas. Pueden ocurrir en secuencia en algunos sistemas, pero el marco no impone un pipeline universal. En particular, el Acceso web contemporáneo no es necesario cuando un sistema recupera una representación almacenada previamente, la Citación puede ocurrir sin un uso fiel, y la Influencia puede ocurrir sin Citación visible.
| Capa | Pregunta central | Unidad primaria | Evidencia típica más fuerte |
|---|---|---|---|
| 1. Acceso | ¿Solicitó o recibió un cliente automatizado el recurso? | Evento HTTP de solicitud / entrega | Logs de servidor o borde; registros de respuesta firmados |
| 2. Elegibilidad | ¿Estaba el recurso disponible técnica y procedimentalmente como candidato? | Tupla recurso-estado-sistema | Evaluación de política del rastreador; estado de índice; configuración del sistema |
| 3. Recuperación | ¿Fue seleccionado el recurso o una representación derivada para una tarea específica? | Evento de recuperación consulta-recurso | Logs del recuperador; correlación de solicitudes; experimentos instrumentados |
| 4. Citación | ¿Se presentó el recurso explícitamente como fuente? | Relación respuesta-citación | Respuesta renderizada; metadatos de citación; lista de fuentes |
| 5. Influencia | ¿Afectó materialmente el recurso al resultado? | Relación causal fuente-resultado | Intervención contrafactual; variantes controladas; evidencia de atribución interna |
Regla de no equivalencia La evidencia en la capa n no establece, por sí sola, la capa n+1. Toda afirmación ascendente requiere evidencia independiente adecuada a la capa objetivo. |
|---|
4. Capa 1 — Acceso
El Acceso es el evento externamente observable en el que un cliente automatizado solicita, recibe o intenta recibir un recurso web desde un origen, borde, proxy, API, almacén de objetos o superficie de entrega equivalente. El Acceso es la capa más directamente medible por un editor.
4.1 Definición operacional
Definición A1 Existe un evento de Acceso cuando un sistema de medición registra una solicitud de origen máquina asociada a un identificador de recurso y a un resultado de respuesta, dentro de una ventana de observación especificada. |
|---|
4.2 Campos mínimos del evento
marca de tiempo del evento y zona horaria de observación;
identificador del recurso o clase de recurso que preserve la privacidad;
método de solicitud y protocolo;
estado de la respuesta;
bytes transferidos o clase de tamaño de respuesta;
resultado de caché, borde u origen;
User-Agent declarado y la base de cualquier clasificación de familia de bot;
identificador de solicitud o traza cuando esté disponible;
política de retención de datos y deduplicación.
4.3 Métricas candidatas
| Métrica | Definición | Valor interpretativo |
|---|---|---|
| Volumen de solicitudes | Conteo de eventos de solicitud que cualifican. | Mide la actividad observada, no el uso posterior. |
| Amplitud de recursos únicos | Recursos distintos solicitados en un periodo. | Aproxima la cobertura del corpus. |
| Recurrencia | Acceso repetido al mismo recurso o clase de recurso. | Puede indicar refresco, validación, reintentos o adquisición persistente. |
| Volumen de transferencia | Bytes entregados al cliente automatizado. | Distingue sondeos ligeros de la entrega sustantiva, sujeto a compresión y caché. |
| Ratio de éxito | Proporción de solicitudes que reciben respuestas exitosas o con contenido. | Mide el resultado de la entrega, no el procesamiento. |
| Concentración temporal | Distribución de eventos en el tiempo. | Apoya la identificación de ráfagas, calendarios o patrones disparados por el usuario. |
4.4 Qué no demuestra el Acceso
que el cuerpo de la respuesta fue analizado;
que el recurso entró en un índice, corpus, caché o contexto de modelo;
que el recurso fue usado para entrenamiento, grounding, evaluación o generación de respuestas;
que un User-Agent declarado identifica de forma concluyente al operador legal o técnico;
que el acceso repetido tenga un único propósito;
que el contenido influyó en ninguna respuesta específica.
5. Capa 2 — Elegibilidad
La Elegibilidad describe si un recurso está disponible técnica, procedimental o política mente para ser considerado por un sistema en una operación especificada. Es un concepto de estado candidato, no una prueba de selección.
5.1 Definición operacional
Definición E1 Un recurso es elegible respecto a un sistema y una operación cuando satisface las condiciones documentadas o establecidas experimentalmente que se requieren para entrar en el conjunto candidato de esa operación. |
|---|
Las condiciones de elegibilidad pueden incluir accesibilidad, análisis exitoso, formato soportado, inclusión en índice, actualidad, idioma, disponibilidad geográfica, estado de autenticación, controles de política, directivas de robots, metadatos, umbrales de calidad, estado de licenciamiento, filtros de seguridad y reglas específicas del operador. El Protocolo de Exclusión de Robots estandariza las preferencias de acceso de cara al rastreador, pero explícitamente no constituye una autorización de acceso; por tanto, el cumplimiento de robots es una señal relacionada con la elegibilidad, no un modelo completo de permiso legal o técnico.
5.2 Clases de evidencia
| Clase de evidencia | Ejemplos | Fortaleza |
|---|---|---|
| Evidencia directa del operador | Estado de índice, logs de decisión del rastreador, configuración de política, resultado de ingesta. | Fuerte para el sistema y momento especificados. |
| Evidencia técnica del lado del editor | Entrega exitosa, contenido analizable, metadatos legibles por máquina, URL canónica estable. | Muestra disponibilidad, no inclusión real como candidato. |
| Evidencia de prueba controlada | El sistema devuelve o muestra consistentemente un recurso instrumentado bajo consultas predefinidas. | Apoya la elegibilidad empírica específica del sistema. |
| Documentación pública | Reglas publicadas de elegibilidad de rastreador o búsqueda. | Útil pero puede no revelar todas las condiciones internas. |
5.3 Qué no demuestra la Elegibilidad
que el recurso fue seleccionado para una tarea específica;
que el sistema ha almacenado una copia completa;
que el recurso supera a fuentes competidoras;
que un modelo lo citará o se apoyará en él;
que la elegibilidad permanece invariable entre productos, geografías, usuarios o tiempo.
6. Capa 3 — Recuperación
La Recuperación es un evento de selección específico de una tarea. Ocurre cuando un sistema selecciona el recurso, un pasaje del mismo o una representación derivada para usarlo en una consulta, generación, evaluación o paso de agente concretos. La Recuperación puede ser contemporánea a una solicitud web o puede operar enteramente sobre un índice o caché almacenados previamente.
6.1 Definición operacional
Definición R1 Existe un evento de Recuperación cuando un recurso o una representación derivada se selecciona dentro del conjunto de trabajo de una tarea, consulta, generación o acción de agente especificada. |
|---|
6.2 Evidencia directa e indirecta
| Evidencia | Ejemplo | Interpretación |
|---|---|---|
| Traza del recuperador | Identificadores y puntuaciones de documento o fragmento registrados para una consulta. | Evidencia directa de selección a nivel de sistema. |
| Traza de contexto | El texto de la fuente aparece en la entrada del modelo o en el resultado de una herramienta. | Evidencia directa de que el contenido recuperado llegó a la etapa de generación. |
| Solicitud instrumentada correlacionada | Un token de recurso único se solicita inmediatamente después de una consulta controlada. | Evidencia sólida de recuperación en tiempo de respuesta cuando se controlan causas alternativas. |
| Solo coocurrencia temporal | Una solicitud de rastreador ocurre cerca de una consulta de usuario. | Evidencia débil salvo que exista correlación única. |
| Solo citación visible | La respuesta enumera una fuente. | Evidencia de Citación, no necesariamente de fidelidad de la Recuperación. |
6.3 Métricas candidatas
tasa de recuperación: proporción de consultas controladas para las que un recurso entra en el conjunto recuperado;
distribución de rango o puntuación dentro del conjunto recuperado;
cobertura de pasaje: proporción del recurso seleccionada o expuesta al generador;
latencia de recuperación relativa al inicio de la consulta;
desfase de actualidad entre la publicación o cambio del recurso y la recuperación observada;
estabilidad entre ejecuciones bajo consultas controladas repetidas;
varianza de sistema e interfaz entre productos, regiones, cuentas o modos.
6.4 La Recuperación no equivale al uso
Un recurso recuperado puede ser ignorado, infraponderado, contradicho, truncado o desplazado por otro contexto. Por tanto, la recuperación establece la selección en un conjunto de trabajo, no la influencia sustantiva en el resultado final.
7. Capa 4 — Citación
La Citación es la presentación explícita de un recurso como fuente de una respuesta, afirmación, sección o artefacto generado. Es observable en la interfaz de resultado, en metadatos estructurados o en la representación exportada de la respuesta.
7.1 Definición operacional
Definición C1 Existe una relación de Citación cuando un resultado generado identifica explícitamente un recurso, documento, dominio u objeto fuente como apoyo, información o relación con el resultado. |
|---|
7.2 Dimensiones de calidad de la citación
| Dimensión | Pregunta |
|---|---|
| Validez | ¿Resuelve el identificador citado a una fuente accesible? |
| Especificidad | ¿Está la citación vinculada a una afirmación concreta o solo a la respuesta en general? |
| Relevancia | ¿Aborda la fuente citada la afirmación citada? |
| Implicación (entailment) | ¿Respalda la fuente la proposición expresada? |
| Completitud | ¿Están las afirmaciones materiales respaldadas por citaciones donde se espera respaldo? |
| Actualidad | ¿Estaba la versión citada disponible y vigente en el momento relevante? |
| Integridad de identidad | ¿Resuelve la citación a la entidad, documento y versión pretendidos? |
La investigación reciente sobre atribución demuestra por qué las citaciones visibles deben evaluarse en lugar de asumirse como evidencia autoautenticada. Los sistemas pueden producir enlaces que resuelven y parecen relevantes mientras fallan pruebas de respaldo factual, y la autocitación puede divergir del uso real del contexto.
7.3 Qué no demuestra la Citación
que el recurso citado fue recuperado antes de la generación en lugar de adjuntado después;
que la citación respalda todas las afirmaciones asociadas;
que la fuente fue la base principal o exclusiva de la respuesta;
que las fuentes no citadas no tuvieron influencia;
que la versión citada coincide con la versión realmente procesada.
8. Capa 5 — Influencia
La Influencia es la capa más exigente y demandante. Se refiere a si una fuente marcó una diferencia material en el resultado generado. La Influencia puede afectar al contenido factual, a la selección de entidades, al ranking, a la redacción, a la incertidumbre, a la recomendación, a la estructura de razonamiento o a una acción posterior de un agente.
8.1 Definición operacional
Definición I1 Una fuente influye en un resultado cuando cambiarla, retenerla o sustituirla —mientras se controlan las condiciones relevantes— produce un cambio material y reproducible en el resultado o decisión atribuible a la intervención. |
|---|
8.2 Métodos de evidencia
| Método | Diseño | Fortaleza / limitación |
|---|---|---|
| Variantes A/B de fuente | Publicar variantes factuales o estructurales controladas bajo condiciones equiparadas. | Sólido cuando se controlan la exposición y la contaminación. |
| Hechos canario únicos | Introducir proposiciones no sensibles y trazables de forma única. | Útil para la detección; debe evitar el engaño, el daño y la propagación no controlada. |
| Retirada o retención | Comparar resultados con y sin disponibilidad de la fuente. | Apoya la inferencia contrafactual pero puede confundirse por las cachés. |
| Sustitución de fuente | Reemplazar una fuente candidata por una alternativa equivalente. | Prueba la sensibilidad a la identidad o al contenido de la fuente. |
| Atribución del operador | Usar evidencia de atribución interna del modelo o del recuperador. | Potencialmente sólida pero dependiente de la arquitectura. |
| Solo similitud textual | Comparar la redacción de la fuente y de la respuesta. | Débil salvo que se excluyan fuentes alternativas y la memorización. |
8.3 Materialidad
No toda diferencia detectable es material. Un estudio debe predefinir la materialidad según la pregunta de investigación. Ejemplos incluyen una proposición factual cambiada, una recomendación de entidad distinta, un movimiento en el ranking, una declaración de confianza cambiada, una restricción recién introducida o un cambio semántico medible por encima de un umbral preespecificado.
8.4 Influencia sin citación
Un recurso puede influir en una respuesta sin ser citado, por ejemplo cuando su contenido se incluye en contexto oculto, es resumido por un agente intermedio, se incorpora a un índice o se usa para seleccionar otra fuente. La ausencia de citación no es por tanto evidencia de ausencia de influencia.
9. Jerarquía de Evidencia y Disciplina en las Afirmaciones
El marco recomienda clasificar cada conclusión según el tipo de evidencia disponible más fuerte. Esto hace explícita la frontera entre el hecho observado y la interpretación.
| Nivel | Estado de la evidencia | Formulación permitida |
|---|---|---|
| E0 | Sin evidencia directa; mera conjetura. | «Una posible explicación es…» |
| E1 | Observación externa única. | «ENTIA observó…» |
| E2 | Patrón externo repetido con controles documentados. | «El patrón observado es consistente con…» |
| E3 | Corroborado por una señal independiente o prueba controlada. | «La evidencia respalda la inferencia de que…» |
| E4 | Traza directa del operador o experimento causal reproducible. | «El recurso fue recuperado / influyó en el resultado bajo las condiciones probadas.» |
9.1 Atajos inferenciales prohibidos
| Observado | Atajo no respaldado | Evidencia adicional requerida |
|---|---|---|
| Alto volumen de solicitudes | «El modelo entrenó con el corpus.» | Divulgación de datos de entrenamiento, evidencia del operador o un estudio válido de pertenencia/influencia. |
| Rastreo repetido de todo el corpus | «Todo recurso entró en un índice de producción.» | Estado de ingesta/índice o evidencia de recuperación controlada. |
| Solicitud en tiempo de respuesta | «La página recuperada determinó la respuesta.» | Traza de contexto o prueba de influencia contrafactual. |
| Citación visible | «La fuente citada fue usada con fidelidad.» | Evaluación de relevancia e implicación a nivel de afirmación. |
| Solapamiento textual | «El sistema copió esta fuente.» | Análisis de fuentes alternativas, evidencia temporal y un método de atribución defendible. |
9.2 Verbos recomendados por capa
| Capa | Verbos preferidos | Evitar sin evidencia adicional |
|---|---|---|
| Acceso | solicitó, recuperó, recibió, intentó, transfirió | usó, aprendió, entrenó, fundamentó (grounded) |
| Elegibilidad | cualificó, estaba disponible, era indexable, entró en el conjunto candidato | seleccionó, se apoyó en |
| Recuperación | recuperó, seleccionó, clasificó, incluyó en el contexto | aceptó como cierto, influyó |
| Citación | citó, enlazó, atribuyó, referenció | validó, se apoyó en, derivó de |
| Influencia | cambió, afectó, contribuyó, determinó bajo condiciones probadas | causó de forma universal, prueba arquitectura interna |
10. Matriz de Observabilidad
Distintos actores poseen distinta evidencia. Un editor puede observar directamente la entrega, mientras que un operador de sistema puede observar la ingesta y la recuperación. Los investigadores independientes a menudo necesitan intervenciones controladas para cerrar la brecha.
| Señal | Acceso | Elegibilidad | Recuperación | Citación | Influencia |
|---|---|---|---|---|---|
| Log de borde/servidor | Directa | Parcial | Débil/condicional | Ninguna | Ninguna |
| Cuerpo de respuesta entregado | Directa | Parcial | Débil/condicional | Ninguna | Ninguna |
| Estado de robots o política | Contexto | Parcial/directa para la regla declarada | Ninguna | Ninguna | Ninguna |
| Log de índice/ingesta | Indirecta | Directa | Parcial | Ninguna | Ninguna |
| Traza del recuperador | Indirecta | Candidato confirmado | Directa | Ninguna | Parcial |
| Traza de contexto del generador | Indirecta | Confirmada | Directa | Ninguna | Parcial/sólida |
| Citación renderizada | Ninguna | Ninguna | Parcial como máximo | Directa | Débil |
| Intervención de fuente controlada | Observada según lo diseñado | Probada | Probada | Probada | Sólida |
| Atribución interna del modelo | Ninguna | Ninguna | Directa/parcial | Parcial | Potencialmente sólida |
11. Protocolo Mínimo de Medición
Un estudio que use el marco debe preregistrar o documentar los siguientes elementos antes de interpretar resultados.
Identidad de sistema e interfaz: producto, modo, estado de cuenta, geografía, idioma, etiqueta del modelo y fecha.
Identidad de la fuente: identificador canónico, versión del contenido, momento de publicación, hash, formato y estado de acceso.
Ventana de observación: hora de inicio y fin, zona horaria, sincronización del reloj, huecos conocidos y política de retención.
Conjunto de consultas: prompts exactos, orden, calendario de repetición, aleatorización y regla de parada.
Variables de resultado específicas de capa: definidas por separado para Acceso, Elegibilidad, Recuperación, Citación e Influencia.
Método de clasificación de bot: User-Agent declarado, IP/ASN verificado cuando sea lícito y apropiado, clasificación conductual y confianza.
Controles: fuentes de línea base, controles negativos, explicaciones alternativas, efectos de caché y riesgos de contaminación.
Umbral de materialidad: predefinir qué constituye un cambio significativo en la respuesta.
Tratamiento de datos faltantes: huecos, reintentos, deduplicación, respuestas parciales y eventos ambiguos.
Paquete de reproducibilidad: datos agregados, scripts, esquemas, manifiestos y notas metodológicas.
11.1 Reporte específico por capa
| Capa | Denominador mínimo reportado | Numerador mínimo reportado |
|---|---|---|
| Acceso | Tiempo de observación elegible o universo de recursos. | Solicitudes que cualifican, recursos, bytes o entregas exitosas. |
| Elegibilidad | Recursos probados frente a condiciones especificadas. | Recursos que cumplen esas condiciones. |
| Recuperación | Consultas o ejecuciones de tarea controladas. | Consultas en las que el recurso entró en el conjunto recuperado o de contexto. |
| Citación | Respuestas o afirmaciones evaluadas. | Respuestas o afirmaciones con citaciones válidas, relevantes y de respaldo. |
| Influencia | Comparaciones controladas pareadas o repetidas. | Comparaciones que producen cambios materiales atribuibles a la intervención de fuente. |
12. ENTIA como Contexto de Implementación
ENTIA opera un corpus estructurado de recursos de identidad empresarial diseñado para el consumo máquina. Su entorno de medición puede dar soporte directo a la capa de Acceso y puede dar soporte a estudios controlados de las capas superiores a través de recursos instrumentados, versionado, controles sintéticos y evaluación en el lado de la respuesta.
12.1 Arquitectura de telemetría
Un pipeline de investigación representativo puede expresarse como: observación de solicitud en el borde → almacenamiento de objetos inmutable u orientado a anexado → procesamiento analítico local → conjunto de datos de investigación agregado → manifiesto firmado y publicación versionada. En el contexto actual de ENTIA, esto corresponde conceptualmente a la telemetría de borde de Cloudflare, el almacenamiento de objetos R2, el análisis basado en DuckDB y resultados de investigación que contienen únicamente datos agregados o adecuadamente anonimizados.
12.2 Esquema de eventos ENTIA — vista mínima de investigación
| Grupo de campos | Campos ilustrativos |
|---|---|
| Tiempo | event_time, date_bucket, observation_timezone |
| Recurso | resource_class, country, entity_type, version_hash |
| Cliente | declared_user_agent, bot_family, classification_basis, confidence |
| Solicitud | method, protocol, response_status, bytes, cache_status |
| Integridad | batch_id, source_manifest, transformation_version |
| Privacidad | aggregation_level, suppression_rule, disclosure_review_status |
12.3 Frontera público/privado
| Apto para resultado de investigación público | Retener en entorno de evidencia restringido |
|---|---|
| Conteos agregados por periodo de tiempo y familia de bot. | Direcciones IP crudas o identificadores a nivel de solicitud. |
| Distribuciones de código de respuesta, caché, transferencia y recurrencia. | Datos de contacto del operador y correspondencia privada. |
| Esquemas anonimizados y consultas de agregación reproducibles. | Estrategia de enforcement y análisis legal confidencial. |
| Ejemplos sintéticos y recursos experimentales controlados. | Umbrales de detección que permitirían la evasión. |
| Hashes, manifiestos, fechas de versión y limitaciones metodológicas. | Términos comerciales, registros de negociación y material contractual no público. |
12.4 Plantilla de afirmación ENTIA
Ejemplo Observado: clientes automatizados clasificados en las familias especificadas solicitaron X recursos durante el periodo T. Interpretación: la amplitud y recurrencia son consistentes con una adquisición máquina sistemática. Límite: la telemetría no establece de forma independiente el entrenamiento, la recuperación específica de una tarea, la citación ni la influencia en ninguna respuesta generada. |
|---|
13. Adquisición Persistente y Recuperación Episódica
El marco apoya una distinción adicional que se desarrollará en un paper separado. La adquisición persistente de corpus describe la recolección o el refresco repetidos a nivel de sistema a lo largo del tiempo. La recuperación episódica en tiempo de respuesta describe la selección de fuente asociada a una consulta, generación o paso de agente concretos de un usuario. Ambas pueden generar solicitudes web, pero difieren en estructura temporal, amplitud de recursos, acoplamiento a la consulta y significado evidencial.
| Característica | Adquisición persistente de corpus | Recuperación episódica en tiempo de respuesta |
|---|---|---|
| Disparador | Proceso programado, continuo o de mantenimiento de corpus. | Consulta, tarea o acción de agente específica. |
| Amplitud | Cobertura amplia de muchos recursos. | Subconjunto más estrecho, relevante a la tarea. |
| Momento | Independiente de la interacción visible del usuario. | Estrechamente acoplado a la ejecución de la tarea. |
| Recurrencia | Refresco regular o recorrido repetido. | Variable y dependiente de la consulta. |
| Evidencia del editor | A menudo detectable a partir de patrones de acceso longitudinales. | Requiere correlación, instrumentación o marcadores únicos de solicitud. |
| Qué demuestra | Comportamiento de adquisición sistemática observado. | Selección de fuente potencialmente específica de la tarea, sujeta a controles. |
14. Amenazas a la Validez
Incertidumbre de identidad del cliente. Las cadenas de User-Agent pueden falsificarse, compartirse, cambiarse o encaminarse a través de intermediarios. La clasificación debe declarar su base evidencial y su confianza.
Caché y uso diferido. Un sistema puede acceder a una fuente una vez y recuperar una representación almacenada mucho más tarde, debilitando la correlación temporal entre solicitudes web y respuestas.
Múltiples superficies de producto. El mismo operador puede ejecutar rastreadores, índices, modelos y agentes dirigidos por el usuario distintos, con políticas y propósitos diferentes.
Transformaciones ocultas. El fragmentado (chunking), el resumen, los embeddings, la deduplicación y la resolución de entidades pueden romper la correspondencia simple uno a uno entre una URL fuente y el contexto posterior.
Contaminación por fuente alternativa. Un hecho puede estar disponible en muchas fuentes o ya estar codificado paramétricamente. El acuerdo textual por sí solo no puede aislar la influencia.
No determinismo. Ejecuciones repetidas del modelo pueden producir resultados distintos sin una intervención de fuente. Los estudios de influencia requieren repeticiones suficientes y umbrales preespecificados.
Mediación de interfaz. Un producto puede alterar, filtrar o añadir citaciones después de la generación. Las observaciones a nivel de resultado no deben asumirse como exposición del orden interno de recuperación.
Efectos de publicación. Los hechos canario públicos o las variantes experimentales pueden propagarse a fuentes de terceros, comprometiendo la atribución futura.
15. Ética, Privacidad y Divulgación Responsable
La investigación de acceso máquina debe minimizar la divulgación de datos personales, infraestructura sensible a la seguridad e información que facilite la evasión o el abuso. Los conjuntos de datos públicos deben usar agregación, supresión, hashing o sustitución sintética apropiada al riesgo. Los canarios de investigación no deben introducir falsedades dañinas, suplantar a personas reales, manipular decisiones de alto impacto ni contaminar sistemas de conocimiento público.
Cuando la identidad o el propósito del operador sean inciertos, las publicaciones deben distinguir la identidad declarada, la atribución de red, la clasificación conductual y la confirmación organizativa verificada. Las conclusiones legales quedan fuera del marco de medición y deben desarrollarse por separado bajo la jurisdicción y los hechos aplicables.
16. Agenda de Investigación
Desarrollar clasificadores validados para distinguir la adquisición persistente de la recuperación episódica.
Medir la brecha entre la validez de la citación, el respaldo de la afirmación y la influencia causal en distintos motores de respuesta.
Crear identificadores que preserven la privacidad y conecten consultas controladas con solicitudes del lado del editor.
Comparar formatos de recurso —HTML, JSON-LD, APIs, páginas canónicas firmadas— a través de las cinco capas.
Estudiar cómo afectan la identidad de la fuente, la procedencia, la actualidad y la autoridad a la recuperación y la influencia.
Definir benchmarks entre sistemas para la influencia en la respuesta usando hechos controlados de identidad empresarial.
Publicar conjuntos de datos longitudinales y agregados de acceso máquina con manifiestos de transformación reproducibles.
17. Conclusión
La proposición central del marco de las cinco capas es la contención metodológica. Una solicitud máquina es evidencia de Acceso. Puede contribuir a una evaluación de Elegibilidad. No establece, sin evidencia adicional, Recuperación, Citación ni Influencia. Del mismo modo, una citación es un artefacto de atribución observable, no una prueba automática de uso fiel o de dependencia causal.
Al separar estas capas, los investigadores pueden reportar hallazgos más sólidos con afirmaciones más estrechas y defendibles. Los editores ganan un vocabulario riguroso para describir la telemetría. Los operadores ganan expectativas más claras sobre la evidencia requerida para respaldar afirmaciones de uso de fuente. Los colaboradores experimentales ganan una estructura de preregistro que distingue la adquisición a nivel de sistema del comportamiento a nivel de respuesta.
Para ENTIA, el marco crea una base metodológica pública para trabajo posterior sobre adquisición persistente de corpus, recuperación en tiempo de respuesta, telemetría de acceso máquina y comparaciones controladas entre dominios empresariales originales y los recursos ENTIA Home. Su valor no reside en afirmar visibilidad sobre sistemas opacos, sino en definir con precisión la frontera entre lo que se observa, lo que está respaldado y lo que permanece desconocido.
Apéndice A — Definiciones Compactas
| Término | Definición compacta |
|---|---|
| Acceso | Solicitud, entrega o intento de entrega registrado de un recurso web por una máquina. |
| Elegibilidad | Estado en el que un recurso cumple las condiciones para ser considerado en una operación especificada. |
| Recuperación | Selección específica de tarea de un recurso o representación derivada dentro de un conjunto de trabajo o contexto. |
| Citación | Identificación explícita de un recurso como fuente de un resultado o afirmación. |
| Influencia | Cambio material y reproducible en un resultado atribuible a cambiar, retener o sustituir la fuente bajo condiciones controladas. |
| Adquisición persistente | Recolección o refresco repetidos a nivel de sistema en un corpus a lo largo del tiempo. |
| Recuperación episódica | Selección de fuente acoplada a una consulta, generación o acción de agente concretas. |
Apéndice B — Lista de Verificación Mínima de Reporte
☐ Sistema, interfaz, modo, geografía, idioma y fecha exactos registrados.
☐ Versión del recurso, marca de tiempo, identificador canónico y hash registrados.
☐ Periodo de observación y huecos de telemetría conocidos declarados.
☐ Base y confianza de la clasificación de bot declaradas.
☐ Resultados de Acceso, Elegibilidad, Recuperación, Citación e Influencia reportados por separado.
☐ Ninguna afirmación de capa superior basada únicamente en una observación de capa inferior.
☐ Explicaciones alternativas y efectos de caché considerados.
☐ Validez, relevancia y respaldo de la citación evaluados por separado.
☐ Materialidad de la influencia y diseño contrafactual preregistrados.
☐ Conjunto de datos público revisado por privacidad, seguridad, riesgo contractual y de divulgación.
☐ Scripts de transformación, versiones de esquema y manifiestos preservados.
☐ Limitaciones colocadas junto a los hallazgos principales, no solo en un apéndice.
Apéndice C — Borrador de Metadatos de Depósito en Zenodo
| Campo | Valor borrador |
|---|---|
| Título | Five-Layer Framework for Measuring LLM and Agent Interaction with Web Sources |
| Autor | Vilches, Fernando |
| Afiliación | ENTIA Systems / PrecisionAI Marketing OÜ |
| Tipo de recurso | Publicación — Working paper / Nota técnica |
| Fecha de publicación | 2026-07-29 |
| Versión | 0.1 |
| Idioma | Inglés |
| Comunidad | ENTIA Machine Access Research — propuesta |
| Palabras clave | LLM; web agents; retrieval; citation; influence; telemetry; provenance; machine access; RAG; source attribution |
| Identificadores relacionados | Pendientes de añadir para preregistro, dataset, software y versiones posteriores. |
| Licencia | Pendiente de selección por el autor antes de la publicación; CC BY 4.0 es una candidata en revisión. |
Referencias
[1] Asai, A., Wu, Z., Wang, Y., Sil, A., & Hajishirzi, H. (2024). Self-RAG: Learning to Retrieve, Generate, and Critique through Self-Reflection. International Conference on Learning Representations. arXiv:2310.11511.
[2] Koster, M., Illyes, G., & Zeller, H. (2022). Robots Exclusion Protocol. RFC 9309. Internet Engineering Task Force. DOI: 10.17487/RFC9309.
[3] Lebo, T., Sahoo, S., & McGuinness, D. (Eds.). (2013). PROV-O: The PROV Ontology. W3C Recommendation.
[4] Lewis, P., Perez, E., Piktus, A., Petroni, F., Karpukhin, V., Goyal, N., Küttler, H., Lewis, M., Yih, W., Rocktäschel, T., Riedel, S., & Kiela, D. (2020). Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks. Advances in Neural Information Processing Systems, 33.
[5] National Institute of Standards and Technology. (2023). Artificial Intelligence Risk Management Framework (AI RMF 1.0). NIST AI 100-1. DOI: 10.6028/NIST.AI.100-1.
[6] National Institute of Standards and Technology. (2024). Artificial Intelligence Risk Management Framework: Generative Artificial Intelligence Profile. NIST AI 600-1. DOI: 10.6028/NIST.AI.600-1.
[7] Onweller, H., Lumer, E., Huber, A., Ramchandani, P., Subbiah, V. K., & Feld, C. (2026). Cited but Not Verified: Parsing and Evaluating Source Attribution in LLM Deep Research Agents. arXiv:2605.06635.
[8] Qi, J., Fernández, R., Bisazza, A., & Titov, I. (2024). Model Internals-based Answer Attribution for Trustworthy Retrieval-Augmented Generation. Proceedings of EMNLP 2024.
[9] Xia, S., et al. (2025). Ground Every Sentence: Improving Retrieval-Augmented Generation with Fine-Grained Citations. Findings of NAACL 2025.
Nota del Autor
Fernando Vilches es el fundador de ENTIA. El marco conceptual, la terminología y la estructura evidencial de este working paper se proponen como parte del programa ENTIA Machine Access Research. Esta versión pretende establecer una línea base pública citable y apoyar la revisión por pares, el preregistro experimental, la publicación de datasets y la revisión posteriores.