Los programas de monitoreo ambiental de facilidades industriales fijan, mediante el instrumento o permiso aplicable, qué se mide, dónde y con qué frecuencia. Ese diseño garantiza series comparables y obligaciones exigibles, y tiene un costo conocido: entre campañas, las muestras se toman sin información sobre lo que está ocurriendo en el sitio. Este documento especifica un protocolo que usa la teledetección multiespectral (Sentinel-2) como capa de screening —previa, frecuente y de bajo costo marginal respecto de una campaña de campo adicional— para asignar las verificaciones de campo adicionales hacia las áreas y los momentos en que el sitio muestra cambio relativo, manteniendo intacto el programa del permiso.
Environmental Scouting no reemplaza el monitoreo ambiental: cambia dónde se gasta la siguiente verificación. Su desempeño se mide, por tanto, por el rendimiento de verificación (verification yield), no por la sola detección de anomalías.
El protocolo separa dos funciones que la teledetección no puede cumplir simultáneamente: la detección de anomalías espectrales, que el protocolo hace con reglas de decisión explícitas y error cuantificable una vez calibrado, y la atribución de causa, que exige verificación de campo y análisis con métodos aceptados. La etapa 1 produce una priorización de muestreo; la etapa 2 produce el resultado analítico y realimenta la etapa 1. La implementación de referencia es el tablero RAPIDS™ EIA (Environmental Intelligence Analysis; la sigla no designa aquí un Environmental Impact Assessment), instrumentación del servicio Environmental Scouting sobre Google Earth Engine, cuyas salidas se muestran como demostración instrumental en la sección 11.
El desempeño del método no se establece por su capacidad de detectar anomalías, sino por el rendimiento de verificación que produce frente a un comparador predefinido. La sección 9 define el marco de validación respondiendo, antes de cualquier piloto, siete preguntas: unidad de screening, unidad de outcome, estimando, comparador, manejo de la selección, separación entre calibración y validación, y mejora mínima que constituye superioridad operacional. La sección 12 fija los criterios de aceptación y rechazo, con la hipótesis de desempeño (H1) como criterio primario, la de calibración fuera de muestra (H2) como evidencia secundaria y la económica (H3) como indicador, no como criterio. Los parámetros que dependen del activo —umbrales de magnitud, persistencia, tratamiento de la dependencia, potencia— se declaran en la sección 9.1 y los fija cada piloto ex ante; este documento no los inventa. Las limitaciones (sección 10) son las del sensor —resolución, revisita, ceguera subsuperficial, confusores— y las del marco —régimen de monitoreo y admisibilidad de la muestra dirigida como evidencia—. La efectividad del método permanece como hipótesis verificable mediante pilotos diseñados por activo y régimen; este documento no reporta cifras de desempeño propias.
Problema. Todo permiso ambiental de una facilidad industrial contiene un programa de monitoreo, y todo programa de monitoreo fija tres cosas: qué se mide, dónde y con qué frecuencia. En Estados Unidos, la vigilancia de aguas subterráneas bajo RCRA se organiza en redes de pozos, con la frecuencia y el procedimiento estadístico que fija el permiso (U.S. EPA, 40 CFR 264 Subpart F); los vertimientos bajo NPDES se reportan por punto de descarga y período (40 CFR 122.41(l)(4)); en Colombia, el plan de manejo ambiental que acompaña una licencia fija puntos y frecuencias de muestreo de aguas y suelos que la autoridad revisa en el seguimiento (Decreto 1076 de 2015; ANLA). El diseño es funcional: sin puntos fijos no hay serie comparable, y sin frecuencia fija no hay obligación exigible. Su limitación es que las muestras se toman sin información sobre lo que ocurre entre campañas: una pérdida de contención, una infiltración desde una piscina de lodos, un rebosamiento en lluvias o una fuga en una línea pueden manifestarse en superficie antes de la siguiente campaña y en puntos donde no hay pozo — premisa operacional de este método, no un hecho medido. Aumentar la frecuencia de muestreo incrementa el costo sin modificar la lógica espacial de asignación.
Alcance. El protocolo descrito no reemplaza el programa del permiso: lo informa. Se aplica a la asignación de las verificaciones de campo adicionales —las que el operador toma por diligencia o la autoridad solicita en seguimiento— dentro de cualquier régimen que combine monitoreo fijado por permiso con verificación adicional. Está fuera de alcance: la sustitución de muestras obligatorias, la inferencia estadística sobre la condición del sitio entero a partir de la muestra dirigida, y la detección de procesos sin expresión superficial (sección 10). La muestra dirigida no es una red probabilística ni un estimador de prevalencia: es una política de asignación de verificaciones, y como tal se evalúa.
Objetivo. Especificar un método reproducible para convertir la observación multiespectral de una facilidad en una priorización de verificaciones de campo, y el marco con el que se evalúa si esa priorización mejora el muestreo respecto del programa periódico.
Proposición metodológica. La utilidad operacional de la teledetección en programas de monitoreo ambiental se evalúa por su capacidad para mejorar la asignación de verificaciones de campo respecto del muestreo periódico establecido por el programa, no por su capacidad de detectar anomalías espectrales.
Hipótesis primaria de desempeño (H1 — superioridad de rendimiento de verificación). El método hipotetiza y somete a prueba que, para un activo y una ventana de evaluación predefinidos, las ubicaciones asignadas a verificación adicional por la política de screening producen un rendimiento de hallazgos confirmados (verification yield) superior al de la política comparadora predefinida, bajo los mismos criterios de elegibilidad analítica y con el efecto mínimo prácticamente relevante y la potencia estadística especificados antes de la evaluación (sección 9).
Hipótesis secundaria de aprendizaje (H2 — mejora de calibración fuera de muestra). El método hipotetiza que, tras recalibrar con un bloque predefinido de resultados de verificación, la política de screening exhibe una tasa de falsos positivos menor en un bloque holdout posterior que en el bloque de evaluación precedente, sin que la tasa de indeterminados supere el límite de aceptación predefinido.
Indicador económico (H3 — economía de verificación). La política de screening reduce el costo incremental por hallazgo confirmado frente al comparador predefinido. H3 es un indicador de gestión (KPI), no un criterio de aceptación.
Las tres preguntas son distintas y se responden por separado: H1, ¿encuentra más? H2, ¿aprende? H3, ¿paga? H1 decide el desempeño del método; H2 informa sobre el mecanismo de calibración y puede no cumplirse aunque H1 se cumpla; H3 se reporta cuando existe contabilidad de costos por verificación. Las secciones 9 y 12 fijan cómo se miden y bajo qué condiciones se aceptan o rechazan.
Environmental Scouting no reemplaza el monitoreo ambiental: cambia dónde se gasta la siguiente verificación; su desempeño se mide por el rendimiento de verificación, no por la sola detección de anomalías.
Sensor y magnitudes. Un sensor multiespectral como el de Sentinel-2 registra reflectancia en bandas del visible, el infrarrojo cercano y el infrarrojo de onda corta (SWIR, 1,6 y 2,2 µm), con resolución de 10 a 20 metros y revisita nominal de cinco días —con dos satélites y en el ecuador; el intervalo útil efectivo entre escenas sin nubes se mide en cada sitio— (ESA, 2023). Esa reflectancia es sensible al vigor de la vegetación, al agua y las sales del suelo, al suelo expuesto y a ciertas firmas de hidrocarburos superficiales.
Índices y sus límites publicados. El fundamento espectral de la detección de hidrocarburos en el SWIR lo establecieron Kühn, Oppermann y Hörig (2004) con un índice sobre datos hiperespectrales (rasgo de absorción a 1,73 µm) que Sentinel-2 no puede computar —sus bandas SWIR están en 1,61 y 2,19 µm—; trabajos posteriores adaptaron combinaciones de bandas de Sentinel-2 a derrames de petróleo, con desempeño dependiente del escenario y de la verdad de campo disponible: derrame marino con evaluación visual (Rajendran et al., 2021), petróleo sobre agua con verdad derivada de la imagen (Zakzouk et al., 2023) y contaminación terrestre masiva en desierto con 180 muestras de suelo (Ashkanani et al., 2025). La infiltración subsuperficial sólo se manifiesta por síntomas indirectos (humedad en SWIR, estrés vegetal, salinización). Los índices de salinidad explican una fracción de la conductividad eléctrica del suelo —en un estudio agrícola específico, R² de calibración de 0,59–0,63 y de ~0,48 en validación (Zeyada et al., 2023); el valor es contexto-dependiente y no transferible a un activo industrial— y el resto es variabilidad de humedad y textura. El estrés vegetal responde a sequía, plaga, manejo agrícola y fenología además de a contaminación (Ghazaryan et al., 2020).
Detección frente a atribución. De lo anterior se sigue la distinción que gobierna el método: el sensor proporciona observaciones espectrales a partir de las cuales el protocolo caracteriza cambio relativo —un área que se comporta distinto de sí misma en el pasado y distinto de un área de referencia comparable en el presente—; ni el sensor ni el protocolo atribuyen causa. La precisión de esa caracterización depende del índice, la resolución, el control, la longitud de la serie, la nubosidad y las reglas de decisión, no del sensor en sí. La atribución corresponde al método analítico: la muestra motivada por la anomalía se analiza con los métodos que el permiso exige y la autoridad reconoce (U.S. EPA, SW-846: métodos 8015, 8260, 6010), y el resultado establece qué es, o que no es nada.
Regla de atribución. La señal satelital constituye evidencia
de anomalía y criterio de priorización. La atribución de causa requiere
verificación de campo y análisis mediante métodos aceptados.
El satélite no es la prueba; es la razón de la
prueba.
Precedente metodológico. La lógica de un screening denso y de bajo costo que dirige las muestras definitivas de laboratorio fue formalizada por la EPA para sitios contaminados como enfoque Triad —planificación sistemática, estrategias de trabajo dinámicas y medición en tiempo real— (U.S. EPA, 2005; ITRC, 2003). Triad es un precedente de lógica —el screening denso dirige la muestra definitiva—, no de desempeño: mide en campo, no con satélite, y sus cifras de ahorro provienen de casos individuales que no se trasladan a este protocolo. El protocolo aquí especificado adapta esa lógica a la escala de una facilidad en operación, utilizando el satélite como capa de screening. El límite de la analogía se declara: Triad mide en campo, en tiempo real y a metros de la fuente; el satélite, a 10 metros de píxel y días de revisita. Es un screening de menor resolución, cuyo valor depende de que la etapa 2 lo compense.
El protocolo se organiza en un pipeline de siete pasos —Observación → Anomalía → Prioridad → Verificación → Hallazgo analítico → Atribución → Calibración—: la observación produce series; la anomalía es la salida de la regla de detección sobre clusters conectados; la prioridad ordena los candidatos; la verificación es el trabajo de campo; el hallazgo analítico es el resultado de laboratorio clasificado; la atribución determina si el hallazgo corresponde al modo de pérdida investigado; la calibración realimenta los parámetros. La «etapa 2» de este documento agrupa los pasos 4–6 y los reporta por separado. El documento distingue además cuatro planos que trata por separado:
| Plano | Contenido | Sección |
|---|---|---|
| Método | El protocolo general de dos etapas y su lazo de calibración | 4–7 |
| Instrumentación | Cómo el tablero RAPIDS™ EIA implementa el método: índices, área de interés, control, descomposición STL, covariable de precipitación, clasificación, banderas de prioridad | 5, 11 |
| Validación | Cómo se determina si el método funciona: tasa de hallazgo, falsos positivos, especificidad, persistencia, comparación contra el programa periódico | 9, 12 |
| Demostración | Salidas del instrumento sobre sitios de ejemplo (figuras 1–5), sin valor de evidencia de desempeño | 11 |
Entradas. Serie temporal Sentinel-2 SR filtrada por nubosidad; geometría de la facilidad (zona excluida) y del área de interés (buffer perimetral); geometría de un área de control comparable en cobertura, geomorfología y régimen hídrico, fuera de la influencia de la facilidad; serie de precipitación CHIRPS (resolución 0,05°, agregación pentadal o diaria asignada al área de interés, con acumulados antecedentes de 1, 3, 7 y 30 días además del acumulado semestral; Funk et al., 2015); niveles de referencia analíticos aplicables al régimen.
Salidas. Por escena y por índice: residuo del área de interés frente al control, contraste diagnóstico y persistencia; mapa de banderas de prioridad; clusters conectados de anomalía con su extensión y clase; orden de verificación priorizada; un Audit Record por cluster (sección 9). Por verificación: resultado analítico clasificado, atribución y actualización de umbrales.
La etapa 1 es un protocolo parametrizable, reproducible una vez fijados sus parámetros (sección 9.1): ninguno de sus umbrales viene dado por este documento, y todos se fijan por escrito antes de la ventana. Para cada índice (vigor vegetal, suelo expuesto, salinidad, humedad) se construye una serie temporal sobre el área de interés y sobre el área de control. Ambas se descomponen con STL —Seasonal-Trend decomposition using LOESS (Cleveland, Cleveland, McRae & Terpenning, 1990)— en tendencia, estacionalidad y residuo; el residuo, lo que ni el ciclo fenológico ni el cambio lento explican, es la componente donde se busca la anomalía. La aplicación de STL a series satelitales irregulares exige declarar el mínimo de observaciones, la regularización temporal, el manejo de huecos por nubes, el período estacional y el tratamiento de outliers (parámetros de la sección 9.1). La precipitación entra como covariable para reducir la probabilidad de interpretar como anomalía inducida por la facilidad cambios coincidentes con variaciones pluviométricas; reduce ese confusor, no lo elimina ni resuelve causalidad.
Regla de detección. Se declara anomalía en un píxel del área de interés cuando concurren tres condiciones, cada una con su propio parámetro fijado ex ante:
La significancia estadística no sustituye a la magnitud ni a la persistencia: son condiciones distintas.
Contraste global AOI–control. Complementariamente, para cada índice se reporta la diferencia de medias entre el área de interés y el control con intervalo de confianza (prueba de Welch sobre los valores por píxel del período reciente). En esta versión ese contraste se lee como diagnóstico de la separación entre zonas, no como inferencia formal: los píxeles vecinos y las escenas sucesivas no son observaciones independientes, y un p-valor calculado sobre ellos exagera la evidencia. Con múltiples índices, píxeles, escenas y ventanas, aparecerán anomalías por azar: la política de multiplicidad es explícita —la decisión se toma a nivel de cluster, con umbrales pre-especificados, control de descubrimientos falsos y un período holdout— y se fija en la sección 9. El tratamiento de la dependencia espacial y temporal se especifica en el protocolo de validación del piloto (sección 9).
Regla de priorización. Las anomalías se combinan jerárquicamente con el contexto temporal en clases de prioridad por píxel: clase 1 (anomalía base, a confirmar), clase 2 (anomalía base con estrés hídrico concurrente), clase 3 (anomalía base con deterioro entre períodos). Sobre esa clasificación el tablero deriva dos magnitudes distintas y las reporta por separado: la extensión (área real por clase, píxeles × superficie de píxel, y su porcentaje del área de interés) y la intensidad de priorización (puntaje de clase ponderado por área, (3·A3 + 2·A2 + 1·A1)/Atotal, con niveles MEDIA / ALTA / MUY ALTA; ordena la verificación y no es una severidad ambiental). Las anomalías con FLAG se agregan por conectividad en clusters conectados de anomalía —la unidad de screening del protocolo— y la acción que el tablero propone se enuncia por cluster, proporcional a extensión e intensidad: seguimiento en la próxima escena, verificación programada en la próxima campaña o verificación prioritaria con un punto de muestreo por cluster de las clases 3 y 2. En todos los casos la notificación a la autoridad se condiciona a la confirmación analítica de la etapa 2.
La anomalía priorizada genera una orden de verificación: inspección, documentación fotográfica georreferenciada, muestreo de la matriz relevante y análisis con método certificado (SW-846 u homólogo del régimen). El resultado se clasifica en una de tres clases:
Un hallazgo confirmado no está, por ese solo hecho, atribuido: la exceedance puede provenir de contaminación histórica, del fondo natural del sitio o de una fuente externa. La atribución al modo de pérdida investigado (paso 6 del pipeline, sección 4) es una determinación posterior, se registra por separado en el Audit Record y no altera la clase de verificación. Sobre las tres clases se reportan siempre tres tasas: tasa de falsos positivos FP/(TP+FP), tasa de indeterminados I/N y tasa de confirmación TP/N. Las tres clases alimentan la calibración (sección 7). La muestra obligatoria del permiso se sigue tomando donde y cuando el permiso lo fija; la muestra dirigida se registra por separado con su origen, para que la comparación de la sección 9 sea posible.
La etapa 2 proporciona la realimentación necesaria para calibrar la etapa 1. Los resultados confirmados afinan los umbrales que los anticiparon; los clasificados como naturales o de manejo enseñan qué firmas descartar; los indeterminados se siguen. El ciclo separa calibración de validación: un bloque predefinido de resultados de verificación actualiza los parámetros (bloque de calibración) y la mejora se evalúa sobre un bloque posterior e independiente (holdout) que no participó en la actualización. Evaluar sobre el mismo conjunto que calibró produce fuga de información (data leakage) y aparenta un aprendizaje que no existe; ese riesgo se declara y se controla por diseño. Que la tasa de falsos positivos descienda con la verificación acumulada es la hipótesis H2, no una propiedad del método: se somete a prueba fuera de muestra según la sección 9. La curva de falsos positivos contra número de verificaciones, con los bloques de calibración y de holdout etiquetados, es el primer producto que un piloto debe entregar y el primer objeto de auditoría del método.
El protocolo no está diseñado para un contaminante sino para las formas en que una facilidad pierde control de lo que contiene. La matriz siguiente fija, para cada modo, qué observa el sensor, dónde deja de observar, hacia dónde reordena la verificación y qué resultado puede producir la etapa 2.
| Modo de pérdida de control | Señal observable | Observabilidad | Capacidad de priorización | Limitación | Acción de screening | Verificación | Resultado posible |
|---|---|---|---|---|---|---|---|
| Pérdida de contención (tanques, diques, piscinas) | Caída de vigor vegetal, suelo expuesto o firma de hidrocarburo en la corona de contención, persistente | Alta–media (superficial) | Sí | Señal superficial; anomalías de dimensión inferior a la resolución efectiva o espacialmente fragmentadas se mezclan con las coberturas circundantes | Priorizar el perímetro del dique, no el pozo aguas abajo | Inspección + muestra de suelo/agua superficial | Confirmado / natural o de manejo / indeterminado |
| Rebosamiento y sobrecarga de drenajes | Humedad y suelo expuesto anómalos en la escorrentía tras lluvias, ausentes en el control | Episódica (post-evento) | Sí, tras el evento | Dependencia del evento y de la escena útil posterior; nubes | Priorizar el canal receptor tras el evento, no la fecha fija de campaña | Inspección + muestra de sedimento/agua | Confirmado / natural o de manejo / indeterminado |
| Infiltración subsuperficial | Síntomas indirectos: estrés vegetal en la zona de descarga, salinización por ascenso capilar | Indirecta | Limitada | Baja sensibilidad; ausencia de señal no es ausencia de infiltración | Priorizar la ubicación de un pozo de verificación | Perforación + muestra de agua subterránea | Confirmado / natural o de manejo / indeterminado; el negativo no descarta |
| Emisiones fugitivas y evaporación | Señal débil, salvo estrés vegetal a sotavento | Baja | No | Capacidad de detección insuficiente para el fenómeno | No priorizar por este medio | Método especializado (detección de gas, OGI) | Fuera del alcance del protocolo |
La cuarta fila ilustra la regla general: la cobertura de un modo de pérdida exige desempeño detección→verificación demostrado para ese modo; ningún modo entra al protocolo por analogía con otro. En los cuatro casos la muestra obligatoria se toma donde y cuando dice el permiso; la muestra adicional se asigna donde el screening señala cambio. Lo que el método hipotetiza y somete a prueba es que esa muestra adicional tiene mayor probabilidad de hallazgo confirmado que la asignada por la política comparadora; no afirma que la periódica sea prescindible.
El marco responde, antes de cualquier piloto, las siete preguntas que determinan si un resultado es interpretable:
Los numerales de esta sección responden las preguntas en ese orden. Sus términos se fijan por escrito antes del piloto y no se modifican durante la ventana.
1. Unidad de screening. El cluster conectado de anomalía (evento candidato): el conjunto de píxeles contiguos que cumplen la regla de detección, agregado por conectividad. Trescientos píxeles anómalos que forman un cluster son un candidato de verificación, no trescientas oportunidades independientes; decidir por píxel introduce pseudoreplicación, dependencia y multiplicidad. La cadena es: píxeles → cluster conectado de anomalía → ubicación candidata de verificación → muestra de campo.
2. Unidad de outcome. La verificación de campo: un punto, una fecha y una matriz (suelo, agua superficial, agua subterránea, sedimento) dentro del activo y la ventana. Sobre ella se cuentan los hallazgos.
Ventanas. El protocolo distingue tres ventanas y las fija por escrito antes del piloto:
Población. Todas las verificaciones realizadas en el activo durante la ventana de evaluación, etiquetadas por la política que las asignó: P (programa periódico fijado por el permiso), D (asignación dirigida por el screening) y, según el diseño del comparador, C (asignación por la política comparadora). D es una política de asignación, no un diseño de estimación de prevalencia (EPA QA/G-5S distingue los diseños probabilísticos de los dirigidos y advierte que sobre estos últimos no se infiere la población; U.S. EPA, 2002; ITRC, 2022).
Hallazgo confirmado. Resultado analítico, obtenido por método certificado, por encima del nivel de referencia aplicable (norma del régimen o línea base del sitio) en la matriz muestreada. La confirmación no depende de la magnitud de la anomalía espectral que motivó la muestra. El numerador de H1 cuenta hallazgos confirmados (analytical exceedance), no atribuidos: la atribución al modo de pérdida investigado se registra por separado (secciones 4 y 6) y se reporta como desglose, no como criterio.
3. Estimando. La cantidad que H1 compara es la probabilidad de hallazgo confirmado cuando una verificación adicional se asigna mediante la política de screening, frente a cuando esa misma verificación se asigna mediante la política comparadora, en el mismo activo, la misma ventana y bajo los mismos criterios de elegibilidad analítica. No es la prevalencia de contaminación del sitio ni la sensibilidad del detector: es el rendimiento de una regla de asignación frente a otra.
4. Comparador. «Superior al programa periódico» no es interpretable si D y P no tienen la misma oportunidad temporal y espacial: P muestrea el pozo A en junio porque lo dice el calendario; D muestrea el área B en agosto porque hubo anomalía. Dos mecanismos de selección distintos no se comparan sin diseño. Tres diseños de comparador son admisibles, en orden creciente de fuerza inferencial:
La comparación puramente histórica (mismo activo, ventanas anteriores) se admite sólo como evidencia contextual, nunca como comparador de H1. El protocolo de cada piloto declara ex ante cuál usa y por qué. Nota v2.1 (WIP): la elección del diseño de comparador por defecto del programa Environmental Scouting —1, 2 o 3— está pendiente de decisión del método (AC2); este documento define los tres y sus condiciones, y no impone uno.
Métrica principal (H1 — verification yield superiority). Rendimiento por política: hD = cD/nD y hC = cC/nC, donde c es el número de hallazgos confirmados y n el número de verificaciones asignadas por la política. Se reporta el cociente hD/hC con intervalo de confianza del 95 % (prueba de proporciones; prueba exacta de Fisher cuando n es pequeño), junto con las tres tasas de la sección 6 para cada política.
5. Selección. El sesgo de selección se reconoce y no se elimina: hD no estima la prevalencia de contaminación en el sitio; estima el rendimiento del direccionamiento. La caracterización estadística del sitio sigue correspondiendo al programa periódico (U.S. EPA, 2002; ITRC, 2022). El estimando y el comparador hacen operativa esta distinción: la comparación es entre políticas de asignación con la misma oportunidad, no entre muestras de distinta naturaleza. Comparabilidad: mismo activo, misma ventana, mismos métodos analíticos, mismos niveles de referencia, misma matriz y misma oportunidad temporal y espacial según el diseño del comparador; las verificaciones que no cumplan estas condiciones se excluyen del cómputo y se declaran. Solapamiento: una verificación dirigida que coincide con un punto de la red del permiso —misma matriz y distancia inferior a la resolución del píxel— se cuenta como P; sólo se cuenta como D la que el screening añade fuera de la red del permiso o fuera de su calendario.
6. Calibración frente a validación (H2). Los resultados de verificación de un bloque de calibración predefinido actualizan los parámetros de detección; la mejora se evalúa sobre un bloque holdout posterior que no participó en la actualización. H2 se enuncia así: tras la recalibración con el bloque predefinido, la política de screening exhibe una tasa de falsos positivos menor en el bloque holdout que en el bloque de evaluación precedente, sin que la tasa de indeterminados supere el límite de aceptación predefinido. Evaluar sobre el mismo bloque que calibró es fuga de información y no cuenta como evidencia. El tamaño y el orden de los bloques, y el límite de indeterminados, se fijan ex ante (sección 9.1).
7. Mejora mínima — criterio de superioridad. H1 se acepta cuando el límite inferior del intervalo de confianza del 95 % del cociente hD/hC es mayor que 1 + δ, donde δ es el margen mínimo de relevancia práctica fijado ex ante por el operador y el equipo técnico —este documento no fija su valor—, con la potencia establecida ex ante. La significancia sin relevancia práctica no acepta H1.
Control del número de verificaciones y potencia. El tamaño nD obedece a dos restricciones distintas que no se confunden: una restricción de costo (por ejemplo, ≤ 20 % de nP, que acota el gasto adicional) y un requisito de potencia (el tamaño mínimo para detectar el cociente objetivo con α = 0,05 y la potencia acordada). Se fija nD = min(techo presupuestal, requisito de potencia) sujeto a evaluabilidad: si el techo presupuestal queda por debajo del requisito de potencia, el piloto se declara no concluyente por diseño antes de empezar, no se ejecuta para rechazar.
Dependencia y multiplicidad. Las observaciones por píxel y por escena no son independientes, y con múltiples índices, píxeles, escenas y ventanas aparecerán anomalías por azar. La política es explícita: la decisión se toma a nivel de cluster; los umbrales están pre-especificados; se aplica control de descubrimientos falsos sobre el conjunto de candidatos de cada ventana; y el holdout de H2 protege la calibración. El protocolo de validación del piloto especifica el tratamiento de la dependencia (agregación por unidad espacial, corrección por autocorrelación o modelo mixto) antes de reportar cualquier contraste como inferencia; hasta entonces, los contrastes del tablero son diagnósticos.
Trazabilidad — Audit Record. Cada detección que genera una orden de verificación abre un registro de auditoría (Audit Record) con identificador único, que acompaña la muestra D hasta su disposición final y es condición para que entre en el cómputo. Campos mínimos: activo y escenario; ventanas de línea base y de evaluación; identificadores de las escenas (baseline y evaluación); índices y versión de umbrales; control (identificador y geometría); cluster de anomalía (geometría, área, clase de prioridad, píxeles); ventana de evento; ubicación y fecha de la verificación de campo; identificador de muestra; resultado analítico (analito, valor, unidad, método); clase de verificación (confirmado / falso positivo confirmado / indeterminado); atribución (al modo de pérdida investigado, a otro proceso, no determinada); disposición (acción tomada, notificación, cierre). El instrumento genera la mitad de screening del registro (una fila por cluster, exportable); la mitad de verificación y atribución se completa fuera del tablero, con cadena de custodia. Un registro incompleto se declara y la muestra se excluye; el conjunto de registros es la cadena de evidencia que conecta la salida satelital con el resultado analítico y, cuando proceda, con una reclamación o un informe a la autoridad.
Indicador económico (H3). Cuando existe contabilidad de costos por verificación, se reporta el costo incremental por hallazgo confirmado: el costo adicional de las verificaciones dirigidas dividido por sus hallazgos confirmados, comparado con el del comparador. H3 es un indicador de gestión, no un criterio de aceptación: un método puede encontrar más (H1) y aprender (H2) antes de que su economía sea demostrable.
Precedentes de calibración cuantitativa. Existen precedentes externos, por dominio, de que el error de un detector remoto puede cuantificarse contra verdad de terreno: en metano con Sentinel-2, un detector de aprendizaje profundo reportó una tasa de falsos positivos de 9,6 % sobre imágenes sin pluma con verificación visual —no de campo— y una precisión de alertas cercana al 9 % en un campo y un año (Zhao et al., 2025); en derrames terrestres con Landsat (no Sentinel-2) y verdad aérea, un modelo de segmentación reportó F de 84,2 % (Nurseitov et al., 2024); en salinidad agrícola, R² de calibración de 0,59–0,63 y de ~0,48 en validación (Zeyada et al., 2023); en pérdida de árboles individuales, exactitud balanceada de 73 % en paisaje peri-urbano (Soutinho et al., 2026). Estas cifras demuestran que la cuantificación del error es alcanzable; no son objetivos, pronósticos ni banda de referencia de este protocolo, y ninguna proviene de su dominio de aplicación exacto.
El marco anterior deja deliberadamente sin valor los parámetros que dependen del activo, del régimen y del volumen de verificación disponible. Este documento los declara; el protocolo de validación de cada piloto los fija por escrito antes de la ventana y no los modifica durante ella. Ninguno se infiere del resultado.
| Parámetro | Sección | Quién lo fija | Cuándo | Criterio de fijación |
|---|---|---|---|---|
| Rango de referencia del control (percentiles por índice) | 5 (regla 1) | Equipo técnico del piloto | Al cerrar la línea base | Distribución del control en la línea base; se documenta el percentil por índice |
| Umbral de magnitud de efecto por índice | 5 (regla 2) | Equipo técnico + responsable HSE del activo | Antes de la ventana | Diferencia mínima operacionalmente relevante para el modo de pérdida de control dominante (matriz §8); hoy los umbrales del instrumento son valores de partida que requieren calibración de campo, no valores validados |
| Regla de persistencia (nº de escenas útiles consecutivas) | 5 (regla 3) | Equipo técnico | Antes de la ventana | Frecuencia esperada de escenas útiles en el sitio (nubosidad, §10) |
| Tratamiento de la dependencia espacial y temporal | 5, 9 | Equipo técnico (estadístico) | Antes de reportar cualquier contraste como inferencia | Agregación por unidad espacial, corrección por autocorrelación o modelo mixto; hasta entonces los p-valores del tablero se leen como diagnóstico |
| Ventana de línea base | 5, 9 | Equipo técnico | Antes de la ventana de evaluación | Período anterior al piloto con escenas útiles suficientes para los rangos de referencia del control; no se evalúa sobre ella |
| Ventana de evaluación | 9 | Operador + equipo técnico | Antes de la ventana | Por defecto ≥ 12 meses con un ciclo estacional completo; criterio real: mínimo temporal + mínimo de verificaciones (potencia) + cobertura de condiciones relevantes; común a P y D |
| Ventana de evento (por detección) | 9 | Equipo técnico | Antes de la ventana | Persistencia mínima exigida (escenas útiles) y plazo máximo entre detección y verificación; se registra en el Audit Record |
| nD = min(techo presupuestal, requisito de potencia) | 9 | Operador + equipo técnico | Antes de la ventana | Dos restricciones separadas: techo de costo (p. ej. ≤ 20 % de nP) y tamaño mínimo para el cociente objetivo con α = 0,05 y la potencia acordada; si el techo queda por debajo del requisito, no concluyente por diseño |
| Margen mínimo de relevancia práctica δ (H1) | 9 | Operador + responsable HSE | Antes de la ventana | Mejora mínima que justifica operar el screening; el criterio es LL95(hD/hC) > 1 + δ |
| Diseño del comparador (B concurrente / C aleatorización dentro de candidatos / D shadow sampling) | 9 | Equipo técnico + operador | Antes de la ventana | Oportunidad temporal/espacial comparable; se declara el diseño y sus reglas de concurrencia o aleatorización |
| Bloques de calibración y holdout (tamaño, orden) y límite de indeterminados (H2) | 7, 9 | Equipo técnico | Antes de la ventana | El holdout es posterior e independiente del bloque que calibra; límite máximo de tasa de indeterminados para aceptar H2 |
| Política de control de descubrimientos falsos (multiplicidad) | 5, 9 | Equipo técnico (estadístico) | Antes de la ventana | Decisión a nivel cluster; procedimiento FDR u homólogo sobre el conjunto de candidatos por ventana |
| Parámetros STL (mínimo de observaciones, regularización temporal, manejo de huecos, período estacional, outliers) | 5 | Equipo técnico | Antes de la ventana | Frecuencia real de escenas útiles del sitio; se documentan con la serie |
| Parámetros CHIRPS (agregación, asignación al AOI, acumulados antecedentes 1/3/7/30 días) | 4, 5 | Equipo técnico | Antes de la ventana | Para rebosamientos, la precipitación antecedente pesa más que la mensual |
| Manejo de escena perdida (nube sobre el cluster en la ventana de persistencia) | 5 | Equipo técnico | Antes de la ventana | Regla explícita: extender ventana, exigir escena adicional o declarar no evaluable el candidato |
| Nivel de referencia analítico por matriz | 6, 9 | Régimen aplicable / línea base del sitio | Antes de la ventana | Norma del régimen o línea base documentada; el mismo para P y D |
| Regla de solapamiento D/P (distancia, matriz) | 9 | Equipo técnico | Antes de la ventana | Resolución del píxel y red de puntos del permiso |
Resolución y mezcla espectral. A 10–20 m por píxel, una anomalía de extensión inferior a unas decenas de píxeles (del orden de décimas de hectárea) o espacialmente fragmentada se mezcla con las coberturas circundantes: el protocolo no resuelve lo pequeño, lo fragmentado ni lo lento.
Nubes y revisita. Más adquisiciones no implican más escenas útiles: la disponibilidad efectiva de observaciones sin nubes varía fuertemente por región y estación (Sudmanns et al., 2020), y en Sudamérica tropical la nubosidad puede inutilizar la mayor parte de las escenas en temporada húmeda (Prudente et al., 2020). Como estimación propia de trabajo —no una cifra publicada—, en trópico húmedo el intervalo útil puede pasar de los cinco días nominales a una o dos semanas o más; el intervalo útil efectivo de cada sitio se mide en el piloto. Una anomalía puede aparecer y resolverse entre dos escenas útiles.
Subsuperficie. El sensor no observa el acuífero: ausencia de señal no es ausencia de infiltración, y cada reporte lo declara.
Confusores. Sequía, fenología, manejo agrícola vecino, quema, obras: cada uno produce residuos comparables a los de una pérdida de contención. El control y la covariable de precipitación reducen el problema; no lo eliminan. Los estudios de monitoreo de vegetación documentan falsos positivos por píxeles mixtos, fondo adyacente y perturbaciones no letales, aun con series temporales densas (Soutinho et al., 2026).
Estatus probatorio de la salida satelital. Este documento no hace ningún claim de admisibilidad probatoria. La salida satelital se trata como evidencia de screening —la razón documentada de una verificación—, nunca como sustituto del resultado analítico; el Audit Record (sección 9) conserva la traza completa entre una y otro. Por eso el orden de las etapas es constitutivo del método.
Régimen de monitoreo. El protocolo se formaliza contra el marco de la EPA porque allí el diseño de muestreo, los objetivos de calidad de datos y los métodos analíticos están documentados y son citables sin ambigüedad (U.S. EPA, 2002; 2006); se aplica en cualquier régimen que combine monitoreo fijado por permiso con verificación adicional —en Colombia, la licencia ambiental y su plan de manejo bajo el Decreto 1076 de 2015—. La relación se declara como referencia metodológica (EPA) y aplicación (régimen local): la compatibilidad se demuestra en cada permiso, no se asume.
Condiciones de aplicabilidad. El método requiere:
Donde falte la condición 1, el instrumento sirve a la diligencia del operador pero no a la relación regulatoria; donde falten las condiciones 2–4, la etapa 1 no es evaluable.
Desempeño propio. Este documento no reporta cifras de desempeño del protocolo Environmental Scouting (instrumentado en el tablero RAPIDS™ EIA) como resultado. Las cifras de la sección 11 son salidas del instrumento (estado E2); no existe todavía desempeño validado en sitio (E4), y ninguna cifra E2 se presenta como tal.
Declaración de alcance de esta sección. Todas las cifras y figuras de esta sección son salidas del instrumento (estado de evidencia E2) sobre dos sitios y una ventana. No se muestra ningún resultado de verificación de campo ni de laboratorio (no ground-truth outcome is shown in Figures 1–5); por tanto, ninguna figura constituye evidencia de desempeño del protocolo (E4), ni atribuye causa. Cada figura lleva la marca visible INSTRUMENT DEMONSTRATION — NOT VALIDATION RESULT. Las demostraciones ilustran la operación del instrumento y la lectura de sus salidas; el desempeño se establece únicamente con el marco de la sección 9 y los criterios de la sección 12.
Las figuras 1 a 4 muestran el mismo instante del protocolo sobre una facilidad industrial real con piscinas de lodos (escenario piscinas de lodos del tablero RAPIDS™ EIA v3.1.0, que instancia la etapa 1): el polígono rojo es la zona excluida (la facilidad misma, 39,34 ha, fuera del cálculo); el anillo alrededor es el área de interés (83,39 ha, buffer de 250 m) donde se buscan anomalías; el control es un área de 2,17 ha fuera de la influencia del sitio. Este control no cumple el protocolo: es unas 38 veces menor que el área de interés y no se ha verificado su comparabilidad en cobertura, pendiente, suelo, hidrología, fenología, manejo y exposición; la sección 9 pide controles comparables y esta instanciación de demostración no lo acredita. Ventanas: línea base del 1 de octubre de 2021 al 31 de diciembre de 2024 (43 escenas útiles); evaluación del 1 de enero al 18 de octubre de 2025 (13 escenas útiles); Sentinel-2 SR, nubes < 30 %. El panel derecho, idéntico en las cuatro figuras, reporta el contraste del área de interés contra el control por índice como diagnóstico (intervalo de Welch sobre píxeles que no son independientes; no es prueba de hipótesis — por eso el panel no muestra p-valor):
Δvegetación = −0,089 , IC95 % = [−0,093;
−0,085]
Δestrés hídrico = +0,035 , IC95 % =
[+0,034; +0,037]
Δsuelo desnudo = +0,079 , IC95
% = [+0,075; +0,083]
Δsalinidad = +0,033 ,
IC95 % = [+0,032; +0,035]
nAOI = 8 838 px,
ncontrol = 228 px; NDVIAOI = 0,755 frente a
NDVIcontrol = 0,844 (E2 — diagnóstico, no inferencia)
El bloque de anomalías del panel es la salida de la regla de priorización sobre este sitio, leída en la unidad de screening del protocolo —el cluster conectado de anomalía—: extensión 5,68 ha del área de interés (6,81 %) — 1,93 ha en clase 3, 3,74 ha en clase 1 y sin área en clase 2 en esta ventana —; intensidad de priorización ALTA (puntaje ponderado ≈ 1,7); cinco clusters de al menos 3 píxeles (siete agrupaciones menores se descartan como ruido): cuatro con clase máxima 3 (5,04 ha · 0,34 ha · 0,16 ha · 0,03 ha) y uno con clase máxima 1 (0,03 ha). La acción que el tablero propone se enuncia por cluster: verificación de campo prioritaria con un punto de muestra por cluster de clase 3, documentación fotográfica georreferenciada, y notificación a la autoridad condicionada a que el laboratorio confirme analito por encima del nivel de referencia. Cada cluster abre un Audit Record (sección 9) que el tablero exporta con sus campos de screening. Las cifras del panel son salidas del instrumento (E2); no son medidas de desempeño del protocolo ni atribuyen causa.
La Figura 5 muestra el mismo protocolo sobre otro tipo de facilidad —un clúster de producción de 4,19 ha con un área de interés de 21,19 ha (buffer de 150 m) y un control de 1,44 ha, que tampoco acredita comparabilidad— como referencia de la graduación del instrumento. Ventanas: línea base 2016-01-01→2024-12-31; evaluación 2025-01-01→2025-10-31. El vigor vegetal del área de interés no está por debajo del control (Δvegetación = +0,020, IC95 % [+0,008; +0,031]), la alteración de suelo queda dentro de la incertidumbre (Δsuelo desnudo = 0,000, IC95 % [−0,009; +0,008]) y la extensión marcada es 0,32 ha (1,49 % del área de interés; 0,05 ha en clase 3, 0,26 ha en clase 1): intensidad de priorización MEDIA, cuatro clusters (uno de clase máxima 3, de 0,04 ha; dos agrupaciones descartadas), con verificación programada en la próxima campaña como acción propuesta por el tablero. La priorización responde a la magnitud y extensión de la anomalía, no a la existencia del área de interés.
Aceptación primaria. El protocolo se considera efectivo para un activo cuando, durante la ventana de evaluación predefinida, con el comparador declarado ex ante y con la potencia establecida ex ante, H1 se cumple según el criterio mínimo de superioridad de la sección 9: LL95(hD/hC) > 1 + δ.
Evidencia secundaria. El cumplimiento de H2 (reducción de la tasa de falsos positivos en el bloque holdout tras la recalibración, sin exceder el límite de indeterminados) se reporta como evidencia de que el mecanismo de calibración aprende; no es condición de aceptación.
Rechazo. El protocolo se considera no efectivo para un activo cuando, durante la ventana de evaluación predefinida, con el comparador declarado y con potencia suficiente, la asignación dirigida no supera el criterio mínimo frente a la política comparadora (H1 no cumplida).
Diagnóstico. Si H1 se cumple y H2 no, el direccionamiento es efectivo pero el mecanismo de calibración no demuestra aprendizaje en la ventana; el resultado se reporta como tal y motiva la revisión de las reglas de detección, no el rechazo del método.
Protocolo no conforme (implementation failure). Antes de leer un piloto como aceptación, rechazo o no evaluabilidad se verifica que el piloto se ejecutó según su protocolo. Se declara no conforme —y el resultado no cuenta ni a favor ni en contra del método— cuando concurre al menos una de estas condiciones:
Condiciones de no evaluabilidad. El protocolo se declara no evaluable —y no se afirma ni se rechaza— cuando el régimen no admite muestra adicional o no la reconoce en seguimiento; cuando la autoridad o la contraparte del activo no reconoce la muestra dirigida dentro del seguimiento del instrumento aplicable; cuando faltan las condiciones 2–4 de la sección 10; o cuando el número de muestras dirigidas queda por debajo del mínimo de potencia fijado ex ante (resultado no concluyente). En el primer y segundo caso, el instrumento conserva utilidad para la diligencia interna del operador, fuera del ámbito de este marco.
Declaración epistémica. Este documento describe un método, su instrumentación y el marco con el que se acepta o rechaza. No reporta resultados de engagement alguno ni cifras auditadas de desempeño propio. Las cifras de terceros (precisión de detectores, R² de índices) se toman de las fuentes listadas, no han sido auditadas por JR Engineering Company y se citan como precedentes externos de que el error de un detector remoto puede cuantificarse, no como banda de referencia, objetivo ni pronóstico de este protocolo. Cualquier aplicación a un activo concreto exige su propio control, su propia curva de calibración y el programa de monitoreo de su permiso intacto.
El protocolo especificado utiliza teledetección multiespectral como capa de screening para priorizar verificaciones de campo dentro de programas de monitoreo ambiental existentes. La medida de su desempeño es el rendimiento de verificación frente al comparador predefinido: la tasa de hallazgos confirmados por verificación de la asignación dirigida frente a la de la política comparadora del mismo activo y ventana (H1), la mejora de calibración fuera de muestra (H2) y, cuando hay contabilidad de costos, el costo incremental por hallazgo confirmado (H3).
Triad es un precedente de lógica —el screening denso que dirige la muestra definitiva— y los detectores remotos publicados son precedentes de que el error puede cuantificarse contra verdad de terreno; ninguno de los dos es evidencia de este protocolo, y ninguna de esas cifras se traslada. La validación requiere el marco de la sección 9 —las siete preguntas: unidades de screening y de outcome, estimando, comparador, selección, calibración frente a validación y mejora mínima— aplicado con los criterios de la sección 12, incluida la distinción entre rechazo del método y fallo de implementación.
Las demostraciones presentadas no constituyen evidencia de desempeño del protocolo. Constituyen salidas de la instrumentación (E2) y ejemplos de su operación. La efectividad del método permanece como hipótesis verificable mediante pilotos diseñados para cada activo y régimen de monitoreo; el resultado de cada piloto determina si el método cumple los criterios de desempeño establecidos para ese activo. Environmental Scouting no reemplaza el monitoreo ambiental: convierte la observación remota en una regla trazable de asignación de la capacidad finita de verificación de campo, y exige que esa regla demuestre su valor frente al régimen de monitoreo que complementa.