Trust & verification methodology
Version 2.0
Every report on the map carries a trust judgement so you can see how much to rely on it, not just what it says. We grade trust on three independent axes and combine two of them into a single user-facing badge. Every grade level is taken from an established standard; the few numeric cut-offs we had to choose are flagged as ours. This is open-source intelligence tradecraft applied to crowdsourced disaster data, not a black box.
The badge
A defined function of Axis 1 (source reliability) and Axis 2 (information credibility):
| Badge | Means | When |
|---|---|---|
| ⛑ Assessed | The source marks its own assessment complete. | SismoAyuda VE reports an ATC-20 / EMS-98 result, generally based on remote photo review. This is a source-status label, not a higher trust tier; the record remains credibility C and the source remains Untested. Other supporting reports stay visible but do not turn the source-declared status into our verification. |
| ✓ Verified | Origin independence and the four verification checks are established. | Credibility A or B, at least two explicitly traced independent origins, completed provenance / source / date / location checks, and no source graded "not reliable". |
| Reported | A traceable public report that does not meet the Verified evidence bar. | One source; multiple named sources whose shared-origin independence is not established; or a record whose four verification checks have not run. |
| Unverified | No assessable source, or reliability in doubt. | Credibility D/E (anonymous, bare-platform, or suspected false), or a "not reliable" source. |
n_fuentes counts distinct source records and distinct_named_sources counts canonical names; only explicit lineage contributes to independent_origins. No ordinary record is labeled Verified while either check is missing: confirmed origin independence or a completed provenance / source / date / location review. Unknowns fail closed to Reported.Axis 1 · Source reliability
Per source. Scale adopted from the UK College of Policing 3×5×2 intelligence grading:
| Reliable | Established outlet, official / scientific body (e.g. FUNVISIS, USGS, NASA), or a curated, source-cited aggregator. |
| Untested | No track record yet. The honest default (= Admiralty "F"). Not pejorative: most crowd sources sit here. |
| Not reliable | Reasonable grounds to doubt the source. Reserved for evidenced cases. |
How it is assigned (today): a type-prior. We seed grades from source type (a registry of the ~45 outlets that cover most of the volume, plus the pipeline's own outlet classification), and default everything else to Untested. This is a starting prior, labelled method: type-prior on every record, not a measured track record. The doctrinally correct upgrade (a computed per-source accuracy statistic, the "Accu" model, that scores how often a source's claims are later independently corroborated) is the next phase; it needs accumulated history we are still gathering.
Axis 2 · Information credibility
Per report. Computed from the deduped source list. Scale from UK 3×5×2 information evaluation:
| A | First-hand (a source that witnessed it). |
| B | Independently corroborated: ≥2 origins "not from the same original source". |
| C | Single-source / uncorroborated. |
| D | Unattributed: anonymous or bare-platform only, no assessable source. |
| E | Suspected false (contradicted). |
We compute B only when explicit lineage establishes at least two origins; otherwise attributed reports remain C. A and E require human review (witness evidence; an active contradiction) and are not auto-assigned, so we deliberately under-claim to C rather than guess A.
Independence (the careful part)
- Canonical names are names, not origins. One account posting five times is one named source, not five; name variants are folded to one id (for example
lamega967andLa Mega). Five different accounts can still be five echoes of one video, so names alone never establish independence. - Explicit lineage is required. An origin counts only when an adapter or documented human review assigns an
origin_idtracing the claim to its underlying source. Two records with the sameorigin_idcount as one origin. - Aggregators never establish another origin. A curated re-publisher (terremotovenezuela.com, RedQuipu, acopiovzla) remains visible for provenance but cannot turn a claim into corroboration.
- Partner datasets are disclosed, not promoted beyond their evidence. NZSEE (the New Zealand Society for Earthquake Engineering, nzsee.org.nz) shares hand-curated remote building assessments with this project. Each record is marked
partnerand the per-record media carries the available evidence, but partner status alone does not satisfy independent-origin or on-site-verification requirements. Canonical citation: NZSEE's public Learning from Earthquakes report (VERT Venezuela 2026). - Citable dataset. Snapshots of this site's data are archived with a DOI: 10.5281/zenodo.21154222 (CC BY 4.0; includes a field-by-field codebook, GeoJSON, and HXL-tagged CSV). Cite as: Martinez, C. (2026). crisisvenezuela.org building-damage dataset, Venezuela earthquakes of 24 June 2026. Zenodo.
- Bare platforms are not a source.
facebook.com/instagram.comwith no specific author carry no independent weight.
explicit-origin-lineage-v2. Media matching can help future review, but it does not silently manufacture independence.Axis 3 · Damage confidence
Damage reports only. Ordinal grades from the Copernicus EMS / UNOSAT scale, read from the report text:
| Destroyed | Total collapse (our nivel=colapso_total). |
| Damaged | Heavy to light structural damage (severo / parcial). |
| Possibly damaged | Lower-confidence / generic damage language (dano). |
Damage read from text is a proxy and near-real-time estimate, not ground truth (Copernicus). It says nothing about whether a building is safe to occupy. That requires a formal engineering assessment; any occupancy decision should be confirmed on site.
Coordinate precision
Separate from trust, every point carries a coord_origen tag so a map pin is never mistaken for a surveyed location:
| explicita | The coordinate came with the source (a partner dataset, catalog, or post). Its precision is not independently verified; source catalogs may publish approximate or placeholder points. |
| geocodificada | We derived it from the place name via a geocoder (OpenStreetMap / Nominatim). Approximate — see accuracy below. |
| (none) | No coordinate could be determined; the report is listed without a pin. |
Indicative geocoder benchmark: in an internal comparison against source-supplied reference coordinates, not surveyed ground truth, resolving a Venezuelan place name to a point had a ~1 km median difference, with about half landing in the same neighborhood and a ~27% gross-difference rate (>5 km); roughly 44% of un-coordinated reports could not be geocoded at all. These aggregate figures describe pipeline behavior, not the accuracy of any individual pin. Geocoded points are never presented as surveyed, unresolved reports remain unpinned rather than guessed, and the map flags each derived pin as "ubicación aproximada." The source mix changes as exports are regenerated; inspect coord_origen on the record rather than relying on a static percentage.
Excluded records
A record can be unusable or contradictory for operational mapping: its coordinate may be in the open sea, outside Venezuela, in a region the quake did not affect, at a no-location placeholder, inconsistent with the reported state or municipality, or incompatible with another source for the same entity. Near-identical names may refer to the same structure, but are also ambiguous when the available locations cannot establish that safely. These can be source-entry errors, placeholders, unresolved location claims, or unresolved entity identities, so the pipeline does not guess. The record is withheld from public operational facts and point layers and disclosed separately in /excluded.json for auditability.
| en el mar | Coordinate in open water, more than ~5 km offshore. |
| fuera de Venezuela | Coordinate outside the country's borders. |
| zona sin sismo | Coordinate in a state this event did not affect (the trans-Orinoco south: Amazonas, Bolívar, Delta Amacuro, Apure). |
| coordenada de relleno | A source placeholder coordinate used when no location could be resolved — the fact has no precise point. |
| ubicación incoherente | The coordinate contradicts the state reported by the source and is more than 5 km beyond that state’s boundary. The narrow tolerance avoids rejecting legitimate border locations; distance from the epicenter is not an exemption. |
| ubicación municipal incoherente | The coordinate contradicts an explicitly reported municipality and is more than 1 km beyond its boundary. |
| ubicaciones de fuente en conflicto | Sources place the same named structure at coordinates more than 250 m apart. Every disputed pin is quarantined pending resolution. |
| ubicaciones de punto de ayuda en conflicto | The same aid-site name and address appears at coordinates more than 250 m apart. Every disputed pin is quarantined pending resolution. |
| identidad de estructura ambigua | Near-identical names may identify one physical structure, but the available source-location evidence does not resolve that safely. Every affected record is quarantined pending human review; a null distance means one or both claims had no source coordinate. |
The full, current list — each record with its coordinate, its reason, and what it was labeled — is published as open data at /excluded.json, so anyone can audit exactly what was removed and why. We deliberately do not use a distance-from-epicenter cutoff: real corroborated far-field damage (Zulia, the Anzoátegui coast, 400+ km out) sits at the same distances as the errors, so dropping on distance alone would erase real reports.
What is computed, prior, or not yet established
- Computed: distinct source records and canonical named sources.
- Confirmed origin: counted only from explicit
origin_idlineage supplied by an adapter or documented review. - Type-prior: source reliability (from source type, not yet a measured track record).
- Not run: the Verification Handbook four-element check (provenance / source / date / location) is represented as
checks.status: "not_run"; it is never assumed to pass. - Our chosen cut-offs (no standard fixes a number): Verified requires at least two confirmed origins plus completed four-element checks; attributed records below that bar remain Reported, and D/E remains Unverified.
In the API
Every record in the open-data API carries a confianza object with the badge and all three axes, so you can filter or re-derive trust yourself. Per-source kind is exposed inside fuentes[], and each record carries a coord_origen precision tag (explicita = from source, geocodificada = our ~1 km geocoder estimate).
Sources: US Army FM 2-22.3 (Admiralty source/credibility matrix); NATO STANAG 2511 (independence of the two axes); UK College of Policing 3×5×2 / 5×5×5 (the adopted grade definitions, "independent, not from the same original source"); Verification Handbook (the 4-element check); ACLED Codebook (single-source floor, "quantity is not quality"); Copernicus EMS & UNOSAT / IWG-SEM (the damage scale); ATC-20 (Applied Technology Council, Procedures for Postearthquake Safety Evaluation of Buildings, the green/yellow/red placards); EMS-98 (Grünthal ed., European Macroseismic Scale 1998, building damage grades G1–G5); Dong, Berti-Équillé & Srivastava 2009 (source-accuracy / copy detection); Li & Gao et al. 2016 (truth-discovery survey, why full ML does not fit sparse data). Full design notes live in the project repo (SOURCE_TRUST_MODEL.md).
Metodología de confianza y verificación
Versión 2.0
Cada reporte en el mapa lleva un juicio de confianza, para que veas cuánto fiarte de él, no solo lo que dice. Calificamos la confianza en tres ejes independientes y combinamos dos de ellos en una sola insignia visible. Cada nivel proviene de un estándar establecido; los pocos umbrales numéricos que tuvimos que elegir están marcados como nuestros. Esto es oficio de inteligencia de fuentes abiertas aplicado a datos ciudadanos de desastre, no una caja negra.
La insignia
Una función definida del Eje 1 (fiabilidad de la fuente) y el Eje 2 (credibilidad de la información):
| Insignia | Significa | Cuándo |
|---|---|---|
| ⛑ Evaluado | La fuente marca su propia evaluación como completada. | SismoAyuda VE reporta un resultado ATC-20 / EMS-98, generalmente basado en revisión remota de fotos. Es una etiqueta de estado de la fuente, no un nivel superior de confianza; el registro queda en credibilidad C y la fuente queda Sin historial. Otros reportes de apoyo siguen visibles, pero no convierten el estado declarado por la fuente en una verificación nuestra. |
| ✓ Verificado | La independencia de origen y las cuatro verificaciones están establecidas. | Credibilidad A o B, al menos dos orígenes independientes con linaje explícito, verificaciones completadas de procedencia / fuente / fecha / ubicación y ninguna fuente calificada como "no fiable". |
| Reportado | Un reporte público trazable que no alcanza el umbral probatorio de Verificado. | Una fuente; varias fuentes con nombre cuya independencia de origen compartido no está establecida; o un registro cuyas cuatro verificaciones no se han ejecutado. |
| Sin verificar | Sin fuente evaluable, o fiabilidad en duda. | Credibilidad D/E (anónimo, solo-plataforma, o sospecha de falsedad), o una fuente "no fiable". |
n_fuentes cuenta registros de fuente distintos y distinct_named_sources cuenta nombres canónicos; solo un linaje explícito aporta a independent_origins. Ningún registro ordinario recibe la insignia Verificado si falta cualquiera de las dos compuertas: independencia de origen confirmada o revisión completada de procedencia / fuente / fecha / ubicación. Lo desconocido falla de forma cerrada a Reportado.Eje 1 · Fiabilidad de la fuente
Por fuente. Escala adoptada de la calificación de inteligencia 3×5×2 del UK College of Policing:
| Fiable | Medio establecido, organismo oficial / científico (p. ej. FUNVISIS, USGS, NASA), o un agregador curado y con fuentes citadas. |
| Sin probar | Aún sin historial. El valor por defecto honesto (= "F" del Admiralty). No es peyorativo: la mayoría de las fuentes ciudadanas están aquí. |
| No fiable | Motivos razonables para dudar de la fuente. Reservado para casos con evidencia. |
Cómo se asigna (hoy): un prior por tipo. Sembramos las calificaciones según el tipo de fuente (un registro de los ~45 medios que cubren la mayor parte del volumen, más la clasificación de medios del propio sistema), y todo lo demás queda por defecto en Sin probar. Es un prior inicial, etiquetado method: type-prior en cada registro, no un historial medido. La mejora doctrinalmente correcta (un estadístico de exactitud por fuente calculado, el modelo "Accu", que mide con qué frecuencia las afirmaciones de una fuente se corroboran luego de forma independiente) es la siguiente fase; requiere historia acumulada que todavía estamos reuniendo.
Eje 2 · Credibilidad de la información
Por reporte. Calculado a partir de la lista de fuentes deduplicada. Escala de la evaluación de información 3×5×2 del UK:
| A | De primera mano (una fuente que lo presenció). |
| B | Corroborado de forma independiente: ≥2 orígenes "no provenientes de la misma fuente original". |
| C | De una sola fuente / sin corroborar. |
| D | Sin atribución: solo anónimo o solo-plataforma, sin fuente evaluable. |
| E | Sospecha de falsedad (contradicho). |
Calculamos B solo cuando un linaje explícito establece al menos dos orígenes; de lo contrario los reportes atribuidos quedan en C. A y E requieren revisión humana (evidencia de testigo; una contradicción activa) y no se asignan automáticamente, así que deliberadamente sub-declaramos a C en vez de adivinar A.
Independencia (la parte delicada)
- Los nombres canónicos son nombres, no orígenes. Una cuenta que publica cinco veces es una fuente con nombre, no cinco; sus variantes se unifican a un id. Cinco cuentas distintas todavía pueden ser cinco ecos del mismo video, por lo que los nombres solos nunca establecen independencia.
- Se exige linaje explícito. Un origen cuenta solo cuando un adaptador o una revisión humana documentada asigna un
origin_idque traza la afirmación a su fuente subyacente. Dos registros con el mismoorigin_idcuentan como un origen. - Los agregadores nunca establecen otro origen. Un re-publicador curado (terremotovenezuela.com, RedQuipu, acopiovzla) permanece visible por procedencia, pero no puede convertir una afirmación en corroboración.
- Los conjuntos de socios se divulgan, sin promoverlos más allá de su evidencia. NZSEE (la Sociedad de Ingeniería Sísmica de Nueva Zelanda, nzsee.org.nz) comparte evaluaciones remotas de edificios con este proyecto. Cada registro se marca
partnery sus medios llevan la evidencia disponible, pero ser socio por sí solo no satisface los requisitos de origen independiente ni verificación presencial. Cita canónica: el informe público de NZSEE (Learning from Earthquakes, VERT Venezuela 2026). - Conjunto de datos citable. Las instantáneas de los datos de este sitio se archivan con DOI: 10.5281/zenodo.21154222 (CC BY 4.0; incluye diccionario de campos, GeoJSON y CSV con etiquetas HXL). Citar como: Martinez, C. (2026). crisisvenezuela.org building-damage dataset, Venezuela earthquakes of 24 June 2026. Zenodo.
- Una plataforma desnuda no es una fuente.
facebook.com/instagram.comsin un autor específico no aportan peso independiente.
explicit-origin-lineage-v2. La coincidencia de medios puede ayudar una revisión futura, pero no fabrica independencia en silencio.Eje 3 · Confianza del daño
Solo reportes de daño. Grados ordinales de la escala Copernicus EMS / UNOSAT, leídos del texto del reporte:
| Destruido | Colapso total (nuestro nivel=colapso_total). |
| Dañado | Daño estructural de severo a leve (severo / parcial). |
| Posiblemente dañado | Lenguaje de daño genérico / de menor confianza (dano). |
El daño leído del texto es un indicador y estimación en tiempo casi real, no la verdad sobre el terreno (Copernicus). No dice nada sobre si un edificio es seguro para habitar. Eso requiere una evaluación formal de ingeniería; cualquier decisión de ocupación debe confirmarse en sitio.
Precisión de las coordenadas
Aparte de la confianza, cada punto lleva una etiqueta coord_origen para que un pin del mapa nunca se confunda con una ubicación inspeccionada:
| explicita | La coordenada vino con la fuente (un conjunto de datos, catálogo o publicación). Su precisión no está verificada de forma independiente; los catálogos pueden publicar puntos aproximados o de relleno. |
| geocodificada | La derivamos del nombre del lugar con un geocodificador (OpenStreetMap / Nominatim). Aproximada — ver precisión abajo. |
| (ninguna) | No se pudo determinar coordenada; el reporte se lista sin pin. |
Referencia indicativa del geocodificador: en una comparación interna contra coordenadas de referencia suministradas por las fuentes, no verdad de terreno levantada, resolver un nombre de lugar venezolano a un punto tuvo una diferencia mediana de ~1 km, con cerca de la mitad cayendo en el mismo vecindario y una tasa de diferencia grave de ~27% (>5 km); cerca del 44% de los reportes sin coordenada no pudieron geocodificarse. Estas cifras agregadas describen el comportamiento del sistema, no la exactitud de un pin individual. Los puntos geocodificados nunca se presentan como levantados, los reportes no resueltos quedan sin pin en vez de adivinarse, y el mapa marca cada pin derivado como "ubicación aproximada". La proporción cambia a medida que se regeneran las exportaciones; debe consultarse coord_origen en cada registro y no un porcentaje estático.
Registros excluidos
Un registro puede ser inutilizable o contradictorio para el mapa operativo: su coordenada puede estar en el mar abierto, fuera de Venezuela, en una zona que el sismo no afectó, en una coordenada de relleno, ser incompatible con el estado o municipio reportado, o ser incompatible con otra fuente para la misma entidad. Los nombres casi idénticos pueden referirse a la misma estructura, pero también son ambiguos cuando las ubicaciones disponibles no permiten establecerlo con seguridad. Puede tratarse de errores de captura, marcadores de posición, afirmaciones de ubicación no resueltas o identidades no resueltas, por lo que el sistema no adivina. El registro se retiene fuera de los hechos públicos operativos y de las capas de puntos y se divulga por separado en /excluded.json para auditoría.
| en el mar | Coordenada en aguas abiertas, a más de ~5 km de la costa. |
| fuera de Venezuela | Coordenada fuera de las fronteras del país. |
| zona sin sismo | Coordenada en un estado que este evento no afectó (el sur trans-Orinoco: Amazonas, Bolívar, Delta Amacuro, Apure). |
| coordenada de relleno | Una coordenada de relleno que la fuente usa cuando no pudo resolver la ubicación — el hecho no tiene punto preciso. |
| ubicación incoherente | La coordenada contradice el estado reportado por la fuente y queda a más de 5 km de su límite. La tolerancia estrecha evita rechazar ubicaciones fronterizas legítimas; la distancia al epicentro no concede una exención. |
| ubicación municipal incoherente | La coordenada contradice un municipio reportado explícitamente y queda a más de 1 km de su límite. |
| ubicaciones de fuente en conflicto | Las fuentes sitúan la misma estructura con nombre en coordenadas separadas por más de 250 m. Todos los pines disputados quedan en cuarentena hasta resolverlos. |
| ubicaciones de punto de ayuda en conflicto | El mismo nombre y dirección de ayuda aparece en coordenadas separadas por más de 250 m. Todos los pines disputados quedan en cuarentena hasta resolverlos. |
| identidad de estructura ambigua | Nombres casi idénticos pueden identificar una sola estructura física, pero la evidencia disponible sobre las ubicaciones de las fuentes no permite resolverlo con seguridad. Todos los registros afectados quedan en cuarentena hasta revisión humana; una distancia nula significa que una o ambas afirmaciones no tenían coordenada de fuente. |
La lista completa y actual — cada registro con su coordenada, su motivo y cómo estaba etiquetado — se publica como datos abiertos en /excluded.json, para que cualquiera pueda auditar exactamente qué se quitó y por qué. Deliberadamente no usamos un corte por distancia al epicentro: hay daños reales corroborados a larga distancia (Zulia, la costa de Anzoátegui, a 400+ km) a las mismas distancias que los errores, así que descartar solo por distancia borraría reportes reales.
Qué se calcula, qué es prior y qué no está establecido
- Calculado: registros de fuente distintos y fuentes canónicas con nombre.
- Origen confirmado: solo se cuenta desde un linaje
origin_idexplícito aportado por un adaptador o una revisión documentada. - Prior por tipo: fiabilidad de la fuente (del tipo de fuente, todavía no un historial medido).
- No ejecutado: la verificación de cuatro elementos del Verification Handbook (procedencia / fuente / fecha / ubicación) se representa como
checks.status: "not_run"; nunca se presume aprobada. - Nuestros umbrales elegidos (ningún estándar fija un número): Verificado exige al menos dos orígenes confirmados y las cuatro verificaciones completadas; los registros atribuidos por debajo de ese umbral quedan Reportados y D/E queda Sin verificar.
En la API
Cada registro en la API de datos abiertos lleva un objeto confianza con la insignia y los tres ejes, para que puedas filtrar o recalcular la confianza por tu cuenta. El kind por fuente se expone dentro de fuentes[], y cada registro lleva una etiqueta de precisión coord_origen (explicita = de la fuente, geocodificada = nuestra estimación con geocodificador de ~1 km).
Fuentes: US Army FM 2-22.3 (matriz de fuente/credibilidad del Admiralty); NATO STANAG 2511 (independencia de los dos ejes); UK College of Policing 3×5×2 / 5×5×5 (las definiciones de grado adoptadas, "independiente, no de la misma fuente original"); Verification Handbook (la verificación de 4 elementos); ACLED Codebook (piso de fuente única, "la cantidad no es calidad"); Copernicus EMS y UNOSAT / IWG-SEM (la escala de daño); ATC-20 (Applied Technology Council, procedimientos de evaluación de seguridad post-sismo, las placas verde/amarillo/rojo); EMS-98 (Grünthal ed., Escala Macrosísmica Europea 1998, grados de daño G1–G5); Dong, Berti-Équillé y Srivastava 2009 (exactitud de fuente / detección de copia); Li y Gao et al. 2016 (estudio de descubrimiento de la verdad, por qué el ML completo no encaja con datos escasos). Las notas de diseño completas están en el repo del proyecto (SOURCE_TRUST_MODEL.md).