27 de julio de 2026 · [[El Abismo de Máquina/Ecos|¿qué es un eco?]]
# Eco: Vídeo - La cura del AI slop es un manual de aviones de 1986
> [!entradilla]
> Un vídeo prueba si un estándar de aviación de 1986 cura el AI slop: seis tareas, cuatro sistemas de escritura, dos modelos y un linter que cuenta las faltas.
> [!tip]+ Qué tienes aquí
>
> Un vídeo de 16 minutos de Vusal Ismayilov, el primero de su canal, y yo ya me he suscrito. Va sobre una idea que corrió mucho hace unos días: que la cura del AI slop está en ASD-STE100, el inglés técnico simplificado que la industria aeronáutica publicó en 1986 para que un mecánico no se equivoque leyendo un manual de reparación.
>
> Lo abrí desconfiando. Suena a titular viral de los que luego no llevan nada dentro, y resulta que no. El autor hace una cosa que casi nadie hace con este tema: en vez de discutir si un texto "suena a IA", que es una sensación y con una sensación no hay por dónde empezar, define el slop como seis costumbres que se pueden contar. Sinónimos rotando, verbos convertidos en sustantivos, adjetivos de folleto, frases kilométricas y un par más. Luego se mete en las 434 páginas del estándar, saca las reglas, escribe un programita que las mide y monta la prueba. Seis tareas de escritura reales, dos modelos y cuatro formas de pedir el texto: sin instrucciones de estilo, con una lista de palabras prohibidas, con las seis reglas de escritura clara que George Orwell publicó en 1946, y con el estándar de aviación. Y publica el código y todos los números, con lo cual cualquiera puede repetirlo y discutírselo.
>
> En teoría el estándar no tiene nada que ver con esto. Se escribió hace cuarenta años para que un mecánico bajo presión no malinterprete una instrucción y se mate, con lo cual nadie estaba pensando en modelos de lenguaje ni en nada que se le parezca. Pero en la práctica ataca una a una las mismas seis costumbres. Esa correspondencia es el hallazgo del vídeo.
>
> Los números con Claude, medidos en faltas por cada 100 palabras. Sin instrucciones de estilo, 4,36. Con la lista de palabras prohibidas, 4,21, que es una mejora del 3%. O sea, ninguna. Con Orwell, un 43% menos. Con el estándar de aviación, un 74% menos.
>
> Y hay un detalle que explica ese 3% mejor que cualquier razonamiento. La lista de palabras prohibidas incluía una regla muy concreta, la de no usar rayas largas, y esa se cumplió: bajaron de seis a una. Lo demás se quedó exactamente igual. El modelo obedeció la letra de la instrucción y siguió escribiendo un párrafo igual de flojo, solo que sin rayas largas.
>
> Con GPT los números cambian bastante. Ahí la lista de palabras prohibidas sí funciona, un 40% menos, y Orwell empata con el estándar. El autor lo cuenta sin maquillarlo, y esa es la parte que más me gusta del vídeo: acaba de demostrar que su 3% era una curva de un modelo concreto y no una ley.
>
> Esto me da un poco en la cara, la verdad. Yo tengo mi lista de palabras prohibidas para escribir en esta web y llevo meses ampliándola cada vez que algo me suena a IA. Según sus números, eso es la versión menos fiable de la idea correcta.
>
> Pegas, que las hay. La mayor la nombra el propio autor: esto arregla la forma, no el fondo. Un párrafo hueco sigue siendo hueco, solo que ahora está bien puntuado. La evidencia con lectores humanos que cita es real pero vieja, de 1996 y 2007, y las mejoras son bastante más modestas de lo que el entusiasmo sugiere. Su programita tampoco es el estándar completo, cosa que también dice. Y el estándar es gratis, pero hay que pedirlo por formulario, así que lo de "descárgatelo ahora" es un poco optimista.
>
> Lo traigo porque conecta con algo que llevo publicando aquí desde hace más de un año. De [[Posts/2026.01/14-AI-Slop-vs-Workslop|slop y workslop]] hemos hablado mucho, casi siempre desde el diagnóstico. Y esta es la primera pieza que veo que pone al lado del diagnóstico una propuesta que se puede medir. Ya era hora. Engancha además con el [[Posts/2026.07/10-Modo-cavernicola|modo cavernícola]] que publiqué hace dos semanas, que es la misma idea por otro camino: darle al modelo un sistema de escritura corto y comprobable en vez de una lista de castigos. El autor cita caveman, de hecho.
>
> Si no escribes código, la conclusión te vale igual para un informe, un correo o una nota interna. Yo creo que la gracia está en dejar de pelear palabra por palabra y darle a la máquina un criterio que ella misma pueda comprobar antes de entregarte el texto. Yo el mío todavía no lo tengo montado del todo, así que ya os contaré si funciona tan bien como sale aquí.
>
> El vídeo original: [The cure for AI slop is a 1986 aircraft manual](https://www.youtube.com/watch?v=uJblcC4lKYw)
> [!abstract]- Resumen esquemático
>
> #### Índice
>
> 1. La afirmación
> 2. Cómo empezó esto
> 3. Qué es el slop
> 4. Qué es el STE
> 5. Regla por regla
> 6. Antes y después
> 7. La evidencia con lectores humanos
> 8. La prueba
> 9. Cómo lo usa el autor
> 10. El veredicto
>
> #### Resumen global
>
> Un hilo viral con más de 2 millones de visitas propuso ASD-STE100 (Simplified Technical English, estándar aeronáutico de 1986) como cura del AI slop. El autor del vídeo define el slop como seis costumbres lingüísticas contables, extrae las reglas del estándar, escribe un linter que las mide y ejecuta un experimento de 6 tareas de escritura x 4 sistemas de escritura x 2 modelos. Resultado en Claude: baseline 4,36 faltas por 100 palabras; lista de palabras prohibidas 4,21 (-3%); reglas de Orwell 2,48 (-43%); STE 1,12 (-74%). En GPT-5.5 el STE reduce el slop un 50% pero la lista de palabras prohibidas también funciona (-40%). Conclusión que sobrevive a los dos modelos: cualquier sistema de escritura verificable reduce el slop a la mitad o más; prohibir palabras sueltas es la versión menos fiable de la misma idea. El estándar arregla la forma del slop, no su fondo.
>
> #### La afirmación
>
> - Punto de partida: mismo prompt y mismo modelo producen dos respuestas de calidad distinta. Una es slop.
> - Ejemplo de slop: "Designed to slide into your existing stack with minimal friction and no vendor lock-in". Ejemplo limpio: "A normal cache matches requests by exact text. A small change in wording causes a cache miss".
> - Afirmación viral que motiva el vídeo: la cura está en un estándar de escritura creado para mecánicos de aviación en 1986.
> - Propiedad que decide todo el asunto: las reglas que sirven son verificables por máquina. Un script simple las comprueba; no hace falta criterio estético.
>
> #### Cómo empezó esto
>
> - Origen: una cuenta (@geogristle) pregunta cómo conseguir que la IA escriba documentación técnica que no suene a IA. Más de 2 millones de visitas.
> - Primera respuesta de fondo (@Voxyz_ai): prohibir palabras una a una es perder el tiempo, porque el modelo nunca eligió esas palabras a propósito. Sin sistema de escritura, el modelo tira del promedio de internet, y el promedio de internet es slop. Su propuesta: las seis reglas de Orwell de 1946.
> - Respuesta que escala el asunto (@mikehostetler): usar ASD-STE100, un estándar internacional publicado, con 53 reglas y un diccionario de unas 900 palabras, diseñado para que un mecánico no malinterprete un manual de reparación.
>
> #### Qué es el slop
>
> - Premisa: "suena a IA" es una sensación, no una definición, y una sensación no se puede arreglar. Hace falta una taxonomía mecánica.
> - Seis costumbres:
> 1. Rotación de sinónimos: el mismo objeto recibe tres nombres en un párrafo (user, customer, client) y el lector no sabe si son lo mismo.
> 2. Hedging: verbos auxiliares apilados hasta que no pasa nada ("it's important to note that this may potentially help to improve": cinco verbos, cero acción).
> 3. Nominalización: verbos congelados en sustantivos ("perform an analysis of" en vez de "analyze", "provides assistance" en vez de "help"). Alarga y debilita.
> 4. Adjetivos de marketing: seamless, robust, powerful, cutting-edge. Palabras que afirman calidad en vez de mostrarla.
> 5. Frases interminables: cuatro ideas cosidas con rayas largas y puntos y coma donde debería haber cuatro frases.
> 6. Phrasal verbs blandos y coloquiales: spin up, reach out, dive into.
> - Criterio de utilidad de la lista: cada elemento es un movimiento concreto y nombrable, y lo que se puede nombrar se puede prohibir.
>
> #### Qué es el STE
>
> - Contexto de origen: en los años setenta, la industria aeroespacial europea escribía sus manuales de mantenimiento en inglés, pero la mayoría de los mecánicos que los leían en el mundo no eran hablantes nativos. Una instrucción mal leída en un avión mata.
> - Respuesta del sector: una versión contractual del inglés. No una guía de estilo, sino una especificación. Primera publicación en 1986.
> - Versión vigente: issue 9, enero de 2025. 434 páginas. Descarga gratuita desde el sitio oficial.
> - Dos partes: (1) reglas de escritura y procedimientos; (2) diccionario de unas 900 palabras aprobadas, donde cada palabra tiene exactamente un significado y una función gramatical.
> - Ejemplos del diccionario: "fall" solo significa caer por gravedad, no disminuir. De los cinco sinónimos de empezar solo sobrevive "start"; begin, commence, initiate y originate quedan fuera. Con esto, la rotación de sinónimos muere por diseño.
> - Dato de difusión: hoy el 64% de quienes solicitan el estándar están fuera del sector aeroespacial y de defensa.
>
> #### Regla por regla
>
> - Rotación de sinónimos: regla 1.11 (un nombre por cosa) más el diccionario de un solo significado.
> - Hedging: regla 3.4, prohibidas las construcciones verbales complicadas.
> - Nominalización: regla 3.7, usa un verbo para una acción, no un sustantivo. "Perform an analysis" es ilegal; "analyze" es la norma.
> - Adjetivos de marketing: no están en el diccionario. "Seamless" no es palabra aprobada, así que no se puede escribir.
> - Frases interminables: topes duros. Regla 5.1, una instrucción admite 20 palabras como máximo; regla 6.3, una frase descriptiva 25. El punto y coma queda prohibido.
> - Phrasal verbs: regla 9.3. "You remove the panel", no "you take it off".
> - Observación central: el STE no se diseñó para IA. Se diseñó hace 40 años para eliminar la ambigüedad ante un lector humano bajo presión. El slop es ambigüedad con buena postura, así que la cura ya existía, hecha para otro paciente.
>
> #### Antes y después
>
> - Tarea de prueba: escribir la introducción de un README para una librería de caché.
> - Versión sin sistema de escritura: frase única y larga, raya larga incluida, cierre con "designed to slot into your existing stack with minimal friction and no lock-in". Cuatro fórmulas de marketing seguidas.
> - Versión con el estándar cargado: frases cortas, voz activa, una idea por frase, nada que descifrar.
> - Resultado más llamativo, un mensaje de error: la versión con STE dice lo mismo con un 41% menos de palabras y saca cero faltas en el linter. Todo lo eliminado era slop; nada de lo eliminado era información.
>
> #### La evidencia con lectores humanos
>
> - Estudio más sólido citado: Chervak, Drury y Ouellette (1996). 175 técnicos de mantenimiento aeronáutico con fichas de trabajo reales, unas en inglés normal y otras en inglés simplificado.
> - Resultados: comprensión del 76% al 86%. En hablantes no nativos, del 69% al 87%: la restricción sube a los lectores que peor lo tenían hasta el nivel de los nativos.
> - Estudio mayor: Microsoft Research (2007). 520 frases traducidas a chino, francés, neerlandés y árabe. Las versiones controladas ganan en los cuatro idiomas, con probabilidad de azar por debajo de 1 entre 1.000. La regla más eficaz de sus datos fue eliminar el lenguaje florido e informal.
> - Matices que el autor recoge: las ganancias en traducción son reales pero pequeñas (unas dos décimas sobre una escala de 4 puntos); un estudio de Airbus encontró que simplificar de más puede ralentizar al lector; todos los estudios miden comprensión, no memoria. Nadie ha demostrado que el texto en STE se recuerde mejor, solo que se entiende mejor.
>
> #### La prueba
>
> - Hueco que ataca el experimento: toda la evidencia anterior trata de manuales de aviación y escritores humanos. Nadie había probado el estándar sobre texto generado por IA. La afirmación viral era una suposición por analogía.
> - Diseño: 6 tareas reales de desarrollo (README, descripción de pull request, documentación de API, mensaje de error, guía de primeros pasos, aviso de obsolescencia) x 4 condiciones (baseline sin sistema, lista de palabras prohibidas, seis reglas de Orwell, skill de STE) x 2 modelos.
> - Medición: linter propio que cuenta palabras por frase, puntos y coma, voz pasiva, phrasal verbs y adjetivos de marketing. Métrica: faltas por 100 palabras; menos es mejor.
> - Resultados en Claude: baseline 4,36; palabras prohibidas 4,21 (-3%); Orwell 2,48 (-43%); STE 1,12 (-74%).
> - Dato más revelador: la lista de palabras prohibidas sí redujo las rayas largas de seis a una, porque era la única instrucción dada, y el nivel general de slop no se movió. Se prohíben las rayas largas y se obtiene un párrafo igual de malo sin rayas largas.
> - Resultados en GPT-5.5: el STE sigue reduciendo el slop a la mitad (-50%), pero la lista de palabras prohibidas funciona (-40%) y Orwell empata con el STE. El 3% de Claude era una curva de ese modelo, no una ley.
> - Diferencia entre modelos: el slop de Claude es llamativo (rayas largas, "seamless", frases larguísimas); el de GPT es discreto (frases limpias pero demasiado largas y demasiado pasivas). Mismo problema, síntomas distintos.
> - Hallazgo que sobrevive a los dos modelos: dale al modelo un sistema de escritura real y el slop cae a la mitad o más, siempre y en todos los modelos probados. El STE fue el mejor o empató como mejor. Prohibir palabras de una en una es la versión menos fiable de la idea correcta.
> - Advertencia metodológica: el linter no es el estándar completo. El propio grupo que mantiene ASD-STE100 afirma que ningún software puede certificar el cumplimiento total, porque algunas reglas exigen que una persona juzgue si la frase tiene sentido. Pero las reglas de juicio no son las reglas del slop: el slop es mecánico y lo mecánico se comprueba con un script.
> - Precedente: Boeing distribuye un corrector de inglés simplificado con un parser de unas 350 reglas desde 1990 aproximadamente. La escritura verificada por máquina es una categoría resuelta y probada; lo nuevo es apuntarla a otro problema.
>
> #### Cómo lo usa el autor
>
> - Descartado: pegar las 434 páginas en el modelo. El estándar tiene derechos de autor y las 900 palabras del diccionario consumirían el contexto sin ganancia. La vía es destilarlo.
> - Skill propia con dos modos:
> - Modo estricto: para procedimientos y mensajes de error, donde una lectura equivocada cuesta dinero o seguridad. Reglas completas y topes duros de longitud.
> - Modo con sabor a STE: para prosa normal. Mantiene la disciplina de frase y de párrafo y la prohibición de phrasal verbs, pero suelta el diccionario cerrado, porque un artículo necesita rango y no un trasplante de personalidad.
> - Alternativa más ligera mencionada en el hilo: un conjunto de reglas propio y corto (un ingeniero afirma obtener el 90% del beneficio con unas pocas). El estándar es una opción, no la única; lo que funciona es tener un conjunto de reglas corto y verificable.
> - Referencia existente: caveman, una skill con la misma lógica publicada meses antes y ya adoptada.
> - Advertencia central: el STE arregla la forma del slop, no su fondo. Un linter convierte un párrafo hueco en un párrafo hueco limpio, seguro y bien puntuado; no lo hace verdadero. El slop son dos problemas con un mismo nombre: escribir mal y no tener nada que decir. Esto solo resuelve el primero.
>
> #### El veredicto
>
> - Respuesta a la pregunta del título: sí, un estándar de mantenimiento aeronáutico de 1986 cura la forma del slop, mejor que cualquier otra cosa probada. El motivo no es casualidad: el slop es ambigüedad y el STE son 40 años de ingeniería dirigida contra la ambigüedad.
> - Límites de uso: no hace buena la escritura, solo la deja sin slop. Debe mantenerse lejos de todo lo que necesite voz propia. Aplicarlo a textos de marketing es como aplicar una especificación de par de apriete a un poema.
> - Dominio recomendado: documentación, pull requests, mensajes de error y salida de agentes, donde la claridad invisible es todo el trabajo.
> - Conclusión general por encima del estándar concreto: el AI slop no se arregla prohibiendo palabras de una en una, sino dando al modelo un sistema contra el que pueda comprobarse a sí mismo. Orwell es un sistema; el STE es uno más estricto y comprobable; una configuración de diez líneas es uno más pequeño. La instrucción es elegir uno y convertirlo en una prueba que el resultado tiene que pasar.
> [!note]- Reflexiones de Plinio
>
> #### La afirmación
>
> El vídeo arranca con dos párrafos que dicen lo mismo y suenan distinto, y esa comparación hace un trabajo que ninguna definición abstracta consigue. Interesa el criterio que el autor coloca al principio y del que no se aparta: solo valen las reglas que un script puede comprobar. Ese filtro deja fuera casi todo el debate sobre estilo y buen gusto, y explica por qué el resto del vídeo puede medir en vez de opinar. Es también un aviso sobre el alcance: lo que no se puede contar, aquí no entra.
>
> #### Cómo empezó esto
>
> Merece atención la escalera de respuestas: alguien pregunta, otro señala que prohibir palabras no ataca la causa, y un tercero aporta un estándar publicado con cuarenta años de uso. La cadena muestra algo del momento actual, y es que hay una cantidad enorme de conocimiento ya establecido esperando a que alguien lo conecte con los modelos. El trabajo de traer una especificación de 1986 a un problema de 2026 no exigió inventar nada, solo reconocer el parecido.
>
> #### Qué es el slop
>
> Convertir una sensación en seis categorías contables es el movimiento que hace posible todo lo demás. Mientras "suena a IA" siguió siendo una impresión, el remedio disponible era la lista de palabras prohibidas, que ataca ejemplos en vez de causas. Con la taxonomía delante se ve por qué esa lista falla: prohíbes una palabra y el modelo elige otra de la misma familia, porque el problema estaba en la familia. Cualquiera que quiera montar controles de calidad sobre salida de IA, en escritura o en otra cosa, tiene aquí el patrón a seguir.
>
> #### Qué es el STE
>
> Lo llamativo del estándar no son sus reglas sino su origen. Nació donde la ambigüedad tenía consecuencias físicas, y eso obligó a un rigor que ninguna guía de estilo corporativa alcanza. El diccionario de una palabra por significado resulta brutal para un lector acostumbrado a la riqueza del idioma, y es exactamente la restricción que hace el texto verificable. El dato de que dos tercios de las solicitudes vengan de fuera de la aeronáutica sugiere que muchos sectores llevan tiempo buscando algo así sin encontrarlo.
>
> #### Regla por regla
>
> La correspondencia entre las seis costumbres del slop y las reglas del estándar es el hallazgo del vídeo, y funciona porque ambas listas describen el mismo fenómeno desde extremos opuestos: una lo padece, la otra lo previene. Que un documento redactado para mecánicos en los años ochenta cubra punto por punto los defectos de un modelo de lenguaje de 2026 dice algo sobre la naturaleza del problema. No es un defecto de la IA, es un defecto del lenguaje impreciso, y la IA lo reproduce a escala porque aprendió de textos que ya lo tenían.
>
> #### Antes y después
>
> El ejemplo del mensaje de error, con un 41% menos de palabras y ninguna pérdida de información, es la demostración más útil para quien tenga que convencer a alguien en su empresa. Deja ver que la longitud del texto generado por IA no es riqueza sino relleno, y que el recorte no cuesta contenido. Conviene notar que el propio autor elige mostrar un caso favorable; la comparación cambia cuando el texto de partida ya está bien escrito.
>
> #### La evidencia con lectores humanos
>
> Aquí el vídeo se separa del contenido habitual sobre IA, porque va a buscar estudios y luego cuenta las partes que le estropean el argumento. La subida de comprensión en lectores no nativos, de 69 a 87, es un dato que debería interesar a cualquier empresa que escriba documentación para equipos repartidos por varios países. Las advertencias también valen: mejoras pequeñas en traducción, riesgo de simplificar de más, y ninguna prueba sobre memoria. La distancia entre 1996 y hoy no es menor, y quien quiera apoyarse en esta evidencia debe saber que trata de personas escribiendo para personas.
>
> #### La prueba
>
> El experimento es pequeño pero está bien planteado, y su resultado más valioso no es el 74% sino el contraste entre modelos. Que Claude y GPT respondan distinto a la misma instrucción, y que produzcan slop de tipos diferentes, complica cualquier receta universal de escritura con IA. Para quien trabaje con varios modelos, la consecuencia práctica es que hay que medir en el modelo que se usa y no fiarse del número que publicó otro. El dato de las rayas largas, que bajan mientras el resto no se mueve, describe con precisión lo que ocurre cuando se optimiza una métrica en lugar del objetivo.
>
> #### Cómo lo usa el autor
>
> La decisión de destilar el estándar en dos modos, en vez de cargarlo entero, es la parte más aprovechable del vídeo para el trabajo diario. Reconoce que el rigor máximo tiene un coste y que no todos los textos lo necesitan, y ese reparto entre lo que exige exactitud y lo que exige voz es una decisión de diseño que cada equipo tendrá que tomar por su cuenta. La advertencia sobre forma y fondo debería ir por delante de cualquier adopción: un sistema de escritura mejora la entrega, y no sustituye al pensamiento que debía haber detrás. Un texto limpio y vacío puede resultar más engañoso que uno confuso, porque su apariencia de rigor desarma la sospecha del lector.
>
> #### El veredicto
>
> La conclusión que el autor coloca por encima del estándar concreto es la que sobrevivirá a este vídeo: cualquier sistema comprobable funciona mejor que una lista de prohibiciones, porque el modelo puede evaluarse contra él antes de entregar. Eso convierte la calidad de la escritura en algo parecido a un test que se pasa o se falla, y encaja con la dirección general del trabajo con agentes, donde los criterios explícitos rinden más que las instrucciones sueltas. La limitación de dominio también es seria: aplicado a un texto que necesita voz, este método produce corrección sin nada dentro.
> [!tip]- Sigue por esta web
> - [[Posts/2026.07/10-Modo-cavernicola|El modo cavernícola para ahorrar tokens]] - La misma idea aplicada por otro camino: un prompt corto que convierte al asistente en cavernícola listo y le quita el relleno. El vídeo cita caveman como ejemplo de conjunto de reglas ligero.
> - [[El Abismo de Máquina/Prompts/Comportamiento/Directiva-modo-cavernicola|Directiva - Modo cavernícola]] - El prompt listo para copiar, con tres niveles de compresión. Si quieres probar la idea del vídeo esta tarde y sin instalar nada, empieza por aquí.
> - [[Posts/2026.01/14-AI-Slop-vs-Workslop|AI Slop vs. AI Workslop]] - Las definiciones de los dos problemas, que se confunden a menudo. Este vídeo ataca el primero, el de la forma del texto.
> - [[Posts/2026.01/17-Newsletter-AI-slop-y-ai-workslop|Newsletter: AI Slop, AI Workslop y la falsa promesa de la productividad]] - El recorrido largo por qué le pasa esto a las empresas por dentro: ruido, pérdida de criterio y productividad aparente.
> - [[Posts/2026.06/27-Doc-nadie-escribe-nadie-lee|Documentación que nadie ha escrito y que nadie va a leer]] - El destinatario natural de un estándar como este. Antes de limpiar la forma de la documentación conviene preguntarse si alguien la va a leer.
> - [[Posts/2025.10/12-AI-Slop-y-fuentes|Vídeo - AI Slop, el problema del contenido basura en Internet]] - El problema visto desde arriba, con Kurzgesagt: qué pasa cuando el slop deja de ser un defecto de estilo y se convierte en la mayor parte de lo que se publica.
> - [[El Abismo de Máquina/Ecos/2026.07/Eco-Entender-Nuevo-Cuello-Botella|Eco: Vídeo - Entender es el nuevo cuello de botella]] - Geoffrey Litt sobre por qué los agentes verifican solos pero no entienden por ti. El complemento de fondo a un vídeo que arregla la superficie.
> [!tip]- Para tirar del hilo en Internet
> - [ep01 - the cure for AI slop (skill, linter y datos)](https://github.com/woosal1337/blog/tree/main/videos/ep01-the-cure-for-ai-slop) · Vusal Ismayilov, GitHub - Todo el material del vídeo: la skill destilada, el linter y cada número del experimento. Si solo abres un enlace de esta lista, que sea este.
> - [ASD-STE100 Simplified Technical English, Issue 9](https://www.asd-ste100.org/STE_downloads.html) · ASD-STEMG - El estándar original, gratuito. Aviso: no hay descarga directa, se pide por formulario. Issue 9 es de enero de 2025 y desde ese año es norma internacional.
> - [Qué es el STE, en la web oficial](https://www.asd-ste100.org/about_STE.html) · ASD-STEMG - Las 53 reglas y el diccionario explicados por quienes lo mantienen, sin pasar por la lectura del documento entero.
> - [Field Evaluation of Simplified English for Aircraft Workcards](https://www.researchgate.net/publication/288495167_Simplified_English_for_Aircraft_Workcards) · Chervak, Drury y Ouellette, HFES 1996 - El estudio con 175 técnicos que cita el vídeo. La fuente primaria de la subida de comprensión en lectores no nativos.
> - [Impact of Controlled Language on Translation Quality and Post-editing](https://www.microsoft.com/en-us/research/wp-content/uploads/2007/10/MTS-2007-Aikawa.pdf) · Aikawa et al., Microsoft Research 2007 - El estudio grande de las 520 frases en cuatro idiomas. Las ganancias son reales y pequeñas; conviene leerlo antes de citarlo de oídas.
> - [Politics and the English Language](https://www.orwellfoundation.com/the-orwell-foundation/orwell/essays-and-other-works/politics-and-the-english-language/) · George Orwell, 1946 - Las seis reglas que en la prueba quedan a mitad de camino entre no hacer nada y el estándar completo. Ochenta años después siguen funcionando mejor que una lista de palabras prohibidas.
> - [caveman](https://github.com/JuliusBrussee/caveman) · Julius Brussee, GitHub - La skill que el vídeo menciona al final: el conjunto de reglas corto que consigue buena parte del efecto sin estándar de por medio.
> - [Simplified Technical English](https://en.wikipedia.org/wiki/Simplified_Technical_English) · Wikipedia - La historia del estándar desde los años setenta y su recorrido fuera de la aeronáutica, para situarlo antes de entrar en las reglas.
# Contenido original: The cure for AI slop is a 1986 aircraft manual
Fuente: [The cure for AI slop is a 1986 aircraft manual](https://www.youtube.com/watch?v=uJblcC4lKYw)

Everyone is fighting AI slop by banning words. "No em dashes." "Stop saying delve." It does not work - and a viral thread claimed the real fix is a writing standard built for aircraft mechanics in 1986.
So I dug through ASD-STE100 (all 434 pages of it), distilled its rules into an agent skill and a linter, and ran the test nobody had run: 6 real writing tasks x 4 conditions x 2 models.
The skill, the linter, and every number from this video: https://github.com/woosal1337/blog/tree/main/videos/ep01-the-cure-for-ai-slop
The spec (free): https://asd-ste100.org
The thread that started it: @geogristle · @Voxyz\_ai · @mikehostetler
Find me at: https://chele.bi
Chapters:
0:00 The claim
0:46 How this started
2:14 What slop is
3:56 What STE is
5:53 Rule by rule
7:12 Before and after
8:34 The human evidence
10:13 The test
13:44 How I use it
15:11 The verdict
> [!example]- Transcripción completa (automática, en inglés, sin corregir)
>
> #### The claim
>
> **0:06** · The same prompt, same model, two answers. Answer one says, "Designed to slide into your existing stack with minimal friction and no window lock in."
>
> **0:15** · And the answer two says, "A normal cache matches requests by exact text. A small change inverting then causes a cash miss." And one of these is slop. And two million people just watched a thread claimed that the cure is a writing standard built for aircraft mechanics in 1986. And that sounded just absurd enough that I had to shake it myself, too. So, I got the real standard, all 434 pages of it, dug out the rules, gave them to my model, and ran the test nobody had actually run before. Now, here's the output.
>
> **0:44** · At first, the story, because the story is the reason this video exists, too. A few days ago, a post went viral. An account called Joe Gristle asking in plain words, "How do I make AI write technical documentation that doesn't sound like AI?" And it got over 2 million views.
>
> #### How this started
>
> **1:05** · And then a writer called Vox picked it up and made the sharper point. He said, "Stop telling Cloudy, no aim dashes.
>
> **1:13** · Stop banning the word delve." And this is whack-a-ole and you lose. Because the model was never choosing those words on purpose. He never gave it a writing system. So it defaults to the average of the internet and the average of the internet is slope. His fix was George Orwell's six rules for clear writing from 1946.
>
> **1:33** · And then Mike Husteller, a man whose biologist says chief agent officer, quote tweeted the better answer. Just tell the model to always use ASD 100 simplified technical English. A real published international standard. The 53 rules and 900word dictionary built so that an aircraft mechanic never misreads a repair manual because a misread repair manual kills people.
>
> **2:00** · And that was the moment I fell down the rabbit hole and one property decides the whole thing. So keep it in mind the entire way. The rules that matter are machine checkable. A dumb script can verify them and no taste is required.
>
> #### What slop is
>
> **2:14** · Before the fix, we have to be precise about the disease. Sounds like AI is a feeling, not a definition. And you cannot fix a feeling. So the first thing I did was to try to pin slope down mechanically. And everything I kept running into collapses into six habits.
>
> **2:31** · You already know every one of them. One, synonym rotation. The text calls the same thing, three names in one paragraph. The user, the customer, and the client. You're never sure they are the same one person.
>
> **2:47** · Two, hedging. Literal helper verbs stack until nothing happens. It's important to note that this may potentially help to improve. Five verbs and zero work.
>
> **3:00** · Three verbs frozen into nouns that perform an analysis of instead of analyze and provides assistance instead of help. A grammar pupil call it normalization. All you need to know is that it makes sentences longer and weaker. Four, marketing adjectives.
>
> **3:20** · Seamless, robust, powerful, cutting edge, words that claim quality instead of showing it.
>
> **3:28** · Five, run on sentences. Four ideas stitched together with M dashes and semicolons when they should be four sentences.
>
> **3:37** · Six, soft, chatty phrasal verbs. Spin up, reach out, dive into. Now, here's why this list matters. Every one of these is a specific nameable move. And anything you can name, you can ban too.
>
> **3:52** · Now, hold that list. We are about to check it out of rule by rule. So, what is this aircraft standard? Now, I was obviously not around in the late 1970s.
>
> #### What STE is
>
> **4:02** · So, this is a story the way my research tells it. Back then, European aerospace had a deadly problem. Maintenance manuals were written in English, but most of the mechanics reading them around the world were not native English speakers.
>
> **4:16** · And one misread instruction on an aircraft is a funeral. So the industry built a contract version of English, not a style guide, a specification, and first released in 1986.
>
> **4:29** · The current version, issue 9, came out in January 2025, and you can download it for free from the official site. The full document is 434 pages. And I'll be honest with you, I didn't sit down and read every single page. I dug through it and mind out the parts that matter. The rules, the dictionary, and the logic behind them. That took a while, but you will never have to open it. It has two parts. Part one, procedures.
>
> **5:01** · Part two is the part that genuinely surprised me. A dictionary of raft 900 approverts where every word gets exactly one meaning and one grammatical job. Now in SD fall only means to move down by gravity. You are not allowed to use it to mean decrease. And where English gives you five words for one idea st keeps one and the list.
>
> **5:26** · You get start. You do not get begin commence initiate or originate.
>
> **5:33** · Notice what that just did. Synonym rotation. Slope habit number one is dead by design already.
>
> **5:41** · And one more number I found that tells you this thing escaped its cage. Today, 64% of the people requesting the standard or outside aerospace and defense entirely.
>
> #### Rule by rule
>
> **5:53** · Now watch the slope list get executed rule by rule. This mapping is the part of the research that made me up. and synonym rotation killed by rule 1.11.
>
> **6:05** · One name per thing plus the one meaning dictionary. Hedging stacks killed by rule 3.4. No complicated verb constructions.
>
> **6:15** · Frozen verbs killed by rule 3.7. Use a verb for an action not a noun. Perform an analysis is illegal. Analyze is the law. Marketing adjectives. They are simply not in a dictionary. Seamless is not an approved word. You cannot say it.
>
> **6:33** · Ranons killed by hard caps. Rule 5.1, an instruction gets at most 20 words. Rule 6.3, a descriptive sentence gets 25 and the semicolon is banned outright.
>
> **6:46** · Phrasal verbs killed by rule 9.3.
>
> **6:50** · You remove the panel. You do not take it off. And here's the punch line. AC was never designed for AI. It was designed 40 years ago to remove ambiguity for a stressed human reader. AI slop is just ambiguity with good posture. The aerospace industry spent four decades engineering the cure but for a different patient. Let me read you the real thing, not a toy example. Same model, same job.
>
> #### Before and after
>
> **7:18** · Write the intro for caching libraries.
>
> **7:20** · Read me. Here's a default with no writing system. Traditionally, caches miss constantly in LLM workloads because users rarely phrase the same question identically.
>
> **7:33** · This is one word breath with an M dash coming and it closes with designed to slot into your existing stack with minimal friction and no lock in. Four marketing phrases wearing a trench code.
>
> **7:46** · Now the same model with the standard loaded a normal cache matches request by exact text. A small change in wording then calls a cache miss. Flux cache compares the meaning of a new prompt with the prompts already in the cache. A short sentences active voice one ID each nothing to decode at all. And my favorite result was an error message.
>
> **8:10** · The default version hes and pads you have exceeded the limit. This ensures fair access for all users. The SD version said the same thing in 41% fever words and scored a perfect zero on my checker. Everything it deleted was slop.
>
> **8:25** · Nothing it deleted was information. The gap between what you cut and what you lose is the entire game. Now, does control English actually work on human readers or is this just an aesthetic I happen to like? I went to digging for studies and there's a real evidence. I will give it to you straight including the parts that weaken it. The strongest study I found is from 1996 by Sherbach Dury and Wlet.
>
> #### The human evidence
>
> **8:55** · They gave 175 aircraft technicians real maintenance word cards, some in regular English, some in simplified.
>
> **9:04** · Comprehension went from 76% to 86. And for the non-native speakers, the people the standard was built for, it went from 69 to 87. Now listen to that. The constraint pulled the struggling readers up to the native speaker level.
>
> **9:20** · Microsoft Research ran a bigger one in 2007. 520 sentences translated into Chinese, French, Dutch, and Arabic. The controlled versions beat the normal ones in every single language and the odds of that being luck are below one in a thousand and the single most effective rule in their data was cutting flowery in formal phrasing which is almost literally definition of antislap.
>
> **9:47** · Now the honesty those translations gains were real but small about t of a point on a fourpoint scale. An airb study found that oversimplifying can even backfire and slow readers down. Shorter is not always clearer and every study here measures understanding not memory.
>
> **10:04** · Nobody has shown SD text is remembered better only understood better. So use it full clarity. Do not expect magic too.
>
> #### The test
>
> **10:13** · And here's the gap in everything I just told you. All of that evidence is about aircraft manuals and human writers.
>
> **10:20** · Nobody had ever tested the standard on AI output. The viral claim was a guess by analogy. So I ran it. They set up in plain words. Six real writing jobs a developer actually does a readme, a pull request description, API docs, an error message, a getting started guide, and a depreciation notice. Each one generated four ways, a plain baseline, the band words list everyone is using right now.
>
> **10:49** · Orwell's six rules and my STS skill.
>
> **10:52** · Then I wrote a llinter, a small script that counts the mechanical stuff. Words per sentence, semicolons, passive voice, phrasal verbs, marketing adjectives. The score is violations per 100 words and lower is cleaner.
>
> **11:08** · The results on cloudy. The baseline scored 4.36.
>
> **11:13** · The band words list 4.21.
>
> **11:16** · This is a 3% improvement. Three.
>
> **11:19** · Orville's rules 2.48.
>
> **11:22** · down 43% as simplified technical English 1.12 down 74% less than a third of the baseline slop and buried in that data is the most damning number of the whole experiment the band's words list did kill him dashes six down to one because that's the one thing you told it to do and the overall slope barrel moved you banned the m dashes and you got a slope paragraph with no mdash in That's the entire mistake in one data point.
>
> **11:54** · But a result on one model is not a result. So I ran the whole thing again on GP 5.5. And here's the honest part.
>
> **12:03** · SD still cut slope in half minus 50%.
>
> **12:08** · So the core finding holds, but on GPT the band list actually worked minus 40%.
>
> **12:15** · And Orville tied ST there. So that brutal 3% number was a cloud curve not a law of nature.
>
> **12:24** · The two models even slope differently.
>
> **12:27** · Cloud slope is flashy m dashes seamless long runons. But GPT slope is quiet cleaning sentences that are simply too long and too passive. Same this is but with the different symptoms.
>
> **12:42** · The finding that survives both model is narrower and truer. Give the model a real riding system and slope drops by half or more every time on every model I tried. A steel was the best or tight for best. Banning birds one at a time is just a least reliable version of the right idea.
>
> **13:02** · One caveat because it matters. My llinter is not the full standard. The people who maintains SDA say plainly that no software can certify full compliance. Some rules need a human to judge whether a sentence makes sense or not. And they are right actually. But the judgment rules are not the slope rules. Slope is a mechanical stuff. And the mechanical stuff is 100% checkable by a script. And that idea is not even new. From what I found, Boing has shipped a simplified English checker with a 350 rule parser since about 1990.
>
> **13:37** · Machine checked writing is a solved, boring, battle tested category. We just pointed it at a new problem. So how do I actually use this? Not by pasting 434 pages into the model. The standard is copyrighted and 900 dictionary words would burn your context for nothing. You distill it. I built a small skill file with two modes. Strict mode is for procedures and error messages. Anywhere a wrong reading has a cost. It gets the full rules and the hard length caps. SD flavored mode is for normal pros.
>
> #### How I use it
>
> **14:08** · It keeps a sentence discipline, the paragraph discipline and the no phrasal verbs habit but drops a dictionary lock down because a blog post needs range not personality transplant and some smart people think even that is too much. One engineer replied to the thread as SD 100 is a bit too much. I wrote a tiny whale rule set instead 90% of the benefit and he's not wrong and that's the real takeaway. The standard is one option.
>
> **14:39** · A short checkable rule set is a product and this product is actually caveman which has been already implemented a couple of months ago and people have adopted using it too. But burn this caveat in SC fixes the form of slope not the substance. A llinter can turn a hollow paragraph into a clean confident well punctuated hollow paragraph. It cannot make it true. Slope is two problems wearing one code, bad writing and nothing to say. This fixes the first one only.
>
> **15:10** · So the verdict, does a 1986 aircraft maintenance standard cure a slop one form? Yes. Better than anything else I tested and for a reason that is not an accident. Slop is ambiguity and ST is 40 years of engineering aimed directly at ambiguity.
>
> #### The verdict
>
> **15:29** · but it will not make your writing good only unsloppy and keep it away from anything that needs a voice. Running your marketing copy 3 sta is a torque wrench spec applied to a poem. Use it where invisible clarity is the entire job. Docs, pull requests, error messages, agent output and nowhere else.
>
> **15:50** · And honestly, the standard is not even the lesson. The lesson is the thing pointed out and my numbers back up. You will not fix AI writing by banning D of one word at a time forever. You fix it by giving the model a system it can check itself against instead of a blacklist. It will always root around.
>
> **16:07** · Orville is a system. SD is a stricter one you can test as well. A 10 line well config is a smaller one. Pick one, make it a test the output has to pass and stop playing whack mode. Constrain the writer and you free the reader. The aerospace industry figured that out before most of us were born. The skill, the llinter, and every number from this video are linked below. This is the first video on this channel, too. If this is the kind of the test you want more of, you know what to do. See you in the next one.