Un millón de tokens son menos palabras de lo que cree: lo hemos calculado

La objeción surge inevitablemente en cuanto alguien menciona un «segundo cerebro». Los modelos lingüísticos actuales pueden procesar un millón de tokens, y algunos incluso más. Entonces, ¿por qué clasificar, etiquetar y vincular notas cuando se puede simplemente entregar todo el conjunto a la IA?
La respuesta se reduce a una cifra que casi nadie comprueba. Los tokens son los fragmentos en los que un modelo divide el texto, y la unidad por la que se factura. La cantidad de texto que abarca un millón de ellos depende del idioma y del método utilizado para la división, el tokenizador. Por eso lo medimos en lugar de hacer conjeturas.
Cómo realizamos el recuento
Partimos de dos textos con contenido idéntico: las versiones en alemán y en inglés de uno de nuestros propios artículos de revista. La versión alemana tenía 1.134 palabras y la versión inglesa, 1.276. Ambos recuentos abarcan únicamente el cuerpo del texto y los subtítulos, sin incluir pies de foto ni la lista de fuentes. Todo lo que se encuentre entre dos espacios cuenta como una palabra. Ambas versiones se procesaron utilizando la biblioteca js-tiktoken, versión 1.0.20, una vez con la codificación o200k_base que OpenAI utiliza para sus modelos actuales, y otra vez con cl100k_base, la codificación más antigua utilizada por GPT-4 y GPT-3.5.
Top 10 Análisis
» Top 10 Portátiles Multimedia
» Top 10 Portátiles de Juego
» Top 10 Portátiles de Juego ligeros
» Top 10 Portátiles Asequibles de Oficina/Empresa
» Top 10 Portátiles de Juego Ligeros
» Top 10 Portátiles de Oficina/Empresa Premium
» Top 10 Estaciones de Trabajo
» Top 10 Subportátiles
» Top 10 Ultrabooks
» Top 10 Convertibles
» Top 10 Tablets
» Top 10 Tablets Windows
» Top 10 Tablets de menos de 250 Euros
» Top 10 Phablets (>5.5")
» Top 10 Smartphones
» Top 10 Smartphones (≤5")
» Top 10 Smartphones de menos de 300 Euros
» Top 10 Smartphones de menos de 120 Euros
» Top 10 Portátiles de menos de 1000 Euros
» Top 10 Portátiles de menos de 500 Euros
» Top 10 Portátiles de menos de 300 Euros
» Los Mejores Displays de Portátiles Analizados por Notebookcheck
La regla general más citada es que un millón de tokens equivale a 750 000 palabras. En el caso del inglés, esta estimación es demasiado conservadora; en el del alemán, es considerablemente demasiado generosa. La comparación entre las dos codificaciones es más reveladora. El mismo texto en alemán da como resultado 1.747 tokens con uno y 2.088 con el otro. Una diferencia del veinte por ciento, debida únicamente a que la división se realiza mediante un método diferente. El texto en inglés se mantuvo prácticamente sin cambios, con 1.200 frente a 1.202 tokens por palabra. Los avances en los tokenizadores se han centrado casi exclusivamente en idiomas distintos del inglés.
En el caso de Claude y Gemini, no es posible realizar la misma prueba, ya que Anthropic y Google no hacen públicos sus tokenizadores. No obstante, Anthropic señala en su documentación sobre precios que Claude 4.7 y los modelos más recientes utilizan un método diferente que genera aproximadamente un 30 % más de tokens para el mismo texto que sus predecesores. Por lo tanto, las cifras que figuran a continuación son de un orden de magnitud, no un dato exacto.
Qué significa esto para una colección del mundo real
Hemos analizado una colección que ha ido creciendo a lo largo de los años: unas 470 notas, lo que supone entre 350 000 y 400 000 palabras. Esa cantidad cabe, por los pelos, en una ventana de contexto, y sigue creciendo.
Sin embargo, la ventana de contexto se rellena y se vuelve a pagar con cada pregunta. El modelo no retiene la información; lee desde el principio cada vez. Con GPT-5.6 Sol, un millón de tokens de entrada cuesta cinco dólares estadounidenses, y a partir de 272 000 tokens en una sola solicitud, el coste asciende a diez. 400 000 palabras en alemán equivalen aproximadamente a 616 000 tokens, lo que las sitúa en el nivel de precios más elevado, es decir, 6,16 dólares. Por pregunta. Diez preguntas en una tarde suman unos 60 dólares. Notion Business, la suscripción más cara de nuestra comparativa de sistemas, cuesta 19,50 euros al mes por usuario.
Hay dos salvedades. Este cálculo se refiere a la API, la interfaz que utilizan los desarrolladores para dirigirse directamente a un modelo, no a las suscripciones de los usuarios finales. Los usuarios de ChatGPT Plus o Claude Pro no pagan por token, pero acaban alcanzando límites de uso. Y está el almacenamiento en caché. En caso de acierto en la caché, OpenAI y Anthropic cobran solo una décima parte del precio de entrada, lo que convierte los 6,16 dólares en 62 céntimos. Sin embargo, dependiendo de la configuración, la caché solo dura entre cinco minutos y una hora.
Por qué sigue mereciendo la pena clasificar
La cuestión no es que un sistema de notas resulte más económico que la IA. Lo que ocurre es que reduce el volumen de información que debe introducirse en el contexto. Una búsqueda de texto completo adecuada, o un índice semántico que busque por significado en lugar de por palabras clave, proporciona al modelo diez notas relevantes en lugar de cuatrocientas.
Esto convierte 616 000 tokens en aproximadamente 9 000 y 6,16 dólares en cinco céntimos. En cuanto a los tokens, la proporción es de 67 a 1; en cuanto al precio, de 123 a 1, ya que la solicitud reducida se mantiene por debajo del costoso umbral de 272 000 tokens. A esto se suma un efecto que ninguna tabla de precios refleja. Un modelo que lee diez notas relevantes responde con mayor precisión que uno que tiene que procesar cuatrocientas.
El verdadero límite rara vez es la ventana de contexto
Si no trabaja a través de la API, de todos modos se topará con otro obstáculo mucho antes. Con ChatGPT, el número de archivos por proyecto depende del plan: cinco con el plan gratuito, 25 con los planes Go y Plus, y 40 con los planes Pro, Business y los planes educativos. Gemini Notebook permite 50 fuentes por cuaderno en el plan Standard gratuito, 100 en el plan Plus y 300 en el plan Pro. Una sola fuente puede contener hasta 500 000 palabras.
Lo que llama la atención es lo inconsistentes que son estas cifras. OpenAI indica 25 archivos para el plan Plus en su página de ayuda sobre proyectos, pero 20 en la sección de ayuda sobre la subida de archivos, y ambas páginas se actualizaron por última vez la misma semana. Si tiene pensado basarse en ello, compruebe la cifra en su propia cuenta en lugar de fiarse de la documentación.
Esto cambia el enfoque de la cuestión. Lo que determina si se puede realizar una consulta en una colección no es el límite de un millón de tokens, sino si la herramienta la acepta o no. Y ahí es precisamente donde su propio sistema de notas demuestra su utilidad, ya que no selecciona lo que entra, sino únicamente lo que sale.
Lo que se opone a toda la idea
Un «segundo cerebro» sigue requiriendo esfuerzo, y los programas tienen peculiaridades que conviene conocer antes de empezar. Obsidian y Joplin también funcionan en teléfonos, pero no se sincronizan en segundo plano. Obsidian responde a esa pregunta en su propia sección de preguntas frecuentes sobre sincronización con un rotundo «no». Los archivos solo se sincronizan mientras el programa está en ejecución. En un ordenador apenas se nota, ya que la aplicación suele estar abierta. Pero si escribe una nota sobre la marcha, cierra la aplicación con un deslizamiento y esta no llegará a su ordenador hasta que vuelva a abrir la aplicación en su teléfono. Esto se aplica a Obsidian Sync, el servicio propio de pago. Si, en cambio, guarda la carpeta en iCloud o la sincroniza con Syncthing, ese servicio se encarga de ello por usted. Notion limita el tamaño de los archivos individuales a 5 MB en el plan gratuito. Y con Gemini Notebook, Google no ofrece posibilidad de recuperación. Si elimina un cuaderno, las fuentes se pierden con él. Solo las conversaciones de Gemini vuelven a aparecer en la lista de chat.
Por lo tanto, el mejor consejo es recopilar notas durante dos semanas y luego decidir. Si al final tiene treinta notas, no necesita un sistema, sino una carpeta. Si al final tiene trescientas, se dará cuenta por sí mismo de lo que le falta cuando realice una búsqueda.
Fuente(s)
OpenAI: Tarifas de la API, Anthropic: Tarifas de modelos y funciones, js-tiktoken 1.0.20, Notion: Planes de precios, Notion: Imágenes, archivos y archivos multimedia, Obsidian: Preguntas frecuentes sobre la sincronización, Joplin: Sincronización, Google: Límites de los cuadernos de Gemini, Google: Eliminación de cuadernos, OpenAI: Proyectos en ChatGPT, OpenAI: Preguntas frecuentes sobre la carga de archivos



