---
title: "Qué formatos entran y cómo se ancla cada cita"
description: "PDF digitales y escaneados, fotos, EPUB, Word, presentaciones, hojas de cálculo, audio, vídeo, webs, YouTube y pódcast. Para cada uno, cómo se lee y qué ancla queda: folio impreso, segundo, diapositiva, filas o párrafo."
url: https://scholaris.joseluissaorin.com/saber/formatos
markdown: https://scholaris.joseluissaorin.com/saber/formatos.md
lang: es
alternate_en: https://scholaris.joseluissaorin.com/en/knowledge/formats.md
updated: 2026-10-06
author: José Luis Saorín Ferrer (https://joseluissaorin.com)
---

# Qué formatos entran y cómo se ancla cada cita

> PDF digitales y escaneados, fotos, EPUB, Word, presentaciones, hojas de cálculo, audio, vídeo, webs, YouTube y pódcast. Para cada uno, cómo se lee y qué ancla queda: folio impreso, segundo, diapositiva, filas o párrafo.

## Cómo entra un fichero

Todo pasa primero por la **imprenta**, el conversor de Scholaris. Reconoce el tipo por los primeros bytes del fichero (después por el tipo MIME y, por último, por la extensión), y lo convierte en tu propio navegador siempre que puede. Lo que el navegador no sabe hacer (decodificar ciertas imágenes, sacar fotogramas de un vídeo, convertir una presentación de Keynote) lo hace un contenedor en el servidor con ffmpeg y LibreOffice.

Después, lo que hay que leer con los ojos (páginas escaneadas, fotos, diapositivas) lo lee un modelo de visión, cuatro páginas por petición, y lo que hay que oír lo transcribe un modelo de voz. Qué proveedor hace cada cosa está en [Privacidad](https://scholaris.joseluissaorin.com/saber/privacidad.md).

## Formatos y anclas

| Lo que subes | Extensiones | Cómo se lee | Ancla y cómo se cita |
| --- | --- | --- | --- |
| PDF digital | pdf | La capa de texto, con sus líneas y bloques; cabeceras y pies aparte; se usan las etiquetas de página del propio PDF, su índice y sus metadatos | Página impresa: «p. 23», «pp. 23-24», «p. xiv» |
| PDF escaneado o con un OCR antiguo | pdf | Visión: cada página como imagen. Si el PDF trae un OCR viejo de mala calidad, se vuelve a leer | Página impresa, o la física entre corchetes: «p. [12]» |
| Fotos de un libro | jpg, png, webp, gif, tiff, heic, bmp, avif | Se ordenan por nombre en orden numérico (IMG_2 antes que IMG_10), se enderezan y se recortan los bordes vacíos | Página impresa de cada foto |
| Textos | docx, odt, rtf, html, md, txt | Bloques (títulos, párrafos, listas, citas, tablas, notas) con su ruta de títulos | Sección y párrafo: «Introducción, párr. 4» |
| EPUB | epub | El orden de lectura, el índice y, sobre todo, la lista de páginas impresas si el EPUB la trae | «p. 23» si hay lista de páginas; si no, «párr. N» |
| Presentaciones | pptx, odp, key | Texto y notas del orador de cada diapositiva; ODP y Keynote se convierten enteras con LibreOffice | «diap. 7» |
| Hojas de cálculo | xlsx, xls, ods, csv, tsv | Tablas en trozos de 50 filas, con la cabecera repetida en cada trozo | «Hoja1, filas 2-51» |
| Audio | mp3, wav, m4a, ogg, opus, flac, aac | Transcripción palabra a palabra, con quién habla; tramos citables de 30 a 60 segundos que acaban en final de frase | «12:04», «1:02:03», «12:04-12:40» |
| Vídeo | mp4, mov, webm, mkv, avi | El audio como arriba; además, fotogramas en cada cambio de escena (o cada 20 segundos) que también se pueden buscar | Igual que el audio |
| Una web | URL | Se guarda una copia fechada y se parte el artículo en bloques | Sección y párrafo, con la fecha de consulta |
| YouTube | URL | No se descarga: Gemini ve el vídeo desde la dirección, en tramos de diez minutos | El segundo |
| Vimeo, pódcast, enlaces a audio | URL | Vimeo, el fichero progresivo más pequeño; un pódcast, el audio de su RSS | El segundo |
| SPDF y paquetes .scholaris | spdf, scholaris | No se vuelve a leer nada: se copian el texto, las anclas y los vectores | Las anclas que traía |

## El folio impreso

El número que importa en una nota al pie es el que está impreso en el papel, no la posición de la página en el fichero. Un libro puede empezar en romanos, saltarse láminas sin numerar o tener dos páginas por imagen. Para cada página, Scholaris junta varias pruebas:

1. las etiquetas de página del propio PDF, si las tiene;
2. los números candidatos de la cabecera, del pie y de los bordes del texto, y lo que vio el lector de visión;
3. la secuencia coherente más larga de esas lecturas;
4. en los casos dudosos, un juez (Jev, de TypeSafe) que decide entre candidatos;
5. y, para las páginas sin número visible, interpolación dentro de cada tramo.

Reconoce números romanos (con la página en que se pasa a arábigos), foliación por hojas («23r», «23v»), escaneos a doble página, láminas sin numerar y años que no son folios. Cada página guarda de dónde salió su número (leído, deducido, del EPUB o ninguno) y con qué confianza. **Si un libro no imprime ningún número, no se inventa ninguno:** se cita la posición física entre corchetes.

En el banco de pruebas, los 64 folios comprobados a ojo salieron exactos (ver [Rendimiento](https://scholaris.joseluissaorin.com/saber/rendimiento.md)).

## La ortografía original se respeta

El lector transcribe con fidelidad: no moderniza «dixo», «assi» o «muger», mantiene u/v, i/j/y y ç, no corrige erratas y deja fuera del cuerpo los titulillos, los reclamos y las signaturas. La única excepción es la s larga (ſ), que se escribe «s». Para que esas grafías se encuentren al buscar existe una capa aparte, explicada en [Búsqueda](https://scholaris.joseluissaorin.com/saber/busqueda.md).

## Límites de tamaño

| Plan | Fichero más grande | Almacenamiento |
| --- | --- | --- |
| Gratis | 200 MB | 1 GB |
| Pro | 4 GB | 100 GB |
| Versión local | 16 GB | el de tu disco |

Por la API v1 en la nube caben ficheros de hasta 95 MB en una sola petición; para más, la aplicación y el SDK de Python suben por partes. No hay una duración máxima para audio y vídeo más allá del tamaño del fichero.

## Lo que todavía no va bien

- Los .doc antiguos de Word no tienen un lector propio: conviértelos a .docx antes de subirlos.
- Vimeo solo funciona cuando el vídeo ofrece un fichero descargable; si no, bájalo y súbelo.
- Las anclas de una web son de párrafo: si la página cambia después, la copia fechada que guardamos es la que manda.
