Experimento · Visión por computadora
Escalada 3D
Filmé con el celular un pegue en la palestra y lo pasé por una cadena de modelos de visión. De 42 segundos de video salen la pared en 3D con sus presas, mi cuerpo con 24 articulaciones en 417 posiciones y una línea de tiempo para recorrerlo desde cualquier ángulo, o al lado del video, cuadro a cuadro. Mientras sube, muestra la altura del cuerpo, cuánto se dobla cada articulación y cuántos kilos hace cada brazo.
- 1 video de celular
- 417 posiciones
- Pared a 1 mm por píxel
- Fuerza de cada brazo
// cómo se hizo
De un video a 3D
- 1
Desde dónde filmaba
Del video salen 10 cuadros por segundo. COLMAP los compara entre sí y calcula la lente del celular y desde dónde filmaba en cada uno.
- 2
La pared en 3D
Depth Anything 3 estima la profundidad; sin las personas (las recorta YOLO) se funde en una malla. Cada punto toma el color de los cuadros que lo ven más de cerca y más nítido.
- 3
El cuerpo
NLF estima 24 articulaciones en cada cuadro, en el mismo espacio que la pared. Se escala a mi altura y se corrige para que manos y pies apoyen en las presas sin atravesarlas.
- 4
Apoyos y fuerza
Una mano o un pie quieto junto a la pared cuenta como apoyo. Mi peso, más lo que acelera el cuerpo, se reparte entre los apoyos de la forma que menos esfuerzo pide.
La fuerza de cada brazo no se mide: se estima con mi peso (90 kg) y la postura. Con los brazos estirados se cuelga más de las manos; con las piernas estiradas, se carga más en los pies. Es un orden de magnitud, con unos 10 a 15 kg de margen.
Los controles
- Seguir / Libre / Celular
- La cámara: acompaña al escalador mientras sube, queda donde la dejes o mira desde el celular.
- Lado a lado
- La reconstrucción al lado del video, cuadro a cuadro.
- Capas
- Pared, cuerpo, esqueleto, recorrido de manos y pies, el celular y el video.
- Línea de tiempo
- Play, velocidad y paso a paso. Los carriles marcan cuándo apoya cada mano y cada pie.
Arrastrá para girar, rueda o pellizco para acercar y rueda apretada o clic derecho para desplazarte. Con teclado: espacio, flechas, F, C y V.
Créditos
- Cámaras: COLMAP — Schönberger y Frahm (BSD).
- Profundidad: Depth Anything 3 — ByteDance Seed (uso no comercial).
- Cuerpo: NLF, Neural Localizer Fields — Sárándi y Pons-Moll, sobre SMPL (uso no comercial).
- Personas: YOLO11 — Ultralytics (AGPL-3.0).
- Malla y textura: Open3D y xatlas (MIT).
- 3D: three.js (MIT).
Todo sale de un solo video de celular, sin sensores: es una reconstrucción, no una medición.
¿Querés ver otras? Todas las apps →