TERMINAL.OS — Système d’exploitation holographique & Interface gestuelle/vocale

25 sept. 2026

TERMINAL.OS est un projet d'expérimentation technologique explorant les interfaces utilisateur naturelles (NUI) sans périphérique physique traditionnel. Pensé comme un cockpit tactique immersif façon science-fiction, le système transforme une simple webcam en capteur spatial pour piloter un environnement complet uniquement grâce aux mouvements de la main. Développé sous Python, le projet fait dialoguer du tracking squelettique en temps réel (OpenCV, MediaPipe), des calculs matriciels de projection 3D (NumPy), une interface plein écran réactive (CustomTkinter) et un assistant vocal en arrière-plan connecté au modèle de langage Llama 3 exécuté localement via Ollama. L'application intègre également une détection matérielle multi-écrans native pour déporter l'espace interactif sur un second moniteur sans interruption.

TERMINAL.OS — Système d’exploitation holographique & Interface gestuelle/vocale

25 sept. 2026

TERMINAL.OS est un projet d'expérimentation technologique explorant les interfaces utilisateur naturelles (NUI) sans périphérique physique traditionnel. Pensé comme un cockpit tactique immersif façon science-fiction, le système transforme une simple webcam en capteur spatial pour piloter un environnement complet uniquement grâce aux mouvements de la main. Développé sous Python, le projet fait dialoguer du tracking squelettique en temps réel (OpenCV, MediaPipe), des calculs matriciels de projection 3D (NumPy), une interface plein écran réactive (CustomTkinter) et un assistant vocal en arrière-plan connecté au modèle de langage Llama 3 exécuté localement via Ollama. L'application intègre également une détection matérielle multi-écrans native pour déporter l'espace interactif sur un second moniteur sans interruption.

CLIENT

Projet Personnel

CLIENT

Projet Personnel

Role

Creative Technologist & Développeur Python

Role

Creative Technologist & Développeur Python

Service

Computer Vision (OpenCV / MediaPipe), Conception d'interfaces NUI / HUD, Calculs géométriques 3D (NumPy), Intégration IA locale (Ollama / LLM), Reconnaissance vocale

Service

Computer Vision (OpenCV / MediaPipe), Conception d'interfaces NUI / HUD, Calculs géométriques 3D (NumPy), Intégration IA locale (Ollama / LLM), Reconnaissance vocale

Parallax image
Parallax image

Vision par ordinateur, grammaire de gestes & immersion 3D temps réel

Vision par ordinateur, grammaire de gestes & immersion 3D temps réel

Le cœur du système repose sur une boucle principale cadencée à 30 ms qui traite les flux de la webcam et extrait en direct les 21 points anatomiques clés de la main grâce à MediaPipe. Pour remplacer la souris et le clavier, j'ai modélisé une grammaire gestuelle complète : l'index pointé guide le curseur avec amortissement cinétique pour stabiliser la visée, le pincement (pinch) gère le clic ou le tracé continu en mode dessin, la paume ouverte commande le zoom dynamique, tandis que le poing fermé agit comme une commande de secours pour revenir instantanément au hub central.

Les modules 3D — du nuage de 100 cubes filaires (Neural Matrix) au puzzle volumique (Assembly) — ne reposent sur aucun moteur de jeu tiers : toutes les projections perspectives et rotations sont calculées dynamiquement à la volée via des matrices NumPy. Dans le mode d'assemblage, l'utilisateur manipule cinq composants géométriques distincts (processeur, mémoires, liaisons synaptiques) dotés d'un algorithme de magnétisme (snap automatique), déclenchant des ondes de choc, des flux d'énergie lumineux et des gerbes de particules dès qu'une connexion spatiale est validée.

Détection multi-moniteurs native & intelligence artificielle vocale embarquée

Détection multi-moniteurs native & intelligence artificielle vocale embarquée

Afin de renforcer la dimension professionnelle et immersive du dispositif, j'ai implémenté une gestion matérielle multi-écrans via la bibliothèque screeninfo. Le système détecte automatiquement la présence d'un affichage secondaire : si deux moniteurs sont branchés, le tableau de bord de télémétrie et de contrôle reste ancré sur l'écran principal, tandis que les espaces interactifs (scènes 3D, canvas laser, zone d'assemblage) basculent automatiquement en mode plein écran sans bordure sur le second moniteur, offrant une surface d'interaction dégagée et immersive.

En parallèle, un thread audio tourne en continu en tâche de fond pour écouter les ordres de l'utilisateur via reconnaissance vocale. Dès que le mot-clé d'activation « Jarvis » est prononcé, le système analyse la requête : il pilote directement l'OS pour changer d'espace de travail ou transmet la consigne au modèle open-source Llama 3:8B, hébergé en local via Ollama. La réponse générée est retranscrite dans le journal de bord de l'interface et oralisée instantanément par un moteur de synthèse vocale asynchrone, concrétisant une interaction humain-machine multimodale fluide et totalement autonome.