SensumAI
Multimodalny system terapeutyczny AI analizujący emocje w czasie rzeczywistym przez wideo, audio i tekst
Przegląd projektu
SensumAI to multimodalny system terapeutyczny oparty na sztucznej inteligencji, który analizuje stan emocjonalny użytkownika w czasie rzeczywistym. W przeciwieństwie do tradycyjnych chatbotów, system integruje trzy kanały sensoryczne: Wideo (mimika twarzy), Audio (ton głosu) oraz Tekst (treść wypowiedzi), aby stworzyć holistyczny model psychologiczny rozmówcy (Deep Profiling). Architektura Multi-Agent Swarm zapewnia głębię psychologiczną niespotykaną w prostych wrapperach GPT.
Wyzwanie
Tradycyjne chatboty terapeutyczne bazują wyłącznie na tekście, ignorując kluczowe sygnały niewerbalne stanowiące 93% komunikacji emocjonalnej. Potrzebny był system zdolny do holistycznej analizy użytkownika - łączący to co mówi, jak mówi i jak wygląda podczas mówienia - w czasie rzeczywistym.
- Tekst to tylko 7% komunikacji emocjonalnej
- Synchronizacja 3 strumieni danych w real-time
- Złożoność modeli ML dla audio i wideo
- Latencja przy strumieniowaniu odpowiedzi AI
Rozwiązanie
Zaprojektowałem architekturę hybrydową: Blazor Server jako orkiestrator z mikroserwisami Python dla ML. Kluczowa innowacja to Multi-Agent Swarm - 4 wyspecjalizowane asystenty AI pracujące równolegle: HelenAI (główna persona terapeutyczna), EmoAnalyst (analiza emocji i osobowości), MentalModelAnalyst (12 archetypów mentalnych), TherapistModelAnalyst (strategia terapii). Streaming przez SSE zapewnia efekt pisania na żywo. Face-api.js renderuje siatkę twarzy client-side, odciążając serwer.
Wykorzystane technologie
SensumAI
Rezultaty
Wideo + Audio + Tekst
Swarm Architecture
SSE + SignalR
Masz podobny projekt?
Porozmawiajmy o tym, jak mogę pomóc Twojej firmie osiągnąć podobne rezultaty.
💬 Komentarze (0)
Zostaw komentarz
Bądź pierwszy, który skomentuje!