UniSE Speech Enhancement
Unified AR-LM-based speech enhancement & separation
None defined yet.
Unified AR-LM-based speech enhancement & separation
Zero-shot TTS with explicit word-level prosody control
Multilingual document image to Markdown OCR
Animate a first frame with Cosmos3-Super I2V (64B, 4-step)
Live multi-step Fara browser-agent loop on real websites
Web computer-use agent โ screenshot + task to next action
Embodied AI VLM for visual grounding and planning
4-class lung ultrasound video classifier with attention
Text-to-image with Microsoft Mage-Flow-Base (4.1B MMDiT)
Persian OCR with Bina 0.1 vision-language model
Temporal reasoning over multi-temporal satellite imagery
3D spatial reasoning VLM with video-diffusion 3D priors
Hierarchical driving world model โ predict future frames
Watch & think simultaneously โ streaming video reasoning
Dense 1.3B embodied video generation โ T2V, I2V, T2I
NVIDIA Cosmos3-Edge โ reason over images & video
Video temporal grounding with TimeLens2-2B
Extract medication/drug entities from clinical text
Clinical lab result entity extraction with Bio_ClinicalBERT
PubMedBERT clinical diagnosis entity extraction NER
Play chess against a tiny reasoning LLM that thinks first
Video temporal grounding with TimeLens2-8B
Clinical entity extraction via Bio_ClinicalBERT spaCy NER
World-state visual QA with BAAI Orca-4B