Submitted by Wanli Li 107 WeaveBench: A Long-Horizon, Real-World Benchmark for Computer-Use Agents with Hybrid Interfaces Microsoft 162 2
Submitted by Rui Yang 22 OpenWebRL: Demystifying Online Multi-turn Reinforcement Learning for Visual Web Agents Microsoft 38 3
5 Beyond Static Dialogues: Benchmarking Realistic, Heterogeneous, and Evolving Long-Term Memory Microsoft 12
Submitted by Jinjing Zhao 111 Lens: Rethinking Training Efficiency for Foundational Text-to-Image Models Microsoft 4
Submitted by Miaosen Zhang 16 Covering Human Action Space for Computer Use: Data Synthesis and Benchmark Microsoft 36 2
Submitted by Baolin Peng 21 Synthetic Computers at Scale for Long-Horizon Productivity Simulation Microsoft 2
Submitted by Sebastian Ehlert 6 Accurate and scalable exchange-correlation with deep learning Microsoft 244 2
Submitted by tan 4 Contrastive Attribution in the Wild: An Interpretability Analysis of LLM Failures on Realistic Benchmarks Microsoft 3 2
Submitted by Aditya Kanade 8 Faithful GRPO: Improving Visual Spatial Reasoning in Multimodal Language Models via Constrained Policy Optimization Microsoft 2
Submitted by ZHOU 5 AVGen-Bench: A Task-Driven Benchmark for Multi-Granular Evaluation of Text-to-Audio-Video Generation Microsoft 25 2
Submitted by Haozhe Qi 7 AdaptToken: Entropy-based Adaptive Token Selection for MLLM Long Video Understanding Microsoft 4 2