Combee: Scalable Prompt Learning for AI Language Agents

Discover Combee, a framework that scales parallel prompt learning for self-improving language model agents with up to 17x speedup and high accuracy.

Ensuring Pedagogical Safety in AI Tutoring Systems

Explore how to formalize and detect reward hacking in educational reinforcement learning to improve AI tutoring safety and learning outcomes.

TimeSeek: Evaluating Temporal Reliability of Forecasters

Discover how TimeSeek benchmarks temporal reliability of agentic forecasters in prediction markets, improving accuracy with time-aware strategies.

Evidence Collapse in Multimodal Reasoning: Key Risks & Fixes

Explore evidence collapse in multimodal reasoning models, its risks, and mitigation strategies to improve vision-language model reliability and safety.

SHARP: Hybrid Tool for Reliable Knowledge Graph Verification

Discover SHARP, a hybrid tool using schema-aware planning for accurate and interpretable knowledge graph triple verification with improved reliability.

Popular

Subscribe