Empirical Audit of Instructed Code-Editing Benchmarks

Discover key insights from an empirical audit of code-editing benchmarks to improve LLM evaluation and real-world coding assistant performance.

OmniScore: Reliable Metrics for Multilingual Text Evaluation

Discover OmniScore, deterministic metrics offering cost-effective, reproducible evaluation for multilingual generative text beyond LLM-based judging.

Nidus: AI-Assisted Engineering with Externalized Reasoning

Discover Nidus, a governance runtime that externalizes reasoning to enhance AI-assisted engineering, ensuring reliable and compliant software delivery.

Privacy-Preserving Graph Learning for Metal 3D Printing

Discover FI-LDP-HGAT, a novel privacy method enhancing graph learning utility in metal additive manufacturing defect detection.

AutoLALA: Optimize Data Locality for AI & HPC Loops

AutoLALA analyzes data locality in AI and HPC loop programs, improving performance by reducing costly data movement with symbolic reuse distance analysis.

Popular

Subscribe