TSR · The desk
Science · 15 September 2026
Articles in this category in 15 September 2026.
TSR Desk · science · 15 September 2026, 01:00 UTC
K-Bench: A Benchmark for LLM Unlearning in Agentic DeploymentsTSR Desk · science · 15 September 2026, 01:00 UTC
Meddies-PII: A Multilingual Framework for Personally Identifiable Information Extraction inTSR Desk · science · 15 September 2026, 01:00 UTC
Generative Retrieval for Unsupervised Text-Based Person SearchTSR Desk · science · 15 September 2026, 01:00 UTC
Retrieval-Augmented Generation for Scientific Code UnderstandingTSR Desk · science · 15 September 2026, 01:00 UTC
Measuring Pragmatic Influence in Large Language Model InstructionsTSR Desk · science · 15 September 2026, 01:00 UTC
MP-Bench: Evaluating Voice Agents as a Multiparty Conversation ParticipantTSR Desk · science · 15 September 2026, 01:00 UTC
Automated Detection and Structuring of Social Tipping Point Evidence in Climate relatedTSR Desk · science · 15 September 2026, 01:00 UTC
OpenFinGym: A Verifiable Multi-Task Gym Environment for Evaluating Quant AgentsTSR Desk · science · 15 September 2026, 01:00 UTC
Who Judges the Judges? A Chinese Safety QA Benchmark for Evaluating LLM Responses and SafetyTSR Desk · science · 15 September 2026, 01:00 UTC
WorkflowPerturb: Calibrated Stress Tests for Evaluating Multi-Agent Workflow MetricsTSR Desk · science · 15 September 2026, 01:00 UTC
A Multi-Vehicle Dataset with Camera, LiDAR, and Radar Sensors and Scanned 3D Models for CustomTSR Desk · science · 15 September 2026, 01:00 UTC
Mr.LHDR: A Benchmark for Multimodal Real-World Long-Horizon Deep Research AgentsTSR Desk · science · 15 September 2026, 01:00 UTC
MedRoundsQA: A Persona and Difficulty Aware Evaluation for Multi-Turn Medical ConsultationsTSR Desk · science · 15 September 2026, 01:00 UTC
Measurement Without Validity: The Compounding Reliability Problem in Agentic AI EvaluationTSR Desk · science · 15 September 2026, 01:00 UTC
Information Specialization and Constrained Synthesis in Multi-Agent LLM Forecasting: A