TSR · The desk
Science · 21 September 2026
Articles in this category in 21 September 2026.
TSR Desk · science · 21 September 2026, 07:00 UTC
PentestChain: A Cost-Aware, MCP-Orchestrated Framework for Automated Penetration Testing withTSR Desk · science · 21 September 2026, 07:00 UTC
GameASG-Bench: Benchmarking Autonomous Software Generation for Game DevelopmentTSR Desk · science · 21 September 2026, 07:00 UTC
Offline Multimodal Large Language Models for Decision Support in Air OperationsTSR Desk · science · 21 September 2026, 07:00 UTC
Do New Attention Mechanisms Actually Fix Attention Sinks at Million-Token Context?TSR Desk · science · 21 September 2026, 07:00 UTC
Staying on the Attack Path: Structured State for Long-Horizon Automated Penetration TestingTSR Desk · science · 21 September 2026, 07:00 UTC
When Should a Failing Robot Ask? Initiating Corrective Human-Robot Dialogue from Audited SensorTSR Desk · science · 21 September 2026, 07:00 UTC
PlaceReasoner-Beta: Reasoning-Driven Macro Placement and BenchmarkingTSR Desk · science · 21 September 2026, 07:00 UTC
CESBench: Benchmarking Large Language Models on Cryptographic Engineering Security for IoTTSR Desk · science · 21 September 2026, 07:00 UTC
HERMES: A Holistic End-to-End Risk-Aware Multimodal Embodied System with Vision-Language ModelsTSR Desk · science · 21 September 2026, 07:00 UTC
CIBuzzBench: A Benchmark for Cross-Lingual Understanding of Chinese Internet BuzzwordsTSR Desk · science · 21 September 2026, 07:00 UTC
Efficient Benchmarking in Production: A Study of an Evolving LLM AgentTSR Desk · science · 21 September 2026, 07:00 UTC
LEGIT: Credentialing Protocol for Trustworthy AI Agent MarketplacesTSR Desk · science · 21 September 2026, 07:00 UTC
LiteMedCoT-VL: Parameter-Efficient Adaptation for Medical Visual Question AnsweringTSR Desk · science · 21 September 2026, 07:00 UTC
GameLogicBench: Evaluating Coding Agents on Runtime Game Logic with Tick-Level State AssertionsTSR Desk · science · 21 September 2026, 07:00 UTC
Beyond Final Answers: CRYSTAL Benchmark for Transparent Multimodal Reasoning EvaluationTSR Desk · science · 21 September 2026, 07:00 UTC
OmniVChat: Synthesizing, Benchmarking, and Training for Native Audio-Visual DialogueTSR Desk · science · 21 September 2026, 07:00 UTC
Benchmarking Autonomous Driving Planners Across Leaderboards: A Unified CARLA-Based Evaluation