Post-Training Leaves Behavioral Shadows on Unrelated Decisions
Active Taskless Distillation을 제안하여 단일 단어만으로 능력 전이를 달성하며, Qwen2.5-1.5B에서 HumanEval+ 점수를 5.34pp 향상시킵니다.
이번 주 로봇·AI 동향 — 최근 7일간 화제가 된 오픈소스와 논문 목록이 매일 갱신됩니다.
마지막 수집: 2026년 9월 30일 09:22 (KST)
Active Taskless Distillation을 제안하여 단일 단어만으로 능력 전이를 달성하며, Qwen2.5-1.5B에서 HumanEval+ 점수를 5.34pp 향상시킵니다.
Domain-Normalized MOPD를 제안하여 도메인별 피드백 분산을 정규화하고, MOPD 대비 벤치마크 평균 점수를 개선합니다.
Physical Coding을 제안하고 HexaAnything를 구축하여 로봇의 상태와 실행을 코드로 표현합니다. RoboCasa365에서 XR-1 VLA 대비 성공률을 높이는 것을 확인합니다.
GAGAR를 제안하여 코드 에이전트 RL에서 SFT-trained agentic grader로 테스트 통과 트래젝션을 평가하고 품질 기반 어드밴티지를 재분배합니다. 이를 통해 MiMo-V2.6-Flash에서 코드 에이전트 성능과 학습 안정성을 향상시킵니다.
MALA를 제안하여 normalized contribution 기반 동적 할당으로 post-score 연산을 최적화합니다. 128K 토큰 벤치마크에서 FullAttn 대비 2.2x~3.0x 지연 시간 감소를 확인합니다.
CoWA를 제안하여 KV head 간 causal history 접근을 분산하고, 128K 토큰에서 FullAttn 대비 7.4x 지연을 줄입니다.
Encoder-free MLLM의 scaling laws를 분석하여 시각 인코더 제거 시 compute-optimal 배분 변화와 10^22 FLOPs 내 성능 추격 가능성을 확인합니다.
TaH2를 제안하여 토큰별 반복 횟수를 동적으로 조절함으로써 test-time scaling 효율을 높입니다. AIME 벤치마크에서 accuracy-compute slope를 53% 향상시킵니다.
UMM-Reflection을 제안하여 통합 모델 내 반사 궤적 전체에 RL을 적용합니다. BAGEL에서 GenEval 점수를 12.05점 향상시킵니다.
FlyBy를 제안하여 knowledge bottleneck 시에만 외부 모델에 query합니다. FlyBy-4B가 Qwen3-14B보다 낮은 비용으로 pass@8 45.96%를 달성합니다.
CompoWorld를 제안하여 재사용 가능한 서비스들을 조합해 다중 서비스 작업을 생성하고, SFT와 RL로 Qwen3.6-35B-A3B를 학습합니다.
장기 embodied task를 위한 벤치마크 EmbodiedMemory-Bench와 외부 기억 시스템 Embodied-Memorizer를 제안합니다.
Recursive Harness Distillation을 제안하여 strong agent의 경험을 playbook으로 축적하고 light agent의 피드백으로 재귀 정제합니다. 이를 통해 SimplerEnv Bridge에서 66.7%의 성공률을 달성합니다.
EAPO를 제안하여 엔트로피와 어드밴티지 부호를 결합해 성공과 실패를 비대칭적으로 처리합니다. 이를 통해 추가 감독 없이 토큰 단위 크레딧을 배정하여 LLM 추론 성능을 향상시킵니다.
QwenGyre는 xlong-horizon 온라인 RL을 위한 탄성적 GPU 재할당 및 트래젝터리 중복 제거 프레임워크를 제안합니다. 이를 통해 NL2RepoBench에서 6.0% 성능 향상을 달성합니다.
DepthBench를 제안하여 다양한 아키텍처의 계산적 깊이를 측정합니다. HC와 Full AttnRes가 깊은 구조에서도 성능을 일관되게 향상시킵니다.
WorldPlay2를 제안하여 factorized hybrid control interface와 Stable Forcing을 결합해 실시간 상호작용과 장기 일관성을 확보합니다.
공공 문서에 작은 변형을 가해 LLM이 문맥 의존 추론을 학습하는 합성 파이프라인을 제안합니다. 이를 통해 CL-bench 성능을 22.8%까지 향상시킵니다.
DRM을 제안하여 reward modeling을 조건부 밀도 추정 문제로 재정의합니다. 이는 reward의 multimodal 구조를 자연스럽게 표현하고 기존 baseline과 동등하거나 우수한 성능을 보입니다.
Skill2Env를 제안하여 스킬 기반의 실행 가능 환경을 합성합니다. 1.5K 트래젝터로 SFT 시 에이전트 벤치마크 성능이 향상됩니다.
FlashForward를 제안하여 in-flight KV cache를 재사용하고 clean anchor로 안정성을 확보합니다. 이를 통해 Self-Forcing 대비 최대 2.92배 빠른 추론 속도를 달성합니다.
SpatialSpeak를 제안하여 QA-Native Reconstruction Pretraining과 Spatial CoT-VC를 결합합니다. 이를 통해 ReVSI 벤치마크에서 62.8점의 SOTA 성능을 달성합니다.
Transformer의 행렬 곱을 associative-algebra로 대체해 6.2~7.8%의 처리량 향상을 확인합니다.
REALM을 제안하여 청자 얼굴 모션을 생성합니다. ViCo 벤치마크에서 성능을 입증합니다.
RoboFoundry는 시스템 전체를 정책으로 진화시키는 첫 embodied agentic framework를 제안합니다. EmbodiedBench에서 GPT-5.5 성능을 27.8% 향상시킵니다.
AdaTutoRank를 제안하며, Adaptive Tutoring Optimization을 통해 RAG 문서 재순위 설정의 크레딧 할당 문제를 해결합니다.
δ-Vision을 제안하여 저비용 low-rank adapters로 시각 토큰을 보존하며 MLLM의 추론 효율을 높입니다.
LLM RLVR의 training-inference mismatch를 해결하기 위해 calibrated importance sampling(CIS)을 제안합니다. CIS는 token confidence에 따라 importance-ratio cap을 조정하여 3개 MoE 모델에서 기존 baseline 대비 성능을 향상시킵니다.
GPT-6 Astra를 55개 벤치마크로 평가하여 일반 AI의 컴퓨터 비전 한계를 분석합니다.
DiT의 residual connection을 active retrieval mechanism으로 전환하는 structured connectivity를 제안합니다. 이를 통해 FID 4.34를 달성하며 학습 효율을 높입니다.
EditWorld를 제안하여 스트리밍 편집 지시와 참조 이미지를 통해 인터랙티브 월드를 정밀하게 수정합니다.
FlowTool을 제안하여 flow matching으로 tool parameter를 생성합니다. MMArt-Bench에서 MLLM보다 성능이 우수합니다.
TT-VidT를 제안하여 DINOv3 기반 ViT와 Temporal Transfer Layer로 운동 중심 영상 표현을 학습합니다.
VQS를 제안하여 이미지에서 구조화된 기록을 파싱하고 프로그램으로 답을 검증합니다. 이를 통해 Qwen3-VL 성능을 최대 3.18점 향상시킵니다.
Imprint Reader를 제안하여 가중치 업데이트를 자연어로 해석하고 MetaEdit로 안전성을 개선했습니다.
SolveEdit 벤치마크와 SolveEdit-Plan을 제안합니다. GPT-Image-2의 SolveScore를 71.6%까지 향상시킵니다.
과학 이미지 생성의 설명 가능한 검증을 위해 SciGen-Verify 벤치마크와 SciGen-Verifier 모델을 제안합니다.
RL 관점에서 OPD를 분석하고 LSPD를 제안하여 오프폴리시 데이터 재사용으로 샘플 효율을 높입니다.
Nereus는 LLM RL post-training의 동적 병렬성을 최적화하는 cost-aware runtime을 제안합니다. 이를 통해 8B PPO 처리량을 최대 7.27배 향상시킵니다.
InfiniHand는 egocentric video에서 MANO 파라미터와 카메라 궤적을 함께 추정하는 end-to-end streaming 프레임워크를 제안합니다.
Residual Transferability(RT)를 정량화하고 CoverLock을 제안하여 워터마크 잔여물의 이전 가능성을 억제합니다.
GeoVerse를 제안하여 기하학적 잠재 공간에서 video generative model의 appearance prior를 주입해 world-consistent novel view synthesis를 수행합니다.
FuseReg을 제안하여 레이어 퓨전 정규화로 RAE의 재구성-생성 격차를 완화합니다.
Prefill과 Decode에 특화된 disaggregated quantization(DQ)을 제안합니다. Qwen 3에서 NVFP4 prefiller 적용 시 MMLU-Pro 정확도가 32.5점 향상됩니다.
PISA를 제안하여 pyramid Top-K 선택으로 block sparse attention의 복잡도를 O(Nlog N)으로 낮춥니다.
InternW0-Δ를 제안하여 시각 동역학과 동작 생성을 통합한 WAM을 구축합니다. 20K+ 시간의 오픈 데이터로 사전 학습하여 시뮬레이션 및 실로봇 벤치마크에서 기존 방법보다 우수한 성능을 보입니다.
LastOPD를 제안하여 latent on-policy distillation의 붕괴를 방지합니다.
Tactile-JEPA를 제안하여 분산형 촉각 센서의 공간 배치를 활용한 위상 인식 자기지도 표현 학습을 수행합니다. 이를 통해 힘 추정 오류를 6.3% 감소시킵니다.
diffusion model의 생성 궤적에서 발생하는 forking moment를 FoMo로 정의하여 reference-based IQA metric의 pointwise perceptual distance label을 자동 생성하는 파이프라인을 제안합니다.
Stable Diffusion 3 기반 diffusion model을 제안하여 photogrammetric DSM의 정확도를 높입니다.
TrackEverything을 제안하여 3D 씬 표현의 중복 제거로 긴 영상에서 모든 점을 추적합니다. TAPVid-3D에서 기존 오픈소스 트래커보다 20% APD를 향상시킵니다.
SLCA-GRPO를 제안하여 툴 호출 RL에서 세그먼트 간 크레딧 오귀속 문제를 해결합니다. 이를 통해 GRPO 대비 BFCL에서 +1.36pp 향상된 성능을 달성합니다.
SAGE 프레임워크를 제안하여 대수적 희소화와 쌍곡 구조 안내로 탐색 편향과 누적 편향을 완화합니다. Andrews-Curtis 문제에서 최대 8배 성능 향상을 달성합니다.
LightMIS는 단계별 디코더 없이 2D 의료 영상 분할을 수행하는 초경량 CNN을 제안합니다. 0.131M 파라미터로 Mobile U-ViT와 유사한 성능을 내며 Arm GPU에서 실시간 추론이 가능합니다.
VLA-Precision을 제안하여 VLA 모델의 정밀한 조작 성능을 향상시킵니다. ACoB 알고리즘과 ACoB-Stream 아키텍처로 10.9배의 처리 효율을 달성합니다.
CARD는 사용자 클러스터링과 LoRA 어댑터로 개인화된 텍스트 생성을 제안합니다. LaMP 벤치마크에서 생성 품질과 효율성을 향상시킵니다.
PsPLUG를 제안하여 명시적 스타일 지시와 암묵적 개인화 간 충돌을 해결합니다. 이를 통해 추론 시 개인화 강도를 조절하며 사용자 선호를 유지합니다.
Morphometric Imitation을 제안하여 인간 손-물체 상호작용을 시뮬레이션-실시간 비전운동 정책으로 변환합니다. 이 프레임워크는 300회 실세계 시험에서 89.3%의 제로샷 성공률을 달성합니다.
D-JEPA를 제안하여 실행 결과 기반의 의사결정 관련 관계를 학습합니다. PushT에서 87.89% 성공률을 달성하며 예측적 세계 모델링과 제어의 연결을 입증합니다.
소프트맥스 재파라미터화를 제안하여 출력 헤드 양자화 전 기능적으로 동등한 헤드를 선택합니다. 이를 통해 Phi-4-mini에서 AW-MSE KL을 0.936에서 0.256으로 낮춥니다.
MOPD-Router를 제안하여 도메인 레이블 없이 토큰 단위로 교사를 라우팅합니다. ExpertAlign 메트릭으로 unlabeled 데이터에서 Mean 대비 5.88점 향상됩니다.
CDB를 제안하여 looped LM의 depth-adaptive inference를 효율화합니다. Ouro 1.4B에서 최대 99%의 속도 향상을 달성합니다.
TRACE라는 condition-aware evaluation framework를 제안합니다. 이 프레임워크는 streaming video understanding의 temporal audit와 execution-conditioned system behavior를 명시적으로 평가합니다.
Net Utility 메트릭을 제안하여 LoRA 병합 시 임의의 랭크 예산을 할당합니다. 이를 통해 비전 및 언어 작업에서 각각 2.1%, 2.2%의 성능 향상을 달성합니다.
BoundInk는 글자 경계를 명시적 생성 단위로 처리하여 필기 연결과 간격을 개선하는 프레임워크를 제안합니다.
ZooWork-ShopRanker를 제안하고 ShopRank-Bench를 공개합니다.
hierarchical rotary positional encoding(hRoPE)를 제안하고, cross-paragraph attention의 compression depth가 paragraph structure의 재현 가능한 signature임을 확인합니다.
NVIDIA/Model-Optimizer는 quantization, distillation, pruning 등 SOTA 기법을 통합한 모델 최적화 라이브러리입니다. 이를 통해 TensorRT-LLM, vLLM 등 배포 프레임워크에서 추론 속도를 최적화합니다.
pure C/C++로 SD, Flux, Wan, Qwen Image, Z-Image 등 Diffusion model 추론을 수행하는 라이브러리를 제공합니다.
WROP 데이터 인프라와 PWM-WROP 모델을 제안합니다. 14개 영상 모델 평가에서 PWM-WROP이 1위를 차지합니다.
LLM의 Linear Superposition 특성을 입증하고 guided decoding을 제안합니다.
WanPE를 제안하며, 30초 영상에서 50.86점의 인간 선호도 향상을 달성합니다.
OmniEchoBench와 OmniEcho를 제안하여 공간 오디오 이해를 평가하고 향상시킵니다.
AEWM을 제안하여 도구 응답 시뮬레이션 대신 추론과 행동이 향후 작업 진행에 미치는 영향을 모델링합니다. EditAct를 통해 노이즈 추론을 편집하여 6개 벤치마크에서 평균 3.2~6.7점의 성능 향상을 달성합니다.
GLM-4.5-Air-Base 기반의 8단계 후학습 파이프라인인 Rufus-Air를 공개합니다. SFT부터 RLHF까지의 데이터와 인프라를 문서화하여 재현 가능한 오픈 레시피를 제공합니다.
SAE latent space에서 part-of-speech가 원자적 특징이 아닌 분산된 그룹으로 인코딩됨을 확인합니다.
Qwen-Planner-Agent를 제안하며, closed-loop AI-for-AI 프레임워크로 모바일 플래너 에이전트를 개발합니다.
Coding agents가 Generalized TAMP 문제를 해결하는 프로그램을 자동 생성합니다. KinDER 벤치마크에서 기존 플래너보다 높은 성공률을 기록합니다.
IterSynth를 제안하여 Planner와 Synthesizer의 역할을 분리하고 summary state를 활용해 ReAct의 한계를 극복합니다.
theorem의 intrinsic interestingness를 정의하고 이를 최적화하는 27B 모델을 학습하여 Mathlib와의 중복률을 30.6%로 낮추며 self-expanding mathematical library 구축을 제안합니다.
RGBD20K 데이터셋과 SPF 방법을 제안합니다. 160개 클래스와 20,000개 이미지로 구성된 이 데이터셋은 RGB-D 시맨틱 세그멘테이션 모델의 일반화 성능을 높입니다.
NSC를 제안하여 모델 인스턴스화 없이 아키텍처 사양만으로 용량을 측정하고 NSC-DP로 최적 아키텍처를 탐색합니다.
VLM이 로봇을 조종하는 World Action Agent를 제안합니다. LIBERO-Pro에서 75.6% 성공률을 달성합니다.
RLCDAlignBench를 제안하여 RLCD 기반 Jev가 제로샷으로 AI 정렬 실패를 탐지하는 성능을 평가합니다.
PUBG Ally는 음성으로 소통하며 자율적으로 행동하는 PUBG AI 팀메이트를 제안합니다. 이 에이전트는 39k 세션의 실제 플레이 데이터를 활용해 반복 학습 및 평가를 수행합니다.
AV-GRPO와 5DAV를 제안하여 오디오-비디오 생성의 모달리티 간 동기화 및 정합성을 개선합니다. JavisBench에서 LTX-2.3보다 우수한 성능을 입증합니다.
DeltaWAM을 제안하여 시각 델타와 액션을 함께 예측하고, RoboTwin에서 성공률을 85.4%로 향상시킵니다.
ViRDM을 제안하여 teacher와 critic 없이 few-step causal video generation의 post-training을 수행합니다.
매일 오전 자동 업데이트됩니다. 최근 7일 항목만 표시합니다.