Model Training Team, CodeBuddy / WorkBuddy
LLM post-training for code and reasoning; agent harness and auto research.
王泓
Model Training Team, CodeBuddy / WorkBuddy
Tencent, China
Email: wanghong1700@gmail.com • wanghong1700@mail.ustc.edu.cn
Google Scholar
•
Github
I work on model training in the Tencent CodeBuddy / WorkBuddy team, focusing on LLM post-training and reinforcement learning for code and reasoning. I earned my Ph.D. from the University of Science and Technology of China (USTC). My research spans LLM RL, agent harness and auto research, and AI for scientific computing (neural operators, learning-based numerical solvers, matrix computation acceleration). I welcome discussions and collaborations in these areas.
Materials: CV • Research Slides • Lab Discussion Slides
LLM post-training for code and reasoning; agent harness and auto research.
LLM post-training for code and mathematical reasoning: reasoning-tree curriculum design, entropy dynamics in RLVR, and data curation for code RL.
Led the full pipeline from algorithm design and theory to experiments; achieved 1.2×–20× speedups in real scenarios.
Advisor: Prof. Kuan Xu
* equal contribution • † corresponding author • full list on Google Scholar.
Large Language Models & Reinforcement Learning
Scheduling Your LLM Reinforcement Learning with Reasoning Trees
Rethinking Entropy Interventions in RLVR: An Entropy Change Perspective 🏆 ACL'26 Outstanding Paper Oral
Exploiting Edited Large Language Models as General Scientific Optimizers
NAACL 2025 • arXiv
ReCreate: Reasoning and Creating Domain Agents Driven by Experience
Perturbation-Restrained Sequential Model Editing
ICLR 2025 • arXiv
Words & Weights: Streamlining Multi-Turn Interactions via Co-Adaptation
ICML 2026 • arXiv
Plug-and-Play Data Module for Code RL: Adaptive Ambiguity Replay
ACL 2026 Findings • Tencent internship work
EvoMAS: Heuristics in the Loop — Evolving Smarter Agentic Workflows
ICML 2026
GAPO: Robust Advantage Estimation for Real-World Code LLMs
LEPO: Latent Reasoning Policy Optimization for Large Language Models
ArborKV: Structure-Aware KV Cache Management for Scaling Tree-based LLM Reasoning
ICML 2026
AI for Scientific Computing
SymMaP: Improving Computational Efficiency in Linear Solvers through Symbolic Preconditioning
Accelerating Eigenvalue Dataset Generation via Chebyshev Subspace Filter
ICLR 2026 • arXiv
Accelerating Data Generation for Neural Operators via Krylov Subspace Recycling Spotlight
Mixture-of-Experts Operator Transformer for Large-Scale PDE Pre-Training
STNet: Spectral Transformation Network for Solving Operator Eigenvalue Problems
HGATSolver: A Heterogeneous Graph Attention Solver for Fluid-Structure Interaction Oral
Learning Neural Operators from Partial Observations via Latent Autoregressive Modeling
AAAI 2026 • arXiv
Self-Attention to Operator Learning-based 3D-IC Thermal Simulation
DAC 2025 • arXiv
Learning-Guided Integration Contours Construction for Fast Large-Scale Generalized Eigensolvers
ICML 2026
Accelerating PDE Data Generation via Differential Operator Action in Solution Space
ICML 2024 • arXiv
Neural Krylov Iteration for Accelerating Linear System Solving Spotlight
NeurIPS 2024 • NeurIPS
Coordinate Transform Fourier Neural Operators for Symmetries in Physical Modelings
TMLR 2025 • OpenReview • Code