关于我
出版物
Physics-Informed Generative World Models for Real-Time Bidding: Deriving Statistical Laws from First Principles
KDD 2026 (Oral)代码
- 提出一种基于物理信息设计的生成式世界模型,用于广告场景的实时竞价
- 捕捉极端波动和耦合竞价动态,为可靠的策略优化提供高保真模拟环境
Behavior-Regularized Diffusion Policy Optimization for Offline Reinforcement Learning
- 将行为正则化与高表达能力的扩散策略相结合
- 引入路径级 KL 散度,以解析方式计算扩散策略之间的 KL 散度
- 提出一种结合双时间尺度时序差分学习的 actor-critic 框架,高效优化带行为正则化的扩散策略
ACT: Empowering Decision Transformer with Dynamic Programming via Advantage Conditioning
AAAI 2024代码
- 指出现有回报条件决策方法的局限性,并使用优势作为条件信息对其进行改进