Overview
RL optimization with Harbor involves:- Trajectory collection: Running agents on tasks and recording interactions
- ATIF export: Converting trajectories to standardized format
- Reward shaping: Using task verifiers to provide learning signals
- Training: Using trajectories to fine-tune agent models
Harbor focuses on trajectory generation. You’ll need an RL training framework (e.g., PPO, DPO) to train models.
ATIF Format
The Agent Trajectory Interchange Format (ATIF) is Harbor’s standard for representing agent interactions:Collecting Trajectories
Agent Support
Only agents with ATIF support can generate trajectories:Running Data Collection
1
Choose an ATIF-compatible agent
2
Run evaluation
3
Export trajectories
Filtering Trajectories
Export only successful trajectories:Using Trajectories for RL
Data Preparation
Load and preprocess trajectories:Reward Shaping
Use partial rewards for better learning signals:Training with PPO
Example using a hypothetical PPO trainer:Advanced Techniques
Multi-Task Training
Collect diverse trajectories:Curriculum Learning
Start with easy tasks, progress to harder:Behavior Cloning
Learn from expert demonstrations:Evaluation
Validate improved agent:Best Practices
- Collect diverse data: Use multiple benchmarks and task types
- Balance dataset: Include successful and failed trajectories
- Validate continuously: Test on held-out tasks
- Start simple: Begin with behavior cloning before RL
- Monitor overfitting: Track validation performance
- Use partial rewards: Better learning signals than binary
- Version control: Track model checkpoints and data
Limitations
Next Steps
Custom Agents
Add ATIF support to your agent
Parameter Sweeps
Optimize hyperparameters
Agent Context
Learn about AgentContext
Verifiers
Design better reward functions