翟福祥
邮箱:18366752695@163.com | Homepage:fuxiangzhai.github.io
研究方向:图像生成 · 统一多模态理解与生成 · 潜空间视觉推理 · Agentic Generation
教育背景
导师:朱磊教授(Prof. Lei Zhu) | 研究方向:生成式人工智能、图像生成、统一多模态模型、视觉推理与模型后训练
优秀毕业生 · 专业前 12% | 自治区人民政府励志奖学金 | 全国大学生数学竞赛新疆赛区两届一等奖
论文与科研成果
科研经历
Latent Action Control(LAC)|统一图像生成模型中的潜空间推理与控制 | 第一作者 · 在审
- 背景与目标:统一多模态模型能够在共享 backbone 中编码“理解”和“生成”,但模型理解到的对象关系、属性绑定和知识线索并不会自动转化为生成控制。目标是将内部推理直接表示为可被生成器消费的连续潜动作。
- 核心方法:基于 BAGEL-7B-MoT 构建 role-structured latent trajectory,将一次生成拆解为 planning → internal visual drafting → diagnosis → refinement,并将潜动作注入 flow-based generation 的 hidden stream,不输出显式 CoT 文本或中间图像。
- 监督与后训练:通过 prior-guided variational latent action alignment,利用 rendered semantic priors、draft image features 与 halting signals 对潜动作进行对齐;进一步采用 Latent-Flow GRPO,以终局视觉反馈联合优化 latent-to-image rollout。
- 实验结果:在 GenEval、WISE、T2I-CompBench 上取得稳定提升,尤其在 spatial relation、attribute binding 与 world-knowledge-sensitive prompts 上增益明显;消融与 latent intervention 验证潜动作被生成器实际利用。
GenEvolve|Self-Evolving Image Generation Agent | 共同作者 · 在审
- 项目目标:面向开放式复杂图像生成任务,研究可调用外部工具、参考图与生成技能的自进化 Agent,使系统能从多条生成轨迹中学习结构化“视觉经验”。
- 技术框架:将生成建模为 tool-orchestrated trajectory,执行 evidence gathering → reference selection → generation skill invocation → prompt-reference program;通过 best-vs-worst trajectory 对比抽取 Visual Experience,并以 teacher-student 方式进行 token-level experience distillation。
- 参与内容:参与联合研究与实验评测,围绕 agentic image generation、生成轨迹组织、工具调用与 benchmark 分析开展工作。
PosterReward|面向高质量平面设计生成的 Reward Model 与 Benchmark | CVPR 2026(CCF A)
- 背景与目标:通用 reward model 更偏全局美学,难以准确判断海报中的 typography、layout 与文字正确性。项目构建 70K poster preference 数据,并提出面向海报评测的专用 reward model。
- 我的工作:参与 PosterReward 相关实验与评测支持,围绕生成结果质量对比、Reward Model 评测与 benchmark 分析开展工作。
- 项目产出:论文构建海报偏好数据并提出专用 PosterReward,同时提供 PosterRewardBench 与 PosterBench,用于评估海报质量判断与生成能力。
ROAD|Rule-Grounded Context-Aware Open-World Driver Anomaly Detection | 共同作者 · 在审
- 研究问题:面向真实驾驶场景中的开放世界异常检测,围绕 rule-grounded 与 context-aware 建模开展研究。
- 参与内容:作为共同作者参与项目研究与实验工作。
代表项目
Domain Adaptation + Confident Learning 的四分类显微图像识别
- 任务与数据:针对 Proestrus / Estrus / Metestrus / Diestrus 四分类阴道细胞学图像,构建 1,236 张有标签 + 1,419 张无标签私有数据集的半监督训练流程。
- 技术方案:采用 G + F1/F2 双分类器的 MCD-style domain adaptation;联合 source CE、classifier discrepancy、entropy 与 target confident CE;每 20 epochs 使用 cleanlab 进行高置信伪标签筛选与标签噪声清理。
- 训练与评测:使用 VGG16 / ResNet50 特征提取器,统计 OA、Macro-Precision / Recall / F1 与各类别 precision,并进行多次运行稳定性评估。
- 结果:私有数据集最佳 OA 约 88.4%;完成数据预处理、标签构建、训练/消融、指标统计与可复现实验管理。
小程序开发项目|国家级大创
- 项目职责:担任国家级大学生创新训练计划项目负责人,负责项目整体规划、团队分工、阶段进度推进与汇报,并参与小程序从需求梳理到功能落地的完整开发过程。
- 开发实践:围绕小程序核心功能开展页面与交互设计、功能模块实现、联调测试与迭代优化;根据测试反馈持续完善功能逻辑、数据交互和使用体验。
- 项目管理:组织团队完成版本测试、项目文档与成果展示材料整理,推进方案设计、开发实现和阶段性总结,积累了产品需求理解、工程实现与团队协作经验。
面向机器人操作序列的 Frame-Consistent Image Editing
- 任务:对毛巾操作连续帧进行颜色、光照、背景与纹理外观增强,同时严格保持动作顺序、几何结构、折叠关系、标签/文字条等任务语义不变。
- 技术探索:系统比较 Qwen-Image-Edit、Flux.1-Kontext-dev、OmniGen2、SD + ControlNet/LoRA 等编辑方案;结合 fixed seed、Img2Img 与批处理策略提升跨帧一致性,并开发 1×4 / 2×2 拼图和批处理脚本用于快速质量检查。
荣誉奖项
- Kaggle Bronze Medal:RSNA 2024 Lumbar Spine Degenerative Classification,Top 6%。
- 学科竞赛:全国大学生数学竞赛第 14、15 届新疆赛区一等奖;“华教杯”全国总决赛三等奖。
- 奖学金与校级荣誉:自治区人民政府励志奖学金;新疆大学优秀毕业生、优秀学生团干部、优秀志愿者。
技术栈与研究工具
- 编程 / 深度学习:Python、PyTorch、Transformers、Diffusers、OpenCV、NumPy、MATLAB;熟悉 VLM / T2I / Reward Model 的训练、推理与评测。
- 生成与大模型:BAGEL-7B-MoT、Qwen 系列、Flux、SD3.5 / SDXL、ComfyUI;vLLM 推理服务、LoRA / ControlNet、GRPO 类后训练与生成 benchmark。
- 系统 / 工程:Linux、Slurm、CUDA、Git、LaTeX;A800-80GB 多 GPU 集群,熟悉显存优化、并行推理、批量实验与结果管理。
其他经历
- 学术与组织:2021 中国数学会年会受邀参会;曾任学生会办公室负责人、班级团支部宣传委员,并长期参与在线教学志愿服务。