后训练
利用强化学习和可验证反馈,持续提升语言模型、科学模型与智能体。
system.profile / 运行中
我的研究围绕大语言模型、强化学习与多模态学习,重点探索语言模型和科学基础模型的学习方法与可靠评测。目前在加州大学尔湾分校攻读计算机科学博士学位。
这里只响应预设命令,不会执行任何代码。可输入 help 查看命令列表。
trace://research-loop示意界面 · 非实时遥测
利用强化学习和可验证反馈,持续提升语言模型、科学模型与智能体。
将大型通用模型压缩为更小、更高效的专家模型,同时保留关键能力。
面向基因组学、生物学、科学图示与几何学,构建基础模型及其评测方法。
快捷导航
stream.01 / 最新
记录论文收录、研究岗位更新与其他重要进展。
担任大语言模型研究科学家实习生,研究科学图示生成的可验证评测与后训练方法。
该工作利用可微组合优化,在非编码基因组中发现因果变异。
该工作构建了一套程序化生成的长时程视频推理任务。
该工作面向 BioLaySumm 2025 共享任务,结合分章节检索、大语言模型生成与强化学习,生成通俗易懂的生物医学摘要。
该工作发表于第 15 届 ACM 生物信息学、计算生物学与健康信息学会议(ACM BCB 2024),并获 ACM SIGBio 最佳论文奖。论文研究 L2 归一化与测地距离如何改善高维单细胞数据的可视化。
workspace.02 / 当前
以研究问题为脉络,串联方法、系统与科学应用。
R/01
项目负责人 · 模型蒸馏、评测与系统实现
将大型基因组语言模型蒸馏为参数量不足百万的专家模型,并在分类任务和碱基分辨率任务上进行受控评测。
R/02
项目负责人 · 模型、数据、训练与评测
DNAThinker 是一个具备推理能力的多模态基础模型,用于以细胞类型为条件的 DNA 生成、编辑与配对预测。我负责模型、数据与评测工作。
R/03
大语言模型研究科学家实习生 · diagram.ai
利用语义验证器,将结构化的图示反馈转化为强化学习后训练和迭代修复所需的奖励信号。公开材料主要介绍评测设计与可复现实验;未公开结果仅作概述。
R/04
独立研究 · 受控实验
以自然语言处理模型和单细胞模型为对象开展跨领域受控研究,通过多个随机种子运行基线实验、设置负对照,并在计算集群上开展可复现实验。
R/05
大语言模型智能体 · 知识蒸馏 · 同策略蒸馏
我研究如何通过同策略蒸馏(on-policy distillation,OPD),在多轮智能体轨迹中稳定迁移知识;实验由基于 FSDP、vLLM、Ray 和 SLURM 的多 GPU 训练与评测基础设施支撑。
R/06
技术报告 · 分布式机器学习系统
针对分布式机器学习中的流水线并行,采用硬件感知、延迟可预测的可微搜索,加快系统配置搜索与模型收敛。
R/07
公开预印本 · 可解释计算生物学
以可解释多任务学习研究多种自身免疫疾病共有的表观遗传调控,并在分析中显式引入“位点—基因—通路”结构。
R/08
开放基准贡献 · Kart 与 Minecraft 任务提案
我设计了两项长时程视频理解任务:在 SuperTuxKart 中重建赛车遥测数据,在 Minecraft 中重建动作记录。任务采用支持设定随机种子的生成器、可由程序精确验证的真值和确定性评分器,并针对捷径策略进行难度校准。
Kart Issue #73 ↗ Minecraft Issue #74 ↗ Kart 分支 ↗ Minecraft 分支 ↗
method.lab / 迁移
两份交互式方法笔记:一份基于论文手稿,拆解 OmegaGenome 的损失函数;另一份介绍适用于多轮智能体的同策略蒸馏方案。未公开结果不在此展示。
archive.03 / 精选
代表性同行评审成果,涵盖基因组学、视频推理、语言模型与单细胞数据的几何结构。
利用可微组合优化,在不同分子模态和组织中高效发现因果变异。
阅读论文
先对细胞表征做 L2 归一化,将其投影到单位超球面;再用角距离刻画细胞间关系,并将球面亲和度引入 SNE。
paper.controls / 交互查看
调整论文中的优化参数,查看论文报告的消融实验结果。页面会明确区分示意数值与实验测量值。
早期工作 / 公开成果
作者版 PDF、完整作者列表与图表说明 前往学术视图查看论文详情 →
paper.lab / 交互式解读
通过交互方式解读我们的 ACM BCB 2024 论文:沿着相同的特征方向,从平直的单纯形走向弯曲的超球面,观察角距离如何进一步转化为概率邻域。
ACM BCB 2024 · ACM SIGBio 最佳论文奖
该方法先将每个细胞投影到单位超球面,计算角距离,再将角度转化为球面亲和度并归一化,最后优化低维嵌入。下方交互会逐步呈现这条完整的方法链路。
向下浏览方法流程时,几何控件会始终保持可见。展开“深入数学”,可查看 κ、亲和度,以及从高维几何走向低维邻域的完整步骤。
systems.04 / 实践记录
我的工作横跨目标函数、数据集、分布式系统、产品界面与评测基础设施。
开源机器学习系统
基于 AutoX、Python 与 OpenMLDB SQL 构建并向上游提交 600 余行的自动特征工程流程,生成时序与统计特征,再通过对抗验证、GRN 或强化学习筛选关键特征;随后在开源社区进行技术分享。
代码贡献 ↗ 4Paradigm ↗ OpenMLDB ↗ Meetup 分享 ↗ Code Camp 分享 ↗模型效率 / 开源
为 Intel Neural Compressor 实现 Cross-Layer Equalization 无数据量化功能;研究 NVIDIA Triton 与 AI Model Efficiency Tool,向约 100 位同事分享其设计,并参与开发支持多框架及 CPU/GPU 部署的 C++ 推理工具。
Intel Neural Compressor ↗常用技术栈
教学
曾任加州大学尔湾分校 ICS 6B(布尔逻辑与离散结构,2025 年冬季学期)、ICS 6D(离散数学,2025 年春季学期),以及上海交通大学密西根学院 VE370(计算机组成,2021 年秋季学期)课程助教。
部分荣誉
技术能力
Python、C/C++、Java、TypeScript、SQL、Shell、CUDA、PyTorch、TensorFlow、Horovod,以及分布式训练、评测与基准设计。
playground.05 / 已发布
浏览器里的游戏世界、交互式数学文章,以及借助模型思考与创作的工具。
实时多人 / 浏览器原生
作品/02 · 可视化指南
The Geometry of Intelligence
用交互式可视化讲解人工智能中的黎曼几何与信息几何。
↗
作品/03 · 交互式文章
Particles → Probability
从相互作用粒子出发,直观理解菲尔兹奖得主邓宇的相关数学研究。
↗
作品/04 · 开发者工具
File → Prompt
一款注重隐私的浏览器工具:整理项目文件并生成一条结构化提示词,所有内容都只在本地处理。
↗
作品/05 · 对话式网站
PengchengGPT
通过对话了解我的研究方向、个人经历与公开项目。
↗
查看源码: PengchengGPT 代码仓库 ↗
side.quest / itch.io
offscreen.06 / 生活侧写
音乐、科幻创作、浏览器实验,以及藏在名字里的故事。
名字 / 起源
“鹏”是形声字:鸟表义,朋表音。动画从字形出发,让朋中的两个月化作一侧舒展的巨翼与羽毛纹理;鸟则构成身体轮廓,其中仍隐约可见一个淡淡的半透明鸟字,字内的一点亮起成为眼睛。二者合为中国神话中的巨鸟“鹏”,振翅飞向万里前程。父母以“鹏程”为我命名,寄托了他们希望我志存高远、前程广阔的心愿。英文里,Xu 的发音近似“Hsu”。
音频 / 视频
我喜欢唱歌、弹吉他,偶尔也会录制技术分享视频。
生活 / 兴趣
篮球、网球、乒乓球、游泳、阅读、科幻,以及追问事物如何运作。理查德·费曼和李政道一直启发着我。
我希望自己的工作能带来积极影响,也能经得起时间检验。更完整的个人随笔收录在 学术视图中。
channel.07 / 开放
期待与你交流大语言模型、强化学习、可靠的 AI 评测、基因组学、模型蒸馏、科学机器学习,以及大胆而有趣的网页实验。