本文属于类型a,是一篇原创研究报告。以下是根据文档内容生成的学术报告。
基于FPGA的并行二维FFT实现及其在实时MR图像处理中的应用研究报告
一、研究概述与发表信息
本项研究由美国NorthShore大学健康系统研究所基础磁共振研究中心(Center for Basic MR Research, NorthShore University HealthSystem Research Institute)的Limin Li(第一作者及通讯作者)和西北大学(Northwestern University)生物医学工程系的Alice M. Wyrwicz共同完成。该研究成果于2018年9月21日在线发表在科学仪器领域的权威期刊《Review of Scientific Instruments》(卷89,文献号093706)上。研究团队报道了一种专门为实时磁共振成像(MRI)图像处理而设计的、基于现场可编程门阵列(FPGA)的并行二维快速傅里叶变换(2D FFT)算法的设计与实现。
二、研究背景与目标
磁共振成像技术在脑功能与连接成像等应用中,通常需要以高时空分辨率采集大量图像。然而,使用如平面回波成像(EPI)等快速成像序列会引发涡流、机械振动、声学噪声以及频率漂移等多种不稳定性,这些问题会降低数据质量,导致图像畸变和像素定位不一致。为了修正这些影响,需要对系统硬件和成像对象进行主动监测与反馈校正。主动反馈校正方法虽然效果优越,但对计算延迟要求极高,延迟必须远小于数据采集的时间尺度。已有研究表明,在7T全身MR系统中,最小反馈延迟为20毫秒,其中很大部分延迟是由中央处理器(CPU)上的数据处理造成的。
为降低计算延迟,图形处理器(GPU)和FPGA均可作为数据处理的硬件加速器。然而,尽管GPU时钟频率高且在浮点运算上具有优势,但其基于软件指令的取指与译码操作会引入较高的时序抖动,不适用于需要时间确定性处理的高速MRI应用。相比之下,FPGA直接在硬件逻辑电路上实现算法,具有极低时序抖动的特性,因此是实现实时内联数据校正的更优选择。在MRI的反馈数据处理中,2D FFT是最核心的计算功能。虽然有众多通用的FFT处理器和知识产权核(IP核)被报道,但由于MRI实时数据流具有独特的结构(如数据呈块序列到达、存在非规则结构数据),通用处理器在面对这些数据时无法高效工作,会导致处理单元(PE)空闲时间增加和处理延迟上升。因此,本研究旨在开发一种资源高效、能处理规则与非规则数据、且专为实时MRI应用定制的并行2D FFT硬件处理器。
三、研究设计与实现方法
研究的核心工作分为三个主要部分:提出新的并行2D FFT算法、基于该算法设计硬件处理器架构、以及在FPGA芯片上实现并验证该架构。
1. 新并行2D FFT算法的提出 为了解决通用算法无法适应MRI实时数据流的问题,研究团队提出了一种数据驱动的新算法。该算法假设MR扫描仪配备单个接收通道,输入数据以块(block)的形式依次流入处理系统。以一个具有4个处理单元(PE)的系统为例,该算法的处理流程主要分为三步: 首先,输入的数据流被分割成长度为N1的数据块,并以交织的方式分配给4个PE。这种分配方式使得所有PE几乎同时获得待处理的数据,从而能同步开始执行行方向的FFT运算,最大程度地减少了处理单元的空闲等待时间。 其次,当行方向FFT完成后,生成的中间结果数据被存入一个临时存储器。此时,算法利用了数据在写入存储的过程,同步完成数据结构的“再规则化”。研究者观察到,MRI信号即便在非规则数据结构中,其在单个数据块内的相位调制始终是线性的,非规则性主要体现在块与块之间。因此,在写入存储器时,通过特定的地址映射模式重新排列数据,可以在不引入额外处理延迟的情况下完成数据重排,解决了不规则数据的处理难题。 最后,为了完成列方向的FFT,存储的数据按列以交织的方式读出并分配给4个PE。这种数据流设计使得整个2D FFT过程能够高效且紧凑地在硬件上实现。
2. 硬件处理器架构的设计 基于上述算法,研究团队设计了一个包含三大核心模块的2D FFT处理器架构:处理单元、片上存储器和数据管理单元。 - 处理单元:PE是处理器的基础构建模块,由一个1D FFT核以及输入/输出先进先出(FIFO)缓冲器构成。研究团队创新地提出了“双程PE”的设计。在传统的“单程PE”设计中,负责行运算和列运算的PE在物理上是分开的,数据在两次运算中各通过一次。而在“双程PE”设计中,行运算和列运算在时间上复用同一个PE的物理逻辑电路。具体来说,在进行行方向操作时,数据沿着特定通道通过PE并存入静态随机存取存储器(SRAM);行操作完成后,列方向操作开始,数据从SRAM读出,并沿着另一通道再次通过同一个PE。这种设计的巨大优势在于,在处理速度要求允许的情况下(如大部分MRI应用中信号采集存在切片间时间间隔),可将硬件资源消耗降低约30%的DSP48切片和10%的块式随机存取存储器(BRAM),使得在单一FPGA芯片上能够集成更多的PE,从而实现更高的并行度。 - 片上存储器:用于暂存行方向FFT计算完成后的中间结果,是连接两次FFT运算的核心数据缓冲。 - 数据管理单元:DMU是设计的另一大关键与难点,负责精确调度所有PE对存储器的访问,防止数据冲突并最小化延迟。本设计采用了一种分布式DMU方案,即每个PE核心都配有独立的地址生成单元(AGU),极大地简化了互连网络。更为核心的创新是,整个数据流控制采用了“数据驱动”的方式,即所有非算术操作的触发均不依赖于一个全局同步时钟信号,而是依赖于其操作数(输入数据)是否已就绪。这通过建立一套“握手”机制来实现,从而省去了复杂的同步时钟总线和网络,实现了数据的高效、低延迟同步。 - 地址生成单元:AGU的设计是本研究的另一大技术难点,其功能是将二维地址空间映射到一维的存储器地址。为了支持常规(如自旋回波序列数据)和非规则(如快弛豫增强采集(RARE)序列数据)两种数据类型,研究团队分别设计了AGU1(linear)和AGU1(rare)。AGU被设计为由多个地址生成核(AGC)级联构成,通过设置步长、基地址等参数,以硬件逻辑电路递归生成地址序列,完全避免了复杂的取模、乘法和除法运算,显著减少了时钟周期消耗和硬件开销。其中AGU1(rare)可以在写入数据时同步完成对RARE数据的重新排序,使其在存储器中成为规则结构。而用于读操作的AGU2则由多个二维地址生成器组成,能实现二维矩阵的转置功能,将数据准确分配给各PE以进行列方向FFT。
3. 硬件实现与验证实验 研究团队采用美国国家仪器有限公司(National Instruments)的LabVIEW FPGA 2014开发环境,以该公司的1D FFT IP核为基础构建了处理器,并将其原型化在Xilinx公司的一块XC7K410t型FPGA芯片上(搭载于NI USRP-2940R板卡)。处理器设计为对16位有符号定点数进行操作,并在不同处理阶段动态调整数据位宽以防止溢出,确保图像信噪比与扫描仪主机重建结果相匹配。 验证实验使用了128×128和256×256两种分辨率的真实多切片MR图像数据(包括自旋回波规则数据和RARE非规则数据),通过千兆级的数据传输总线(MXI-Express 4),以模拟实时数据流的方式将数据从宿主机(PC)传输至FPGA板卡进行重建处理。实验搭建了一套图形用户界面(GUI)程序用于初始化和控制FPGA,并管理数据流。
四、主要研究结果
实验结果全面验证了该处理器设计的有效性和高性能。
1. 图像重建的准确性验证 通过将FPGA处理器重建的RARE兔脑图像(并行度p=4和p=8)与传统软件(运行在PC上)重建的图像进行对比,结果显示二者几乎完全一致。这不仅证明了并行2D FFT算法及其FPGA实现的正确性,也确认了处理器针对非规则数据进行“在片”(on-chip)实时重排策略的可行性,没有引入图像质量的损失。
2. 计算加速性能 研究团队在不同并行处理因子(p=1, 2, 4, 8)和不同时钟频率(40 MHz, 80 MHz)下,测量了重建单幅切片图像的计算时间。结果表明,在并行度较低时,图像重建时间几乎随并行因子p的增加而线性减少。例如,在40 MHz时钟下,对于128×128图像,p=8的处理时间(0.46 ms)仅为p=1(3.80 ms)的约1/8。将时钟频率从40 MHz提升至80 MHz后,加速效果进一步提升,处理速度最高可达每秒3000帧(128×128图像)和800帧(256×256图像)。 然而,研究也揭示了一个关键瓶颈:当并行度超过某个阈值后(如本例中p>4),继续增加p值所带来的性能增益急剧下降。这是因为数据驱动的架构使得处理器的实际吞吐量受限于数据传输速率,而非计算能力本身。当处理单元的计算速度超过数据输入速度时,大量逻辑电路会因等待数据而处于空闲状态。
3. 硬件资源利用率 通过对“双程PE”与“单程PE”架构的资源消耗进行比较,研究量化了“双程PE”设计的优越性。结果表明,采用双程PE使得DSP48切片(一种用于数字信号处理的硬件资源)的消耗减少了30%,BRAM消耗减少了10%。这种节省意味着在同等规模的FPGA芯片内可以构建更多的2D FFT处理核心。例如,在实验中使用的FPGA上,理论上可集成8个用于处理128×128图像的2D FFT模块,或5个处理256×256图像的模块,从而分别能实现8倍或5倍的多切片同步并行处理能力,极大地提升了单片FPGA的图像处理通量。
五、研究结论与价值
本研究报告并实现了一种为实时MRI应用量身定制的并行2D FFT处理器设计方法。其核心结论是,通过充分考虑MRI数据流的独特模式(如块序列到达、非规则结构),并采用数据驱动的处理逻辑和创新的“双程PE”架构,能够在FPGA上实现既资源高效又具有高度灵活性的图像重建处理器。该处理器无需复杂的同步时钟网络,即可有效处理规则与非规则数据。 该研究的科学及应用价值在于:它为开发MRI系统的实时内联反馈硬件加速器提供了关键技术基础。通过将2D FFT计算加速至微秒级别,可极大缩短动态匀场、运动校正等主动反馈回路的延迟,使其远小于数据采集的时间尺度,从而使高精度、高稳定性的实时MRI校正成为可能。此外,其节省硬件资源的架构设计策略也为在有限资源的FPGA上集成更复杂的多通道、多切片并行图像处理任务铺平了道路。
六、研究亮点