摘要
背景
预测出院时的功能状态对于中风康复非常重要,但开发本地预测模型通常需要统计和编程专业知识。本研究的主要目标是使用常规入院变量开发并内部验证出院功能独立性测量(FIM)得分的预测模型。次要目标是描述仅用于模板生成和代码框架的本地执行ChatGPT辅助工作流。
方法
这项单中心回顾性观察研究包括2022年4月至2025年3月期间入院至日本福冈县樱树寺福冈医院康复病房的377名脑梗死或脑出血患者,该病房是为急性治疗后需要强化康复的患者设立的日本后急性期住院康复单位。预测变量为年龄、从卒中发作到入院的天数和入院FIM得分。分别为出院运动FIM和出院认知FIM开发了单独的线性回归模型,并为出院总FIM开发了直接模型。内部验证使用了带有留出预测的五折交叉验证。模型性能使用平均绝对误差(MAE)、均方根误差(RMSE)、决定系数(R²)和校准指标进行评估。
结果
出院运动FIM模型产生的MAE为11.87,RMSE为14.69,R²为0.680。出院认知FIM模型产生的MAE为3.76,RMSE为4.98,R²为0.731。直接出院总FIM模型产生的MAE为14.55,RMSE为18.21,R²为0.714。所有结果的校准斜率接近1.0,重复交叉验证显示预测误差变化最小。
结论
使用少量常规可用的入院变量,可以中等程度地预测出院FIM得分,并具有良好的校准。本地执行的ChatGPT辅助工作流在模板生成和代码框架方面是可行的,但临床实用性、透明报告、人工验证和外部验证仍需正式评估。
引言
预测出院时的功能状态对于中风康复非常重要,因为它有助于目标设定、出院计划和预期护理需求的制定。功能独立性测量(FIM)在住院康复中被广泛用于量化残疾和康复情况,入院FIM已与中风后的后续护理需求和出院安置相关联[1-3]。
多项研究表明,入院功能状态、年龄和其他临床变量与中风康复后的结果相关。入院FIM已被报告为良好结果的独立预测因子,在住院中风康复队列中,入院总FIM被确定为出院总FIM的强预测因子[4-6]。
同时,近期研究表明,大型语言模型可以通过自然语言交互和代码辅助分析支持研究和数据分析工作流,而新兴的报告指南强调在健康研究中使用此类工具时需要透明披露、人工监督和隐私保护[7-10]。本研究的主要目标是使用常规可用的入院变量,在入院至康复病房的脑梗死或脑出血患者中,开发并内部验证出院运动、认知和总FIM得分的回归模型,该病房是日本的后急性期住院康复单位。次要目标是描述仅用于模板生成和代码框架的本地执行ChatGPT辅助工作流的可行性。我们假设这些常规可用的入院变量将提供具有良好校准的中等预测性能。
材料与方法
研究设计
本研究是一项回顾性观察研究,研究对象为入院至日本福冈县樱树寺福冈医院康复病房的脑梗死或脑出血患者,该病房是为需要急性治疗后强化康复的患者设立的后急性期住院康复单位。
数据来源
数据从医疗记录中常规收集的信息中提取。研究期为2022年4月至2025年3月。
伦理考虑
本研究获得樱树寺福冈医院伦理委员会批准(批准号:2025011402)。所有参与者均获得书面知情同意。未将患者级数据分享给第三方。
ChatGPT的使用
ChatGPT(OpenAI,美国加利福尼亚州旧金山)于2026年1月7日仅用于协助起草标准化输入/输出模板和计划分析的代码框架。未将任何患者级数据输入ChatGPT。所有生成的代码均由作者审查,按需修改,并在本地执行。模型拟合、验证和性能评估使用结构化临床数据在本地执行。本研究中使用的最终版本分析代码可在GitHub发布版获取(
研究对象
研究人群包括入院至康复病房的脑梗死或脑出血患者。合格的诊断从医疗记录中记录的入院诊断中识别;在源系统中,这些诊断也对应于日本住院康复计费所用的行政疾病类别。
如果年龄、卒中发作至入院天数、入院运动FIM、入院认知FIM、出院运动FIM和出院认知FIM的完整数据可用,则患者被纳入分析。排除标准为死亡、因临床恶化紧急转院和缺失数据。最终分析包括377名患者。
变量
预测变量为年龄、卒中发作至入院天数、入院运动FIM和入院认知FIM。入院总FIM计算为入院运动FIM和入院认知FIM之和。结果变量为出院运动FIM、出院认知FIM和出院总FIM。出院总FIM计算为出院运动FIM和出院认知FIM之和。
FIM评估
FIM由负责每位患者的治疗师在入院和出院时评估。所有评估者均已完成FIM评估程序培训,并使用描述评分标准的手册进行评分。
数据质量控制
在分析前,检查数据集是否存在所有必需变量中的缺失值或非数值值。此外,还检查入院和出院运动、认知和总FIM得分是否存在超出允许范围的值。通过确认入院和出院总FIM得分等于相应运动和认知FIM得分之和,验证了内部一致性。
异常值处理
未将任何观察结果排除为统计异常值。由于所有必需变量均在预设允许范围内,且在数据质量检查中未发现不可信值,因此在完整合格样本上进行分析,不进行基于异常值的删除或缩尾处理。
缺失数据处理
进行了完整案例分析。排除在分析所需任何变量中缺失数据的患者。在377名患者的最终分析样本中不存在缺失值。
预测模型
对于出院运动FIM和出院认知FIM,使用年龄、卒中发作至入院天数、入院运动FIM和入院认知FIM作为预测变量,分别开发了多变量线性回归模型。
对于出院总FIM,使用年龄、卒中发作至入院天数和入院总FIM作为预测变量,开发了单独的多变量线性回归模型。由于入院运动FIM、入院认知FIM和入院总FIM线性相关,在出院总FIM的直接预测模型中仅使用入院总FIM。
此外,出院总FIM的推导预测值计算为预测出院运动FIM和预测出院认知FIM之和。
统计分析
对于内部验证,分析数据集被随机划分为五个大致相等的部分。在每次迭代中,模型在四部分上拟合,并在剩余部分上评估,因此每位患者每轮重复贡献一个留出预测。由于线性回归模型和预测变量是预先指定的,因此在交叉验证内未进行超参数调整或数据驱动的变量选择。对于重复交叉验证分析,使用不同随机种子在40次重复中重新生成折叠分配。使用平均绝对误差(MAE)、均方根误差(RMSE)和决定系数(R²)评估模型性能。
观察值 = a + b × 预测值,
其中a表示校准截距,b表示校准斜率。
使用带2,000次重复的自助重采样估计性能和校准指标的95%置信区间。
为评估重复交叉验证分析中预测的稳定性,计算了MAE的均值和标准差。此外,计算了每位患者的重复预测的标准差。使用ICC(2,1)评估重复预测的一致性,并使用带2,000次重复的自助重采样估计其95%置信区间。
作为补充分析,进行了带500次重复的自助乐观校正。
虽然考虑到未来实施的操作要求,考虑了整数舍入和范围限制,但这些约束未应用于当前性能评估,所有预测均作为连续值进行评估。
软件
所有统计分析均使用Python 3.14.3(Python软件基金会,美国)和NumPy 2.4.0在本地执行。
结果
研究队列
共有377名患者被纳入最终分析。研究队列的基线特征总结在表1中。在所需变量中未发现缺失或非数值值。此外,入院或出院运动、认知或总FIM得分未观察到超出范围的值,并且总FIM得分与运动和认知FIM得分之和之间未发现差异。
表1:研究队列的基线特征(n = 377)
| 变量 | n | 均值 ± 标准差 | 中位数(四分位距) | 最小值–最大值 |
|---|---|---|---|---|
| 年龄,年 | 377 | 73.46 ± 14.71 | 76.00 (65.00–84.00) | 20–104 |
| 发病至入院天数 | 377 | 30.72 ± 23.92 | 24.00 (17.00–35.00) | 0–207 |
| 入院运动FIM | 377 | 42.44 ± 18.84 | 47.00 (25.00–57.00) | 13–89 |
| 入院认知FIM | 377 | 22.96 ± 9.77 | 25.00 (15.00–32.00) | 5–35 |
| 入院总FIM | 377 | 65.40 ± 26.53 | 70.00 (45.00–86.00) | 18–124 |
| 出院运动FIM | 377 | 67.19 ± 25.99 | 79.00 (50.00–89.00) | 13–91 |
| 出院认知FIM | 377 | 26.61 ± 9.61 | 31.00 (20.00–35.00) | 5–35 |
| 出院总FIM | 377 | 93.81 ± 34.11 | 109.00 (70.00–122.00) | 18–126 |
注:数值表示为均值±标准差、中位数[四分位距]和最小值–最大值。总FIM得分计算为运动和认知FIM得分之和。
FIM:功能独立性测量
内部验证性能
预测模型的内部验证性能见表2。在使用留出预测的五折交叉验证中,出院运动FIM模型实现了11.87的平均绝对误差(MAE)、14.69的均方根误差(RMSE)和0.680的R²。校准截距为0.668,校准斜率为0.990。相应的95%置信区间分别为MAE 11.02-12.79、RMSE 13.68-15.73、R² 0.627-0.723、校准截距-4.65至6.07、校准斜率0.919-1.062。
表2:出院FIM结果预测模型的内部验证性能
| 模型 | 结果 | 预测变量 | MAE (95% CI) | RMSE (95% CI) | R² (95% CI) | 校准截距a (95% CI) | 校准斜率b (95% CI) | n |
|---|---|---|---|---|---|---|---|---|
| 模型A | 出院运动FIM | 年龄 + 发病至入院天数 + 入院运动FIM + 入院认知FIM | 11.87 (11.02–12.79) | 14.69 (13.68–15.73) | 0.680 (0.627–0.723) | 0.668 (-4.648–6.068) | 0.990 (0.919–1.062) | 377 |
| 模型B | 出院认知FIM | 年龄 + 发病至入院天数 + 入院运动FIM + 入院认知FIM | 3.76 (3.44–4.12) | 4.98 (4.50–5.48) | 0.731 (0.668–0.780) | 0.433 (-1.375–2.437) | 0.984 (0.924–1.041) | 377 |
| 模型C | 出院总FIM | 年龄 + 发病至入院天数 + 入院总FIM | 14.55 (13.46–15.65) | 18.21 (16.80–19.56) | 0.714 (0.664–0.758) | 0.639 (-6.049–7.737) | 0.993 (0.926–1.056) | 377 |
| 推导总FIM | 预测总FIM = 预测运动FIM + 预测认知FIM | 模型A + B推导 | 14.47 (13.38–15.58) | 18.17 (16.77–19.56) | 0.716 (0.665–0.761) | 1.065 (-5.755–8.132) | 0.989 (0.924–1.054) | 377 |
注:性能估计基于五折交叉验证的留出预测。使用自助重采样(B = 2,000)估计95%置信区间。通过观察值对预测值的线性回归评估校准(观察值 = a + b × 预测值)。推导总FIM行计算为预测运动FIM + 预测认知FIM。
FIM:功能独立性测量
对于出院认知FIM,模型产生了3.76的MAE、4.98的RMSE和0.731的R²,校准截距为0.433,校准斜率为0.984。95%置信区间分别为MAE 3.44-4.12、RMSE 4.50-5.48、R² 0.668-0.780、校准截距-1.37至2.44、校准斜率0.924-1.041。
对于出院总FIM,直接预测模型产生了14.55的MAE、18.21的RMSE和0.714的R²,校准截距为0.639,校准斜率为0.993。95%置信区间分别为MAE 13.46-15.65、RMSE 16.80-19.56、R² 0.664-0.758、校准截距-6.05至7.74、校准斜率0.926-1.056。
作为预测运动FIM和预测认知FIM之和计算的推导总FIM得分也显示出类似性能,MAE为14.47,RMSE为18.17,R²为0.716,校准截距为1.065,校准斜率为0.989。95%置信区间分别为MAE 13.38-15.58、RMSE 16.77-19.56、R² 0.665-0.761、校准截距-5.76至8.13、校准斜率0.924-1.054。
稳定性和敏感性分析
稳定性和敏感性分析总结在表3中。在40次重复五折交叉验证中,出院运动FIM的MAE均值±标准差为11.80 ± 0.07,出院认知FIM为3.71 ± 0.02,出院总FIM为14.47 ± 0.07。
表3:预测模型的稳定性和敏感性分析
| 模型 | 结果 | 重复交叉验证MAE,均值±标准差 | 每受试者预测标准差,中位数[IQR] | ICC(2,1) (95% CI) | 乐观校正MAE | 乐观校正RMSE | 乐观校正R² |
|---|---|---|---|---|---|---|---|
| 模型A | 出院运动FIM | 11.80 ± 0.07 | 0.753 [0.589–0.945] | 0.998397 (0.998181–0.998581) | 11.80 | 14.63 | 0.684 |
| 模型B | 出院认知FIM | 3.71 ± 0.02 | 0.253 [0.189–0.325] | 0.998713 (0.998512–0.998882) | 3.69 | 4.90 | 0.741 |
| 模型C | 出院总FIM | 14.47 ± 0.07 | 0.817 [0.628–1.027] | 0.998911 (0.998753–0.999038) | 14.45 | 18.13 | 0.718 |
注:重复交叉验证结果基于40次使用不同随机种子的五折交叉验证重复。每受试者预测标准差指每位参与者的重复留出预测的标准差。ICC(2,1) 95%置信区间通过自助重采样(B = 2,000)估计。通过自助乐观校正(B = 500)获得乐观校正性能。
FIM:功能独立性测量
每位受试者重复预测的标准差中位数为出院运动FIM 0.753(四分位距[IQR],0.589-0.945)、出院认知FIM 0.253(IQR,0.189-0.325)和出院总FIM 0.817(IQR,0.628-1.027)。
组内相关系数ICC(2,1)为出院运动FIM 0.998397(95% CI,0.998181-0.998581)、出院认知FIM 0.998713(95% CI,0.998512-0.998882)和出院总FIM 0.998911(95% CI,0.998753-0.999038)。
经过自助乐观校正后,校正性能估计如下:出院运动FIM的MAE 11.80、RMSE 14.63、R² 0.684;出院认知FIM的MAE 3.69、RMSE 4.90、R² 0.741;出院总FIM的MAE 14.45、RMSE 18.13、R² 0.718。
最终模型方程
在完整分析数据集上拟合的完整回归方程如下:
预测出院运动FIM = 39.241 - 0.238 × 年龄 - 0.096 × 发病至入院天数 + 0.826 × 入院运动FIM + 0.581 × 入院认知FIM。
预测出院认知FIM = 13.663 - 0.073 × 年龄 - 0.020 × 发病至入院天数 + 0.031 × 入院运动FIM + 0.767 × 入院认知FIM。
预测出院总FIM(直接模型)= 53.550 - 0.306 × 年龄 - 0.115 × 发病至入院天数 + 1.013 × 入院总FIM。
讨论
在本单中心回顾性研究中,基于常规可用入院变量的回归模型对出院运动、认知和总FIM结果显示出中等预测性能和良好校准。ChatGPT仅用于协助模板生成和代码框架,未将任何患者级数据输入模型。所有三个结果的校准斜率接近1.0,重复交叉验证显示MAE变化最小,ICC(2,1)值超过0.998。综上,这些发现表明仅使用少量常规可用的入院变量即可中等预测出院功能状态[2-5]。
一个临床重要发现是,仅使用四个简单的入院变量(年龄、卒中发作至入院天数、入院运动FIM和入院认知FIM)即可获得具有良好校准的中等预测性能。这些变量在常规护理早期可用,无需额外检测,可能支持早期出院计划并与患者及其家属沟通,尽管本研究未正式量化临床实用性。先前研究表明,入院FIM与中风后的后续护理需求和出院安置相关[2,3],且入院功能状态是康复结果的强预测因子[4,5]。我们的发现支持在康复环境中使用简明预测变量集预测出院运动、认知和总FIM的可行性。
在本研究中,ChatGPT未用于直接从患者级数据推断结果。相反,它用于生成分析工作流和可执行代码,而模型拟合、验证和性能评估则使用结构化临床数据在本地执行。这一区别很重要,因为在此上下文中大型语言模型的价值可能在于支持技术实施,同时保持统计验证和人工监督的必要性[7]。
这些发现应结合先前的中风康复预测研究进行解读。Meyer等人的系统综述发现,入院功能水平和年龄是在卒中后住院康复中与功能结果最一致相关的预测因子[12]。Sonoda等也报告称,年龄、卒中发作至入院天数以及入院运动和认知FIM有助于预测康复队列中的出院运动FIM[13]。在一项住院中风康复的机器学习研究中,Harari等报告称,入院临床测试得分是出院结果的最重要预测因子,卒中发作至康复入院时间和年龄也有助于预测性能[14]。最近,Campagnini等开发了内部交叉验证和外部验证的机器学习模型用于卒中后住院康复,并发现基线运动和认知测量以及年龄是结果预测的主要贡献者[15]。综上,这些研究和本结果支持 readily available入院功能数据和年龄的重要性,同时也强调透明报告和外部验证对临床采用至关重要[12,15-17]。
应承认若干局限性。首先,这是一项单中心回顾性研究,未进行外部验证。因此,模型对其他机构和其他患者群体的可推广性尚不清楚[12,17]。其次,由于分析仅限于完成康复课程至出院且数据完整的患者,无法排除选择偏倚。死亡、需要紧急转院或数据缺失的患者可能在严重程度或康复轨迹上与分析队列有系统性差异。第三,虽然所有评估者均已完成FIM培训并使用评分手册,但未在本数据集中评估正式的评估者间可靠性;因此,残余测量变异性可能影响了模型性能。第四,无法报告候选患者的数量和详细排除情况。第五,模型有意保持简明,未包含其他可能相关的预测变量,这可能在未来研究中提高性能,但也会增加数据收集负担[12,16]。最后,我们未将预设回归模型与更简单的基准模型或替代机器学习方法进行比较,也未直接比较ChatGPT辅助工作流与常规非大型语言模型分析工作流。
尽管存在这些局限性,本研究具有实际意义。简明入院数据集、无需与外部模型共享患者级数据的本地执行、良好的内部验证指标以及公开发布的版本化代码支持了在康复环境中开发本地预测模型的AI辅助工作流的可行性。然而,本研究未正式量化临床效用,也未确立所选建模策略或AI辅助工作流的优越效率或性能。未来研究应在独立队列中进行外部验证,将预设回归模型与更简单的基准模型和替代方法进行比较,直接比较基于预测运动和认知FIM的直接总FIM模型和推导总FIM方法,并评估添加临床有意义的预测变量是否能在不显著降低可行性的情况下提高性能。AI辅助预测模型研究的透明报告,包括工具规格、人工监督、验证程序、隐私考虑和代码可用性的披露,对评估和实施也将很重要[9-11]。
结论
在入院至康复病房的脑梗死或脑出血患者中,仅使用常规可用的入院变量即可中等预测出院运动、认知和总FIM得分,并具有良好校准。在本研究中,ChatGPT仅在人工审查和本地执行下用于模板生成和代码框架。在实施前需要进行外部验证、与基准模型的比较以及临床实用性的正式评估。
【全文结束】

