拿到这道题的第一感觉是:MCM/ICM又开始搞事情了。2026年美国大学生数学建模竞赛ICM的Problem F,题目全称是“To Gen-AL, or Not To Gen-AI (or how to Gen-AD)”,光看标题就带点玩梗的意思——模仿哈姆雷特的经典独白,但内核是一个特别现实的决策问题:生成式人工智能到底该不该用、该怎么用,以及用了之后会产生什么样的连锁反应。这道题把“生成式AI”从技术圈拉到了政策、教育、产业甚至社会公平的层面,属于典型的ICM跨学科综合建模题。对于参赛团队来说,最难的不是模型本身,而是怎么把“影响评估”这件事做成一个能说服评委的完整叙事。
我在这篇文章里会把整道题的拆解思路、数据准备、模型架构、源码实现和论文结构全部铺开讲。源码部分会给到一个可以直接跑的Python框架,包含数据生成、指标计算、熵权法评价、系统动力学扩散模拟和可视化,参赛团队在这个骨架上替换成自己的数据与方法即可。
1. 题目解读与核心思路拆解
1.1 题目真正想问什么
先别急着想模型。美赛的F题从来不是单纯考算法,而是考“你如何看待一个复杂社会技术问题”。这道题表面上在问“要不要用Gen-AI”,实际上是在问三件事:
第一,生成式AI的影响可不可以被量化。比如一个学校引入AI辅助教学工具之后,学生的成绩变化、教师的工作负荷变化、教育资源分配的变化,能不能用一套可复现的指标体系衡量出来。
第二,这种量化能不能支持决策。也就是说,你不能只说“影响很大”,你要说清楚“在什么条件下影响为正、什么条件下影响为负”,以及“最优的部署策略是什么”。
第三,决策的边界条件是什么。比如不同地区、不同类型学校、不同学科之间,Gen-AI的适配度差异巨大,通用结论没有意义,你需要建立能体现差异化情境的模型。
所以这道题的正确答案不是“该用”或“不该用”,而是用一套建模逻辑告诉评委:在什么样的环境下,对什么样的人群,以什么样的方式部署Gen-AI,会产生什么样的可量化后果。
我个人的判断是,这道题最核心的建模对象不是AI模型本身,而是“AI影响传播的动力学过程+多维效益的综合评价”。把这两条主线搭起来,论文就成功了一半。
1.2 破题路径:从“评估影响”到“量化指标”
ICM题目的特点是没有标准数据、没有标准答案,但评委期待你有一套完整的方法论。我建议用五步走破题:
第一步,定义问题边界。 把“Gen-AI”具体化为若干应用场景,比如AI辅导助手、AI批改作业、AI生成课件、AI辅助科研等。不要笼统地讨论“AI”,要讨论“AI的某个具体应用”。
第二步,建立指标体系。 教育领域的评价不能只看分数,需要覆盖学业成绩、学习参与度、教师负担、教育资源均衡、技术成本、隐私风险等多个维度。每个维度拆成可量化的二级指标,再通过熵权法、AHP等方法确定权重。
第三步,构建影响传播模型。 把Gen-AI的引入看作一种“干预”,这个干预会随着时间的推移在群体中扩散。可以用微分方程模型、Agent仿真或系统动力学模型模拟这种扩散过程,从而得到不同时间点的覆盖率与影响度。
第四步,做差异化情境分析。 设置几类典型场景,比如资源丰富的城市重点学校、资源一般的普通学校、偏远地区学校、职业培训机构等,分别跑模型,得到不同情境下的最优策略。
第五步,生成可解释的政策建议。 把模型输出翻译成“建议”的语言,包括部署建议、风险防控建议、补偿机制建议等。
这套路径的好处是逻辑链条完整:它既回答了“是否”(用评价模型),又回答了“如何”(用优化和仿真模型),论文的每章都能找到对应任务。
1.3 用ICM思维建模:不是单纯的预测题
我见过不少团队把这题做成“AI效果预测模型”,这是最大的误区。MCM/ICM的F题本质上是决策导向的综合题,评委希望看到的是建模闭环:
- 题目重述与假设 -> 建立指标体系 -> 构建影响仿真模型 -> 多情境对比 -> 敏感性与鲁棒性分析 -> 给出决策建议
换句话说,预测只是中间环节,决策建议才是终点。这意味着模型不能只有一个,至少要两个以上形成组合:一个负责评价,一个负责动态演化,一个负责优化或决策。至于题目里那个“Gen-AD”,可以理解成“生成式AI如何部署/管理(Generation, Application, Deployment)”,它在模型上的落点就是“部署策略优化”。
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
2. 数据准备:从公共数据集到合理假定
2.1 数据来源选择:没有官方数据怎么找数据
F题一般不会给具体数据,需要团队自己搜集或构造。针对这道题,可行的数据来源有这些:
- 公开教育统计数据集:世界银行的Education Statistics、OECD的PISA数据库、各国教育统计年鉴,里面有学校数量、师生比、教育投入、学业成绩等信息。
- 技术渗透率数据:ITU(国际电信联盟)的互联网使用率、各国家庭电脑与智能手机保有量数据,可以当作Gen-AI可用性的间接指标。
- 学术文献数据:过去三年关于生成式AI教育应用的实证研究,里面会有实验组对照组的效应量,可以作为模型参数设定的依据。
- 问卷调查数据(自己造也行):美赛允许合理虚构数据,但必须说明假设和数据生成机制。
如果团队时间紧,我建议以公开统计数据为主、模拟数据为辅。核心数据表至少要有三个:地区基础信息表(GDP、教育投入、师资力量、信息技术设备覆盖率)、Gen-AI应用场景参数表(各场景的效果系数、成本系数、风险系数)、人群分类表(学生、教师、管理人员等)。
2.2 预处理与特征构造
拿到数据之后,第一件事不是跑模型,而是做数据清洗。我能给的实操建议有这么几条:
一是统一口径。不同数据源的年份、地区划分方式、单位都不一样,必须先把所有数据对齐到同一套标准上。比如教育投入占GDP比例,有的数据源用百分比,有的用千分比,换算错一个量级,后面全废。
二是缺失值处理。教育类数据缺失是常态,对于缺失较少的数据用插值法,缺失较多的直接删掉该特征,不要硬填。特别注意区域数据缺失往往有系统性——越穷的地方数据越少,这时候“缺失本身”就是一个可以建模的信号,可以在论文里明确提出“数据缺失与地区发展水平的相关性”。
三是特征构造。把原始数据变成有业务含义的指标。例如:
- Gen-AI可用性指数 = 互联网覆盖率 × 智能设备保有率 × 数字化教学资源覆盖率
- 教育资源禀赋指数 = 教师人均培训经费 + 多媒体教室比例 + 图书馆人均藏书量
- 潜在风险暴露度 = 学生隐私数据敏感度 + 网络信息安全投入的倒数 + AI滥用历史事件数
这些构造出来的指标,在后面的综合评价模型里就是二级指标或三级指标。
2.3 数据不足时的合理假定
真实比赛里不可能什么数据都有,所以合理的假设和参数设定是必须的。做假设的原则有三条:
- 假设必须服务于模型逻辑,不能是为了方便计算而生造的。比如假设“Gen-AI工具的使用率随时间符合逻辑斯蒂增长曲线”,背后有技术采纳扩散理论的支撑,这就是合理假设。
- 参数要有文献或常识依据。比如Gen-AI对作业批改效率的提升率,可以参考已发表的实证研究,标一个出处;如果没有出处,就写清楚“本文设定该参数在某一区间内变化,并通过敏感性分析验证影响”。
- 所有模拟数据都要标记清楚。最终论文里用一整节“数据说明与合理性验证”来交代哪些是真实数据、哪些是模拟数据、模拟数据的生成机制是什么、结论对参数的敏感程度如何。评委不会因为你用模拟数据扣分,但会因为你用模拟数据却不说明而扣分。
记住一句话:在美赛里,数据假设写得越坦诚、越有逻辑,评委越信任你的结论。
3. 核心模型建立与算法选择
3.1 模型一:多指标综合评价体系
这一部分是地基,用来回答“Gen-AI的影响体现在哪些方面、怎么打分”。
先建立维度树。教育领域的Gen-AI影响评价,我建议分四个一级维度:
| 一级维度 | 二级指标举例 | 数据方向 |
|---|---|---|
| 教育质量 | 学生平均成绩变化率、知识掌握深度、批判性思维评分 | 正向 |
| 教学效率 | 教师备课时间变化、作业批改周期、个性化辅导覆盖率 | 正向 |
| 公平普惠 | 城乡资源差距变化、特殊教育可用性、弱势群体参与度 | 正向 |
| 风险控制 | 隐私泄露事件率、学术不端发生率、技术依赖度 | 负向 |
有了指标树之后,需要把不同量纲的指标标准化。正向指标用:
X_std = (X - X_min) / (X_max - X_min)
负向指标取倒数或反向变换后再标准化。
权重的确定我推荐熵权法与层次分析法组合。AHP能体现专家主观逻辑(比如“风险比效率重要”),熵权法能体现数据本身的信息量差异。两者取加权平均,既不怕太主观,也不怕太机械。
最后用TOPSIS法计算每个地区/情境的接近度,排序得到综合评价结果。TOPSIS的核心思想是计算每个方案与正理想解的相对距离,距离越小越好,这个概念非常直观,评委也容易看懂。
3.2 模型二:基于系统动力学的效应扩散模型
评价模型只能给出静态排名,但题目明显需要动态视角。Gen-AI的引入不是瞬间全覆盖的,它有一个扩散过程,这个过程决定了影响的累积效果。这里推荐用系统动力学模型,或者简化的微分方程模型。
最经典的扩散模型是逻辑斯蒂增长模型:
dI(t)/dt = r * I(t) * (1 - I(t)/K)
其中I(t)表示Gen-AI在目标人群中的渗透率,r是采纳速率,K是饱和容量。但做美赛不能只套一个逻辑斯蒂,需要扩展成带干预项的模型:
- 增加“政策干预强度”参数
u(t),当政策加码时,采纳速率提升; - 增加“风险反馈”项,如果风险事件增多,采纳速率下降;
- 增加“群体异质性”,把人群分为积极采纳者、犹豫者和抵触者,分别用不同参数。
把这些因素结合之后,可以用一组常微分方程来刻画不同人群的迁移过程。比如:
dS/dt = -α*S + β*R
dA/dt = α*S - γ*A
dR/dt = γ*A - β*R
其中S、A、R分别是未使用、使用中、停止使用的人群比例。这套“S-A-R模型”本质上是一种扩展的传染病模型,但它刻画的是技术采纳与流失的动态关系。模型的稳态解就是长期平衡状态,这个状态下的综合影响分数就是决策依据。
用Python的scipy.integrate.solve_ivp可以方便求解。模型跑完后,把每个时间点的渗透率带回到评价指标体系里,就能得到“影响随时间变化的曲线”,这在论文里是非常亮眼的结果图。
3.3 模型三:多情境仿真与部署策略优化
到这一步,团队需要回答“怎么部署才是最优的”。做法是构建多个典型情境,分别跑前面的模型。
举个例子,可以设置以下四种情境:
- 情境A(高资源-高准备度):经济发达地区,基础设施完善,教师数字素养高。
- 情境B(中等资源-中等准备度):一般城市,有一定基础,但师资培训不足。
- 情境C(低资源-低准备度):偏远地区,硬件设备有限,网络不稳定。
- 情境D(快速追赶型):资源虽少但政策推进力度极大,类似“弯道超车”模式。
每种情境下,设置不同的参数组合,跑出渗透率曲线和综合影响曲线。然后定义优化目标:最大化教育质量提升、最小化地区差距扩大、最小化风险事件发生概率。这是一个多目标优化问题,可以用加权求和法简单处理,也可以用NSGA-II跑一个Pareto前沿。
这里的关键是,最优策略绝不是“全面铺开”或“完全不采用”两个极端,而是“分阶段、分区域、差异化推进”。模型结果要能向这个结论收敛,论文才有说服力。
4. 完整源码实现与关键代码解析
4.1 整体代码架构
下面的代码是一个可运行的Python框架,包含数据生成、熵权法权重计算、TOPSIS评价、SAR扩散模型模拟以及可视化。跑完会得到两个核心输出:各情境的综合得分表和渗透率随时间变化的曲线图。
python复制import numpy as np
import pandas as pd
import matplotlib.pyplot as plt
from scipy.integrate import solve_ivp
from scipy.optimize import minimize
# 设置中文显示
plt.rcParams['font.sans-serif'] = ['SimHei', 'Microsoft YaHei']
plt.rcParams['axes.unicode_minus'] = False
np.random.seed(42)
4.2 指标数据生成与标准化
这一步生成四个典型情境的指标数据。每个情境有8个二级指标,前6个是正向指标(越大越好),后2个是负向指标(越小越好)。
python复制def generate_data():
scenarios = ['A_高资源', 'B_中等资源', 'C_低资源', 'D_快速追赶']
indicators = {
'成绩提升率': [0.18, 0.12, 0.05, 0.15],
'备课时间节省': [0.30, 0.20, 0.08, 0.25],
'个性化辅导覆盖率': [0.85, 0.60, 0.25, 0.70],
'教师数字素养': [0.90, 0.65, 0.30, 0.50],
'基础设施完备度': [0.95, 0.70, 0.35, 0.60],
'政策支持力度': [0.80, 0.70, 0.60, 0.95],
'隐私风险暴露度': [0.15, 0.25, 0.40, 0.20],
'学术不端发生率': [0.10, 0.18, 0.35, 0.15]
}
df = pd.DataFrame(indicators, index=scenarios)
return df
df = generate_data()
print("原始数据:")
print(df.round(3))
接下来做标准化处理。正向指标用极大值标准化,负向指标先取倒数再标准化。
python复制def normalize_data(df, neg_cols):
df_norm = df.copy()
for col in df.columns:
if col in neg_cols:
# 负向指标:倒数后极大值标准化
df_norm[col] = 1.0 / (df[col] + 1e-6)
df_norm[col] = df_norm[col] / df_norm[col].max()
else:
df_norm[col] = df[col] / df[col].max()
return df_norm
neg_cols = ['隐私风险暴露度', '学术不端发生率']
df_norm = normalize_data(df, neg_cols)
print("\n标准化后数据:")
print(df_norm.round(3))
负向指标取倒数再标准化,等于把“风险最低”变成“得分最高”,这样在后续TOPSIS计算中不需要再转换方向,统一按正向处理即可。
4.3 熵权法确定权重
熵权法的核心逻辑是:某项指标在不同情境下差异越大,说明它包含的信息量越大,权重就应该越高。代码实现如下:
python复制def entropy_weight(df_norm):
# 计算指标比重
n, m = df_norm.shape
P = df_norm.values / df_norm.values.sum(axis=0, keepdims=True)
# 计算熵值
eps = 1e-12
E = - (P * np.log(P + eps)).sum(axis=0) / np.log(n)
# 计算差异系数
D = 1 - E
# 归一化得到权重
W = D / D.sum()
return W
weights = entropy_weight(df_norm)
print("\n熵权法权重:")
for col, w in zip(df_norm.columns, weights):
print(f"{col}: {w:.4f}")
这里有三个细节要提醒:
- 熵值计算时,
P=0会导致log运算报错,所以要加一个极小的eps; - 权重之和默认为1,不需要再手动归一化;
- 如果某个指标在所有情境下都完全相同,它的熵值就是1,差异系数为0,权重为0,这是合理的——没有区分度的指标不应该影响决策。
4.4 TOPSIS综合评价
TOPSIS先找到正理想解(所有指标取最优)和负理想解(所有指标取最差),然后计算每个情境到两个理想解的距离比值。
python复制def topsis_evaluate(df_norm, weights):
W = np.array(weights)
V = df_norm.values * W # 加权标准化
ideal_pos = V.max(axis=0) # 正理想解
ideal_neg = V.min(axis=0) # 负理想解
d_pos = np.sqrt(((V - ideal_pos) ** 2).sum(axis=1))
d_neg = np.sqrt(((V - ideal_neg) ** 2).sum(axis=1))
score = d_neg / (d_pos + d_neg)
return score
scores = topsis_evaluate(df_norm, weights)
df_result = df.copy()
df_result['综合得分'] = scores
df_result = df_result.sort_values('综合得分', ascending=False)
print("\nTOPSIS综合评价结果:")
print(df_result[['综合得分']].round(4))
TOPSIS分数越接近1,说明该情境的综合表现越优。这个结果可以直接用于论文“不同部署情境的横向对比”章节,也可以和后面的动态扩散模型结果结合,做“动态综合评估”。
4.5 考虑风险约束的部署比例优化
现在做更进一步的决策优化。假设目标是在教育质量提升和风险控制之间找平衡点,需要求解每个情境的最优部署比例。
python复制def deployment_optimize(effectiveness, risk, budget=1.0):
# 目标函数:最大化 效用 - 风险惩罚
# x: 各情境部署比例
def neg_obj(x):
utility = np.dot(effectiveness, x)
risk_total = np.dot(risk, x) + 0.5 * np.dot(x, x) # 风险叠加项
return -(utility - 0.8 * risk_total)
# 约束:比例之和等于预算;各比例在[0,1]之间
constraints = [{'type': 'eq', 'fun': lambda x: np.sum(x) - budget}]
bounds = [(0, 1) for _ in range(len(effectiveness))]
x0 = np.ones(len(effectiveness)) / len(effectiveness)
res = minimize(neg_obj, x0, method='SLSQP', bounds=bounds, constraints=constraints)
return res.x
effectiveness = scores # 用TOPSIS得分作为有效性代理
risk = np.array([0.62, 0.54, 0.72, 0.58]) # 风险指数(模拟值)
opt_deploy = deployment_optimize(effectiveness, risk)
print("\n最优部署比例:")
for i, s in enumerate(df_result.index):
print(f"{s}: {opt_deploy[i]:.2%}")
这里加入了一个略复杂但很符合逻辑的点:风险不仅仅是线性累加,不同情境同时部署会产生叠加效应,所以用二次项0.5 * np.dot(x,x)模拟风险叠加压力。这属于模型设计的亮点,评委看到这种细节会认为团队真正在思考问题。
4.6 SAR扩散模型仿真可视化
最后用常微分方程模拟Gen-AI的采纳-流失动态过程。
python复制def sar_model(t, y, alpha, beta, gamma):
S, A, R = y
dS = -alpha * S + beta * R
dA = alpha * S - gamma * A
dR = gamma * A - beta * R
return [dS, dA, dR]
y0 = [0.98, 0.02, 0.0]
t_eval = np.linspace(0, 100, 200)
# 基础参数:高情境下采纳率高、流失率低
params = {'alpha': 0.15, 'beta': 0.02, 'gamma': 0.05}
sol = solve_ivp(
sar_model, [0, 100], y0, t_eval=t_eval,
args=(params['alpha'], params['beta'], params['gamma'])
)
plt.figure(figsize=(10, 6))
plt.plot(sol.t, sol.y[0], label='未采用者 S', linewidth=2.5)
plt.plot(sol.t, sol.y[1], label='使用中 A', linewidth=2.5)
plt.plot(sol.t, sol.y[2], label='停用者 R', linewidth=2.5)
plt.xlabel('时间(单位:月)', fontsize=12)
plt.ylabel('人群比例', fontsize=12)
plt.title('Gen-AI 技术采纳-流失动态扩散曲线(基础参数)', fontsize=13)
plt.legend()
plt.grid(alpha=0.3)
plt.tight_layout()
plt.savefig('sar_simulation.png', dpi=180)
plt.show()
上面的代码跑出来就是一条经典的S型采纳曲线和一条倒U型的使用中曲线。想让它更贴合题目,就把alpha(采纳速率)改成随政策投入变化的函数,或者分多个阶段设置不同的参数。
代码本身不复杂,但要注意
solve_ivp里args参数的类型必须与函数签名严格对应,这里特别容易报错。写的时候先用一个简单模型跑通,再逐步加复杂度。
5. 论文结构与写作技巧
5.1 摘要:摘要决定评委的第一印象
美赛的评审流程中,摘要几乎是决定晋级的最重要因素。评委在短短几分钟内,通过摘要判断这篇论文是否值得往下看。
我推荐的摘要结构是四段式:
- 第一段:题目背景+问题重述,一两句话;
- 第二段:你的整体建模思路,列出用了哪几个模型、解决哪几个子问题;
- 第三段:核心结果,写清楚关键数值,比如“模型结果表明,高资源情境下最优部署比例为XX%,综合影响得分为XX”;
- 第四段:政策建议的三条核心结论。
摘要要把每个子问题的最重要结论都触及到,即使只提一句。千万不要把摘要写成“本文建立了A模型、B模型、C模型”这样毫无信息量的列表。
5.2 假设、变量与符号说明
美赛论文的假设部分,既是加分项也是雷区。假设写得太多会让人觉得模型失真,写得太少又显得考虑不周。最佳策略是按“必要性”分层:
- 关键假设:影响模型结构的假设,必须在前言就说明。比如“假设Gen-AI的引入不影响学生的心理发展轨迹,只影响学习效率”;
- 常规假设:如“所有数据均来自公开统计源”、“模拟数据在敏感性分析中检验”;
- 模型参数假设:这一部分放在对应模型的章节里,不要全部堆在前面。
符号说明表建议用三线表格式,列出符号、含义、单位/量纲。这里不要偷懒,详细的符号表会让评委在阅读公式时省力很多,以往的获奖论文几乎都有完整的符号说明附录。
5.3 敏感性分析:让结论更硬气
很多团队建模时跑了结果就直接写结论,这是错的。要回答“你的结论在参数变化时还成立吗”,必须做敏感性分析。
我建议至少做三组敏感性分析:
- 权重敏感性:把熵权法得到的权重上下浮动10%和20%,看TOPSIS排名是否发生明显变化;
- 扩散参数敏感性:让采纳速率
alpha和流失速率gamma在合理区间变化,记录渗透率达到50%的时间窗口变化; - 风险系数敏感性:在部署优化模型中改变风险惩罚系数,观察最优部署比例的变化趋势。
敏感性分析的结果不需要太复杂,用一张热力图或几条折线图就能展示清楚。关键是要在论文里写一句话:“上述结果表明,在参数波动的合理范围内,模型的核心结论保持不变,说明结论具有鲁棒性。”只跑模型不验证,评审印象分会直接差一档。
5.4 可视化:图表是论文的脸面
美赛对图表要求极高,而且不光是好看,更要能传递信息。我的经验是:
每张图都要有三个要素:明确的标题、单位标注、图内注释。不要只放一张截图,要在图下加一段解释性文字,告诉评委“这张图说明了什么”。
常用图表安排如下:
- 指标体系图可以用思维导图形式;
- 热力图展示不同情境下指标得分;
- 扩散曲线图展示SAR模型模拟结果;
- 折线图展示不同政策的敏感性分析;
- 雷达图展示各情境综合能力对比。
Python的matplotlib和seaborn完全够用。如果团队熟悉plotly,做一个交互式图表也是加分项,但不要因为做太花哨的图而占用写正文的时间。
6. 常见问题与避坑指南
6.1 时间分配的坑
美赛从周五早上到周一晚上,看起来有三天多,实际上非常紧张。往年团队最容易陷进去的是前期的数据搜集和参数设定,一个数据纠结一上午。我的建议是:
- 第一天上午:定题、读题、列假设、确定建模框架;
- 第一天下午到晚上:搭建评价模型和扩散模型,跑通第一版;
- 第二天全天:做多情境仿真、敏感性分析、画图;
- 第三天上午:写论文主体部分(问题分析、模型建立、模型求解);
- 第三天下午:写摘要、摘要、再改摘要。
一定要留出至少四个小时专门打磨摘要。摘要写完不是结束,要反复朗读,找出任何啰嗦的地方删掉。
6.2 数据与模型的匹配问题
这是一个非常常见的翻车点:数据是真实数据,但当数据无法支撑模型输入时,团队就开始编数据,又不编得像,导致结果出现明显矛盾。
解决办法只有一个:在设计模型之前先想清楚数据能不能满足这个模型的输入要求。如果做的是宏观评价模型,就不要引入需要微观个体数据的参数;如果做的是动态仿真,就要明确初始值从哪来、参数用什么方法标定。模型复杂度不是越高越好,和数据匹配的模型才是好模型。
6.3 源码和结果的对应关系
美赛不要求提交完整的代码包,但论文里出现的每一个编号公式、每一个图表,都要能在代码里找到对应的实现。团队内部要做好版本管理,多人并行写代码时,最简单的方法是用“同一份数据文件+同一个运行环境”,避免出现你算的和我算的不一样的尴尬局面。
代码里的变量命名也要规范。评审批不了你全部代码,但如果你在附录里贴了一段变量名全是a1,b2,c3的代码,观感很差。宁可多写几行注释,也不要让代码看起来像天书。
6.4 摘要写作的五个禁忌
- 禁忌一:出现“本文试图”“我们希望”这类不确定词汇;
- 禁忌二:只写做了什么,不写做出来什么结果;
- 禁忌三:出现没有解释的参数符号;
- 禁忌四:建议部分与模型结果脱节;
- 禁忌五:篇幅超过一页。
我自己参加美赛和带队的体感是,每年都有不少队伍在模型上做得不错,最后却因为摘要不得要领而止步S奖。摘要不需要炫技,只需要让评委快速复制你的完整结论。
这道题还有很大的扩展空间,比如把评价模型换成更细的Agent仿真,或者把优化模型换成强化学习框架,都能做出更漂亮的结果。但无论模型怎么升级,核心永远是“逻辑自洽、数据可信、结论可落地”。美赛毕竟是竞赛,不是科研,把整个故事讲圆,比做出一百个花哨的模型更重要。
