融合多源异构数据与架构级幻觉缓解的棉花生产大语言模型安全决策框架

张鹏宇 ,  邢玉佳 ,  杨秘 ,  张泽 ,  吕新

中国农业大学学报 ›› 2026, Vol. 31 ›› Issue (9) : 69 -81.

PDF (1950KB)
中国农业大学学报 ›› 2026, Vol. 31 ›› Issue (9) : 69 -81. DOI: 10.11841/j.issn.1007-4333.2026.09.06

融合多源异构数据与架构级幻觉缓解的棉花生产大语言模型安全决策框架

作者信息 +

A safety decision-making framework for large language models in cotton production integrates multi-source heterogeneous data and architecture-level hallucination mitigation

Author information +
文章历史 +
PDF (1996K)

摘要

针对现有大语言模型智能体框架在多源异构农业感知数据处理中普遍缺乏语义可靠性验证、易引发“垃圾进-垃圾出(GIGO)”效应并产生灾难性幻觉决策的问题,本研究以“默认不可信”为核心设计理念,构建了一种四层功能解耦安全架构,并在新疆棉花生产场景下对其安全决策能力进行验证。结果表明:该架构将灾难性幻觉率由紧耦合基线的45%降至13%,较软验证反思基线(29%)降幅显著;模块消融实验进一步证实了感知层硬验证与符号审计2个安全模块的独立作用,二者协同构成了纵深防御机制;经领域适配的8B模型在新疆棉花专业基准上准确率达72.1%,以约为其1/9的参数量超越了Llama3-70B(61.3%),为智慧棉花生产中多源异构数据实时融合与算力受限的决策场景提供了可信、高效、可迁移的架构方案。

Abstract

Existing large language model (LLM) agent frameworks lack semantic reliability verification for multi-source heterogeneous agricultural perception data, leaving them vulnerable to the “garbage in, garbage out”(GIGO) effect and catastrophic hallucinated decisions. This study proposes a four-layer functionally decoupled safety architecture grounded in an “untrusted-by-default” design principle and evaluates its decision-making safety in Xinjiang cotton production scenarios. The architecture reduces the catastrophic hallucination rate from 45% (tightly coupled baseline) to 13%, a markedly greater reduction than that achieved by the soft-validation reflective baseline (29%). Ablation experiments confirm the independent contributions of the perception-layer hard validation and symbolic audit modules, which together constitute a defense-in-depth mechanism. On the Xinjiang Cotton Benchmark, a domain-adapted 8B model attains 72.1% accuracy-surpassing Llama3-70B (61.3%) with approximately one-ninth of the parameters. The architecture provides a trustworthy, efficient, and transferable solution for real-time multi-source heterogeneous data fusion and decision-making under computational constraints in smart cotton production.

Graphical abstract

关键词

棉花生产 / 大语言模型 / 智能体 / 幻觉缓解 / 可信决策

Key words

cotton production / large language model / agent / hallucination mitigation / trusted decision-making

引用本文

引用格式 ▾
张鹏宇,邢玉佳,杨秘,张泽,吕新. 融合多源异构数据与架构级幻觉缓解的棉花生产大语言模型安全决策框架[J]. 中国农业大学学报, 2026, 31(9): 69-81 DOI:10.11841/j.issn.1007-4333.2026.09.06

登录浏览全文

4963

注册一个新账户 忘记密码

新疆棉花产量占全国90%以上,是区域经济的重要支柱。其生产高度依赖荒漠绿洲灌溉农业,大陆性荒漠气候对灌溉、施肥和化学调控的时机与用量要求极为苛刻。在此安全关键场景中,农事决策失误可导致大面积减产和重大经济损失。因此,构建安全、可信的智能决策支持系统已成为新疆棉花生产现代化的迫切需求。
棉花生产决策有赖于多源异构数据的实时融合:宏观层面,需借助Google Earth Engine(GEE)等平台获取Sentinel-2卫星遥感影像1,结合深度学习进行作物长势评估与环境胁迫分析;微观层面,需融合物联网节点实时采集的土壤墒情、田间小气候等地面传感数据2;决策支持层面,则需动态接入实时气象预报API,并整合农户的实地观测与经验反馈。上述数据来源高度异构,时效性与可靠性差异悬殊,如何有效融合与管理这些数据,构成棉花智能决策系统的核心技术挑战。
针对这一挑战,国内外学者开展了广泛研究。以大语言模型(Large language model,LLM)作为规划核心,动态调用外部工具完成复杂任务,已成为当前智能体研究的主流。在LLM智能体框架层面,ReAct框架3、MetaGPT4以及Geo Agent5等智能体框架展现了LLM整合多源工具的能力。然而,现有框架的鲁棒性设计多聚焦于功能正确性,即主要确保工具调用语法有效、代码可执行,而缺乏对工具输出语义可靠性的验证机制,在安全关键的农业决策场景中极易诱发“garbage in,garbage out”(GIGO)效应。
幻觉缓解技术大致分为两类:一是基于链式思考CoT6提示、检索增强生成RAG7与Self-Refine8的“软约束”方法,这些方法依赖模型自身的推理审查输入,当输入数据在语义上具有强迷惑性时,这种自我循环式审查存在本质局限,无法阻断语义失效的GIGO数据;另一类是基于规则约束的“硬约束”方案9-10,但多局限于孤立的特定规则校验,缺少架构层面的系统设计。
在农业AI决策层面,Pan等11构建了面向农业数据管理与分析的多智能体系统,开始将LLM引入决策与农事问答,低秩适配(Low-rank adaptation,LoRA)12与知识蒸馏13也在垂直领域验证了精调小模型的可行性,模型压缩技术也为资源受限场景的部署提供了支撑14。然而,现有农业AI研究大多聚焦于单一感知任务或传统的问答交互,缺乏在统一框架内对遥感、物联网等多源异构数据进行语义融合的系统设计,且尚未将端到端的安全性纳入系统设计的核心约束。基于上述不足,本研究确定以下核心目标:1)建立架构级硬验证GIGO拦截机制。利用Pydantic确定性规则将农学领域约束显式编码为独立架构关卡,突破传统依赖模型自我反思的软验证路线在语义拦截上的局限,从架构层面拦截语义失效数据,大幅压降灾难性幻觉率。2)构建轻量化棉花领域专用模型。探索输入块扩展预训练(Input block expansion,IBE)与知识蒸馏流程,使经济领域适配的轻量8B模型在新疆棉花专业基准(Xinjiang cotton benchmark,XCB)上取得显著性能提升,以远小于通用大模型的参数规模实现超越,开辟面向资源受限场景的高效部署路径。3)提出基于神经-符号双过程的交互与决策闭环。引入LoRA受控多轮问答机制,解决用户侧模糊输入问题,并构建独立于模型外部的符号规则库,对生成的农事草案进行交叉审计,通过闭环反馈机制在逻辑层面锁定棉花生产的决策安全边界。

1 材料与方法

1.1 系统总体架构

针对通用LLM Agent框架在棉花生产安全决策场景中对感知数据语义可靠性缺乏验证的问题,本研究提出一种四层功能解耦架构,由感知层、知识层、交互层和安全决策层组成(图1)。感知层在数据入口部署基于Pydantic15的硬验证关卡,对从卫星遥感、IoT传感器和气象API等多源原始数据施加约束规则,拦截语义失效的数据输入。通过验证的感知数据与交互层收集的用户上下文共同进入知识层;该层以IBE块扩展训练的领域模型为核心,结合动态检索增强生成(Retrieval-augmented generation,RAG),为后续推理提供事实依据。交互层则通过受控多轮问答机制澄清用户意图,补全决策所需信息。安全决策层采用神经提案-符号审计双过程结构:在神经模型生成决策草案后,由独立的符号规则库进行交叉核验,并通过闭环反馈对不合规草案实施强制修正。各层之间通过显式验证协议传递数据,而非默认信任,从而确保任何层级的异常输出都不会向下一层传播。该框架通过IBE块扩展与LoRA两阶段训练完成领域适配,无需对底层大模型进行全参数训练,在显著降低计算成本的同时将安全约束内嵌于架构层面。

1.1.1 感知层硬验证机制

感知层负责采集卫星遥感、IoT地面传感和气象API等外部数据,并在进入认知核心前对其语义可靠性进行验证(图2)。以卫星遥感为例,系统通过Google Earth Engine16获取目标地块最新的Sentinel-2影像,提取多光谱特征,输入预训练回归模型反演氮、磷、钾、株高和叶绿素等农学参数,再将结果转化为结构化描述供后续推理使用。IoT传感与气象API链路采用相同的接入验证机制。所有输出均需通过基于Pydantic的硬件验证关卡,并同步提交关键过程元数据;未通过验证的结果将被直接拦截,不能进入知识层。感知层验证函数V(r)如下:

V(r)=True,ifi=1nfimi=TrueFalse,otherwise

式中:V(r)为感知层验证结果,r为感知工具返回的原始响应;mi为该响应中携带的第i项过程元数据;fi()为对应的确定性约束谓词;n为当前链路所需校验的元数据维度数。

V(r)=False时,系统将失效感知源从当前决策上下文中剔除。仅当所有约束谓词同时满足(即V(r)=True)时,响应被判定为语义有效并放行;任一谓词不满足则V(r)=False,响应在架构层面被直接拦截并标记为语义失效,不进入知识层。各感知链路硬验证约束谓词及参数设定如表1

1.1.2 知识层混合注入

本架构以Llama3-8B作为模型基座,通过IBE块扩展17与LoRA12两阶段训练策略完成领域适配。领域知识注入依赖两组核心语料:1)静态机构知识库,收录约0.2B token的专业文本,来源涵盖权威专著、学术论文及棉花标准种植技术手册;2)推理增强指令集(XJ-Cotton-SFT-810K):先利用上述静态机理知识库对Llama3-70B-Instruct18进行LoRA领域增量微调,再由该教师模型围绕棉花全生育周期39个主题生成81万组多轮问答对,用于实现向8B基座模型的数据级知识迁移。

基于上述领域语料,本层采用静态参数注入与动态检索增强相结合的混合知识注入策略,在保留模型通用推理能力的同时,将新疆棉花领域知识通过静态机构知识库、推理增强指令集和动态时空知识库等注入模型。

在模型训练方面,以Llama3-8B为基座,采用IBE块扩展策略17进行训练。具体方法为:在原有32个Transformer块的基础上均匀插入8个新块,总块数扩展至40,参数量增量约为基座模型的25%。训练时仅优化新插入块及层归一化层的参数,使用静态机理知识库与推理增强指令集的混合语料,在8×A100 GPU上以1×10⁻⁴的学习率、256的全局批次大小完成3个epoch的训练,输出Cotton-Llama-8B-IBE模型。

为弥补静态模型参数在时效性信息上的不足,本研究构建了面向新疆棉花生产的动态时空知识库,作为RAG模块的检索基础。知识库的原始文档来源于实时农情监测报告、气象专报以及本地化植保情报等持续更新的文本。所有文档入库前均进行时空元数据登记与基于语义边界的文档切分,以确保检索粒度与农事决策的实际需求相匹配。

在向量化与索引方面,本模块采用BGE-M3-large模型19将各文档片段同时编码为1024维稠密向量与稀疏词权重向量。稠密向量端基于FAISS库20构建向量索引,稀疏端则基于BM25算法构建倒排索引;检索时两路分别召回候选集,并通过倒数秩融合(Reciprocal rank fusion,RRF)进行重排序。检索时,系统首先基于用户查询中的时空实体进行元数据硬过滤,随后在符合时空约束的候选集内执行上述混合检索,返回融合得分最高的5个相关片段。

该知识库在后续架构中作为RAG模块的动态知识源。推理时,系统会根据用户查询检索Top-5最相关片段,并将其拼接至模型输入上下文,使模型能够实时调用最新农情事实,有效弥补了静态参数的时间滞后性。

1.1.3 交互层受控澄清策略

在棉花实际生产管理中,用户侧的信息缺损和意图模糊是GIGO重要诱因。本层采用基于约束的澄清策略,构建受控多轮问答流程。首先,定义决策信息完整性向量I=[l,c,s,d,h],其中l为地块位置,c为作物品种与生育期,s为症状或需求描述,d为近期管理措施,h为田间环境条件。5个维度作为显式约束条件写入系统提示词,指导模型在每轮交互中评估用户输入的信息完整度。当关键决策要素缺失时,模型主动挂起下游推理并生成针对性追问,直至上下文满足最小决策依据要求。该阶段微调的目标为交互风格,即以 Cotton-Llama-8B-IBE 模型为基座,使模型模拟新疆本地农技专家的问询逻辑,以受控方式主动补全决策所需上下文。训练数据为手动标注的2 000个模拟农事问询场景。交互策略通过LoRA指令微调实现12,训练阶段秩设置为r=32,缩放系数α=64,dropout=0.05,仅对注意力投影矩阵(Q、V)进行低秩分解,以最大限度降低灾难性遗忘风险,使模型具备面向新疆棉花场景的受控澄清能力。此阶段产出的是Cotton-Llama-8B-Chat模型。

1.1.4 安全决策层神经-符号双过程

安全决策层由神经生成子系统和符号审计子系统构成,两者通过闭环反馈机制协同工作。系统采用“神经-符号双过程”架构21,将大语言模型的生成能力与农学约束严格解耦(图3)。神经生成子系统基于经感知层验证、知识层增强和交互层澄清后的多源上下文,生成具有上下文适应性的农事决策草案a^。符号审计子系统作为一道独立于模型推理之外的棉花种植规则关卡,内置由领域专家编写的硬约束规则库。该规则库包含58条审计规则,覆盖棉花全生育周期的关键农事操作。审计过程形式化定义为:对于特定决策草案a^,系统逐项验证规则库中所有的适用规则,综合审计结果Aa^)计算定义为:

A(a^)=japplicablerj(a^)

式中:A(a^)为符号审计子系统对草案a^的综合审计结果,当且仅当所有适用规则谓词同时满足时取值为True,否则为False;a^为神经生成子系统输出的农事决策草案;为符号审计规则库,包含全部58条硬约束规则;applicable为规则库中对当前草案a^适用的规则子集;rj为第j条适用规则对应的确定性约束谓词,返回值为True或False。

规则库按棉花全生育周期分为播种期、苗期、蕾期、花铃期、吐絮期5个阶段模块,涵盖灌溉、施肥、化学调控、病虫害防治与采收五类操作约束。规则库由3名具有10年以上新疆棉花栽培经验的领域专家依据实际生产经验编写,经交叉审核后定稿。冲突处理:当同一草案触发多条规则否决时,系统将所有违规条目按生育阶段优先级排序后统一反馈至神经生成子系统,而非逐条迭代修正,以避免规则间的修正震荡。当前规则库尚未引入系统化的规则优先级仲裁机制,此问题已在3.4节中讨论。表2列出了若干典型审计规则及其逻辑形式,以展示规则库的覆盖范围与约束逻辑。当A(a^)=True时草案通过审计并输出为最终决策;否则进入闭环反馈修正流程。

在闭环反馈修正阶段,系统将具体违规条目及其对应的农学解释作为显式负面约束回注至大模型的输入上下文,强制其在新约束下重新生成决策草案。修正流程设置最大迭代次数Nmax=3:若经3次重规划后草案仍未通过全部审计规则,系统终止自主决策流程,提示用户自行决策。这种降级策略确保系统在规则覆盖边界处选择拒绝回答而非冒险输出,与感知层的设计理念一致。

这种“神经提案—符号否决—约束反馈”的协作模式,在保留大模型灵活处理复杂农事问题能力的同时,通过独立于模型之外的确定性规则在逻辑层面约束灾难性输出,为农业决策安全提供可解释的鲁棒性保障。

1.2 评价数据集

本研究使用2个专门构建的数据集对系统进行评估,各数据集的规模与用途如表3所示。

新疆棉花基准(Xinjiang cotton benchmark,XCB):鉴于公开领域目前缺乏专门针对新疆棉花决策场景的评测基准,本研究联合5名从业10年以上的新疆本地资深棉农,对第三方农技平台的历史农事问询数据进行遴选,构建了包含1 000个本地化专业问答对的评测集。数据来源在地理上覆盖北疆(石河子、奎屯垦区)与南疆(阿克苏、库尔勒等棉区)主要产棉区,确保样本涵盖不同光热资源条件与灌溉模式。题目设计刻意规避一般性农学常识,着重考察新疆本地化条件,具体体现在3个维度:1)品种适配性,涉及“新陆早”及“新陆中”系列主栽品种的生育期参数与管理差异;2)水肥决策精度,涉及膜下滴灌模式下的精量水肥调控时机与剂量判断;3)本地病虫害防治,涵盖棉铃虫周期预测与防治窗口判断等新疆本地高发病害的处置逻辑。数据集的题目与答案均源于真实的线上农事咨询交互,全面覆盖棉花全生育周期的典型关键决策节点,旨在检验模型对新疆本地农艺条件的掌握程度和本地化适用性。评测时,为验证感知层功能,本研究为这些纯文本问答动态匹配了问题对应的地块时空与传感背景数据。

错误注入数据集(Fault injection dataset,FID):针对安全性评估,本研究基于第三方大数据平台历史日志,手动设计100个安全关键场景,每个场景包含一个被刻意污染的感知层输入。污染强度均超出感知层硬验证阈值,但保持数据格式合规。各感知链路的拒绝阈值均依据新疆棉区Sentinel-2质量评估实践经验及相关传感器可靠性研究设定,污染参数在此基础上取超出阈值10%~300%的范围,覆盖从边界违规到严重失效的完整语义失效梯度。污染类型分为两类:第一类为单源污染(70个),模拟单一传感器或数据源的严重失效,包括遥感链路云覆盖率取值范围35%~95%(阈值30%)、影像时效性超期11~30 d(阈值10 d),IoT链路数据缺失率20%~60%(阈值15%)或传感器完整性标志强制置False,气象API响应延迟35~120 min(阈值30 min)或关键字段强制置空;第二类为多源协同轻度降级(30个),各单项异常指标控制在硬验证阈值的110%~130%范围内,单项均未触及拒绝阈值,但综合数据质量已无法满足可靠推理的需求,旨在考察系统依赖符号审计与闭环反馈机制防范规则盲区的兜底拦截能力。所有场景的正确系统行为由3名领域专家依据感知层硬验证规则库和符号规则库独立核验,3名专家对全部100条场景的判定结果完全一致,无争议样本。

1.3 评价指标

本研究从安全性和领域专业性两个维度评估系统性能,共设三项评价指标。灾难性幻觉率(Catastrophic hallucination rate,CHR)用于衡量系统在错误注入场景下仍输出具体农事建议的比例,定义为:

CHR=NhallucinationNtotal×100%

式中:Nhallucination为系统在错误注入场景下仍输出具体操作建议(如:“立即灌溉”)的场景数,个;Ntotal为FID数据集总场景数(100),个。

拒答率(Refusal rate,RR),衡量系统在错误注入场景下成功触发安全降级机制的比例,定义为:

RR=NrefusalNtotal×100%

式中:Nrefusal为系统输出受控澄清、剥离型保守决策或强制告警等安全降级响应的场景数,个;Ntotal为FID数据集总场景数(100),个。

CHR与RR共同描述系统安全性:CHR衡量错误输出的比例,RR衡量正确拒绝的比例,两者互补。对于安全性评估场景,本研究将正确系统行为严格定义为系统贯穿所有防御链路后触发安全降级,具体包括:识别多源语义矛盾后主动挂起推理的受控澄清、经规则违规反馈后仅依赖剩余可靠数据输出的剥离型保守决策,或因多次重新规划仍未通过审计而触发的强制告警;仅当系统强行输出具有误导性的操作指令时,方被判定为产生灾难性幻觉。

任务准确率(Accuracy),衡量系统在领域专业问答上的正确率,定义为:

Acc=NcorrectNtotal×100%

式中:Ncorrect为经双层评审判定为完全正确和基本正确的答案数,个;Ntotal为XCB测试集总题数,个。

评分采用三分类体系(完全正确/部分正确/错误),以第三方农技平台的历史专家回答作为评审参考背景而非固定标准答案,最终判定由评审人依据田间实践经验与农学机理独立作出。评测实施阶段,首先将1 000个专业问题输入待测模型,收集生成的全文本农事决策方案,并进行匿名化与乱序脱敏处理;随后由5名近5年连续高产的资深种植户依据实际田间经验对生成方案进行独立盲审和初评;对初评中产生意见分歧的边缘方案,提交给3名具有10年以上新疆棉花栽培研究经验的领域专家进行深层机理论证与研讨,最终通过协商达成共识。

1.4 实验设计

为系统评估本架构的有效性,设计了两组实验。实验A在FID数据集的100个错误注入场景上,对比本架构、紧耦合基线(TCA)和反思基线(RA)的灾难性幻觉率(CHR),以评估架构级确定性约束相较于模型自我反思路线的安全性差异。三种配置共享相同的LLM核心、工具集与系统提示词,唯一变量为数据验证机制:TCA不含验证指令,RA采用基于Self-Refine的软验证策略8,本架构则在感知层和决策层分别部署Pydantic硬验证与符号审计关卡。每种配置独立运行3次以保证结果稳定性。实验B通过消融实验考察IBE块扩展预训练、知识蒸馏、LoRA行为对齐和RAG动态检索对领域准确率的贡献,在XCB基准上评估各组件带来的增益,并以Llama3-8B和Llama3-70B作为通用模型参照。

2 结果与分析

2.1 GIGO安全及鲁棒性测试

本实验在FID(错误注入数据集)的100个安全关键决策场景上,对本架构与TCA(紧耦合基线)、RA(反思基线)进行对比评估,并通过模块消融实验量化感知层硬验证与“符号审计+闭环反馈”2个安全模块的独立贡献,结果如表4所示。

表4所示,5种配置的CHR呈现出清晰的梯度分布,各安全模块的独立贡献得到有效量化。在基线对比方面,TCA(S1)的CHR为45%,反映了在缺乏任何验证机制的条件下,格式合规的污染数据可直接进入下游推理——例如云覆盖率达80%的遥感影像或气象API空值响应等低质量数据,在语法层面均能通过检查,并直接触发具体农事建议的生成。引入Self-Refine自我反思机制的RA基线(S2)将CHR降低至29%,说明基于提示的自我审查对具有明显异常特征的输入具有一定过滤效果。然而,当污染数据在语义上与有效数据高度相似时,依赖模型自身推理进行自我审查存在循环依赖的本质局限,导致仍有近三分之一场景产生幻觉决策。

模块消融方面,2个安全模块对CHR的压降均有独立且可量化的贡献。去除感知层硬验证(S3)后,CHR从13%回升至27%,接近RA基线水平,表明感知层是承担GIGO污染数据的主要过滤职责的一线拦截核心;此时符号审计仍保留,拒答率为21%,高于完整架构的16%,原因在于更多污染数据穿透感知层后到达决策层,触发符号审计否决的概率随之上升。去除符号审计与闭环反馈(S4)后,CHR回升至20%,高出完整架构7个百分点,说明符号审计对已通过感知层的边界案例具有二次拦截作用;由于此配置无主动拒答出口,系统在审计缺失时倾向于直接输出边界草案而非拒绝,拒答率相应为零。

S3与S5的对比进一步揭示了两模块的协同价值:二者均配备符号审计与闭环反馈,尽管S3因失去前线拦截导致更多脏数据涌入决策层,迫使符号审计被动触发了更高的拒答率(21% vs. 16%),但其CHR依然大幅回升至27%。更深层次的逻辑在于系统可用性:完整架构(S5)在保持最低幻觉率(13%)的同时,实现了高达71%的安全放行率(即系统在感知层精准、静默地剔除单一污染源后,仍能基于富余的干净上下文做出完全正确的决策);而S3架构的安全放行率仅为52%。上述结果验证了纵深防御设计的有效性:单独依赖任一模块均无法达到完整架构的安全水平,两者协同才能系统性地将CHR从45%压降至13%,对13%残留失败案例(共13例)进行定性分析,可归纳为两类边界情形:1)阈值邻近型(9例),污染数据的关键元指标(如云覆盖率32%)仅略超阈值,时序积分统计的正常浮动导致个别场景中规则未被触发;2)多源协同降级型(4例),气象API轻度延迟与遥感影像轻度污染同时发生,各单项指标均未达到硬拒绝阈值,但综合数据质量已低于可靠决策所需的信息下限。这些失败模式均属规则覆盖盲区,而非软约束意义上的推理局限,为后续多元协同降级联合规则与自适应阈值校准研究指明了方向。

2.2 领域专业性消融测试

为系统评估各组件对领域专业性的独立贡献,在XCB基准上对7种系统配置进行准确率(Acc)消融分析,结果如表5所示。

从准确率维度看,各组件的边际贡献呈现差异化分布。通用底座模型Llama3-8B与通用SOTA模型Llama3-70B的准确率分别为40%与61.3%,表明缺乏领域适配的模型在新疆棉花专业问题上存在明显局限,参数规模优势难以弥补领域知识的缺失。引入IBE块扩展增量预训练与知识蒸馏后,Cotton-Llama-8B-IBE的准确率提升至72.1%,在参数量约Llama3-70B的九分之一的条件下超出后者10.8个百分点,有力验证了深度领域适配的必要性。在此基础上引入SFT交互对齐(架构v1.0),准确率升至76.5%,反映了行为约束对用户意图准确理解的实质贡献。进一步叠加RAG动态检索(架构“v1.1”),准确率提升至78.2%,增幅相对有限(+1.7%)。这与XCB测试集侧重农学推理链完整性而非孤立事实召回的考核导向一致。随后引入感知层硬验证模块,将准确率进一步推升至82.1%(+3.9%),有效阻断了低质量信息对推理的干扰。最后,升级为融合符号审计的完整Agent架构,准确率达到85.3%,增幅为(+3.2%),表明多轮澄清交互与符号审计的协同对复杂决策场景具有不可替代的作用。

3 讨 论

3.1 架构设计贡献

现有LLM智能体框架的鲁棒性设计普遍聚焦于功能正确性,对工具输出的语义可靠性缺乏显式验证。在棉花生产这类安全关键场景中,这一设计盲点会导致格式合规的污染数据难以畅通地进入推理链,直接诱发灾难性决策。TCA基线45%的幻觉率,本质上是“默认信任工具输出”这一隐式假设的系统性代价。本研究提出的四层架构将可靠性保障从模型内部的推理自纠正迁移至架构层面的确定性约束,使安全性成为独立于模型选型的系统属性,而非依赖特定模型推理质量的涌现结果。

3.2 感知层验证关卡:从软约束到确定性约束

RA基线的自我反思机制将CHR从45%降至29%,表明软约束对具有显著异常特征的输入具有一定过滤效果,但存在明显上限。当污染数据格式合规且数值处于表面合理区间时,模型以同一套推理能力既生成假设又负责核验,循环依赖难以规避。感知层的Pydantic硬验证将云覆盖率、影像时效、传感器完整性等领域约束显式编码为独立于模型推理之外的确定性谓词,CHR因此压降至13%。对残余失败案例的分析表明,13%的失败均源于规则覆盖盲区,而非推理局限,这将后续优化方向从不可解释的模型调优精确定位至可追溯的规则完善。

3.3 知识-交互双层协同:双源GIGO的系统性治理

Cotton-Llama-8B-IBE在XCB基准上以72.1%的准确率超越参数量约为其9倍的Llama3-70B(61.3%),表明在知识边界高度专业化的场景中,领域适配深度比模型规模更能决定性能上限。交互层针对的是用户侧信息缺损这一独立风险源:农户问询往往缺乏地块位置、生育期、近期管理措施等关键要素,在不完整上下文下直接生成建议,错误根源在于输入缺损而非知识匮乏。受控多轮问答通过决策信息完整性向量对输入实施结构化约束,主动补全最小决策依据后方才启动下游推理。完整Agent架构相较基础模型配置(Cotton-Llama-8B-Chat+RAG)提升了7.1个百分点,印证了系统层面协作设计的不可替代性。RAG模块在XCB上的增益未达显著(+1.7%),与测试集侧重推理链完整性而非事实检索的考核导向一致,因此,不宜由此否定该模块的整体价值。

3.4 局限性及未来工作

本研究存在两点主要局限。其一,感知层阈值依赖新疆棉区领域经验设定,跨区域迁移时需重新标定,人工成本较高;未来工作将引入基于历史感知数据的自适应阈值学习机制,通过对真实田间数据分布的持续拟合实现阈值的自动校准,以降低跨区域迁移成本。其二,符号规则库对多源异常叠加的复合场景覆盖不足,规则间优先级冲突尚未系统处理;针对2.1节中识别的多源协同降级型失败案例,未来工作组拟设计基于多源质量指标联合评分的协同降级检测规则,通过构建跨链路质量状态的综合评估函数替代当前的单项谓词独立判断机制,从规则覆盖层面系统填补此类盲区。

4 结 论

本研究围绕新疆棉花生产这一安全关键的农业决策场景,揭示了现有通用LLM Agent框架在处理多源异构感知数据时存在的GIGO风险,提出了以“默认不可信”为设计理念的四层功能解耦安全架构。该架构的核心贡献在于,将系统可行性确立为独立的工程约束,摆脱了对特定模型推理质量的被动依赖,从而在架构层面实现了对幻觉和语义失效数据的硬拦截。架构具有模块化特性:感知层验证规则可针对目标作物重新标定,知识层支持领域知识库的无缝替换,符号规则库可持续迭代,为向其他安全关键的作物生产场景迁移奠定了工程基础,并展现出拦截脏数据的高鲁棒性与低算力依赖优势,能够直接适应气象多变、传感器易受损的复杂大田环境及农业边缘端部署需求。

实验结果验证了本架构的2个核心结论。其一,架构级硬验证将灾难性幻觉率从紧耦合基线的45%压降至13%,显著优于Self-Refine软约束路线(29%);消融实验进一步表明,相较于完整架构,剥离感知层硬验证与符号审计分别导致CHR回升14个和7个百分点,二者协同构成不可替代的纵深防御机制。其二,经IBE块扩展与知识蒸馏深度适配的8B领域模型在新疆棉花专业基准上准确率达72.1%,以约为通用70B模型1/9的参数规模实现超越(61.3%),为资源受限的农业一线部署提供了切实可行的轻量化路径。

未来工作将聚焦3个方向:引入基于历史数据的自适应阈值学习,降低跨域迁移的人工标定成本;探索案例推理驱动的符号规则自动扩展机制,提升审计覆盖率;开展多生长季真实棉田部署研究,构建更大规模的自动化评测基准,为系统持续迭代提供实证基础。

参考文献

[1]

Drusch MDel Bello UCarlier SColin OFernandez VGascon FHoersch BIsola CLaberinti PMartimort PArino OBerger MBiasutti RCarnicero BGreco BSilvestrin PSpoto FSy O. Sentinel-2ESAs optical high-resolution mission for GMES operational services [J]. Remote Sensing of Environment2012120: 25-36

[2]

Jawad H MNordin RGharghan S KJawad A MIsmail M. Energy-efficient wireless sensor networks for precision agricultureA review [J]. Sensors201717(8): 1781

[3]

Yao SZhao JYu DDu NShafran INarasimhan KCao Y. ReAct: Synergizing reasoning and acting in language models[EB/OL].[--].

[4]

Hong SZhuge MChen JZheng X WCheng Y HWang J LZhang C YYau SLin Z JZhou L Y. MetaGPTMeta programming for a multi-agent collaborative framework [C]. In: The Twelfth International Conference on Learning Representations. Vienna: International Conference on Learning Representations, 2024: 23247-23275

[5]

Lin QXu LWu SMao RWang CFeng HHuang BDu Z. GeoAgentA hierarchical LLM-based multi-agent architecture for autonomous spatial analysis [J]. International Journal of Geographical Information Science2026: 1-40

[6]

Wei JWang X ZSchuurmans DBosma MIchter BXia FChi E HLe Q VZhou D N. Chain-of-thought prompting elicits reasoning in large language models [C]. In: Advances in Neural Information Processing Systems. Red Hook: Curran Associates, 202235: 24824-24837

[7]

Lewis PPerez EPiktus APetroni FKarpukhin VGoyal NKüttler HLewis MYih W TRocktäschel TRiedel SKiela D. Retrieval-augmented generation for knowledge-intensive NLP tasks [C]. In: Advances in Neural Information Processing Systems. Red Hook: Curran Associates, 202033: 9459-9474

[8]

Madaan ATandon NGupta PHallinan SGao L YWiegreffe SAlon UDziri NPrabhumoye SYang Y MGupta SMajumder B PHermann KWelleck SYazdanbakhsh AClark P. Self-refineIterative refinement with self-feedback [C]. In: Advances in Neural Information Processing Systems. Red Hook: Curran Associates, 202336: 46534-46594

[9]

Tonmoy S M IZaman S M MJain VRani ARawte VChadha ADas A. A comprehensive survey of hallucination mitigation techniques in large language models[EB/OL].[--].

[10]

Ji Z WLee NFrieske RYu T ZSu DXu YIshii EBang Y JMadatto AFung P. Survey of hallucination in natural language generation[J]. ACM Computing Surveys202355(12): 1-38

[11]

Pan YSun J XYu H FLuck JBai GChamara NGe Y FAwada T. Building multi-agent copilot towards autonomous agricultural data management and analysis[C]. In: 2024 IEEE International Conference on Big Data. Washington DC: Institute of Electrical and Electronics Engineers, 2024: 4384-4393

[12]

Hu E JShen Y LWallis PAllen-Zhu ZLi Y ZWang SWang LChen W Z. LoRALow-rank adaptation of large language models [EB/OL].[--].

[13]

Hinton GVinyals ODean J. Distilling the knowledge in a neural network[EB/OL].[--].

[14]

Zhu X YLi JLiu YMa CWang W P. A survey on model compression for large language models[J]. Transactions of the Association for Computational Linguistics202412: 1556-1577

[15]

Colvin S. Pydantic: Data validation using Python type hints[CP/OL].[--].

[16]

Gorelick NHancher MDixon MIlyushchenko SThau DMoore R. Google Earth EnginePlanetary-scale geospatial analysis for everyone [J]. Remote Sensing of Environment2017202: 18-27

[17]

Wu C YGan Y KGe Y XLu Z YWang J HFeng YShan YLuo P. LLaMA Pro: Progressive LLaMA with block expansion[C].In: Proceedings of the 62nd Annual Meeting of the Association for Computational Linguistics (Volume 1: )Long Papers. Bangkok: Association for Computational Linguistics, 2024: 6518-6537.

[18]

Grattafiori ADubey AJauhri APandey AKadian AAl-Dahle ALetman AMathur ASchelten AYang AFan AGoyal AHartshorn AYang AMitra ASravankumar AKorenev AHinsvark ARao AZhang ARodriguez AGregerson ASpataru ARoziere BBiron BTang BChern BCaucheteux CNelli CFerraton CGibson CZheng CBoerner CChauhan CMarra CMcConnell CKeller CTouret CWu CWong CFerrer C CNikolaidis CAllonsius DSong DPintz DLivshits DEsiobu DChoudhary DMahajan DGarcia DDunbar DEverett DGhosh DEllsworth DNi ETestuggine EDavid EFerrara ETrinkle ECheng EReiter EZelingher ESilva FGonguet FMetri FGholamalinezhad FRecovery GMousavi GAghajanyan GBehram GChabot GHan GGill GGirdhar GGhosh GMehar GTessler GVasquez GEthiraj GYazdan HPatil HWan HLi HTouvron HSeide H IAntoniadis IKhong IGilaberte JAshar JSilverman JLam JCosgrove JCoaplen JBraude JCheng JXu JLi JNgang JKe JWang JBhosale S. The Llama 3 herd of models[EB/OL].[--].

[19]

Chen J LXiao S TZhang P TLuo KLian D FLiu Z. BGE M3-embeddingMulti-lingualmulti-functionalitymulti-granularity text embeddings through self-knowledge distillation [C].In: Findings of the Association for Computational Linguistics: ACL 2024. Bangkok: Association for Computational Linguistics, 2024: 2318-2335

[20]

Johnson JDouze MJégou H. Billion-scale similarity search with GPUs[J]. IEEE Transactions on Big Data20197(3): 535-547

[21]

Bhuyan B PRamdane-Cherif ATomar RSingh T P. Neuro-symbolic artificial intelligenceA survey [J]. Neural Computing and Applications202436(21): 12809-12844

基金资助

天空地众源遥感数据时空谱融合与智能解析系统研发及应用(2025AB065)

农业人工智能与智慧生产重点实验室(2026PT02)

棉花智慧管销服务关键技术及平台研发应用(QS2025005)

AI Summary AI Mindmap
PDF (1950KB)

2

访问

0

被引

详细

导航
相关文章

AI思维导图

/