首页 / 资讯中心 / 文章详情

自然语言输入、语义航迹表示与LLM推理:使海事信息交换模型可处理

自然语言输入、语义航迹表示与LLM推理:使海事信息交换模型可处理 ★ FEATURED ARTICLE
大家读完觉得有帮助记得关注和点赞摘要我们描述一种实用架构利用当前大语言模型LLM技术使海事信息交换模型MIEM以及更广泛的丰富语义航迹Rich Semantic Track模型变得可处理。语义航迹模型在国防和执法领域被采用的障碍在于要求操作员学习形式本体语言并将观察手动编码为类型化逻辑断言。我们提出彻底消除这一障碍操作员用自然语言贡献观察LLM将这些观察翻译为类型化语义断言记录Semantic Assertion Records, SARSAR是命名案例框架在单一紧凑结构中捕捉n元关系知识图谱累积SAR第二个LLM遍在图上执行推理、异常检测和假设排序。我们详细研究两个例子一个9/11时代攻击前指标场景一个海事货物检查场景展示从自然语言输入到SAR表示再到推理输出的完整流水线。我们认为该架构使航迹模型和MIEM可用当前技术立即部署针对该方法的专有圈占建立了在先技术并将该方法置于连接语义航迹表示与神经流形几何的理论框架中。索引词——知识表示语义航迹模型大语言模型案例框架知识图谱海事领域感知异常检测信息融合在先技术披露1. 引言《航迹的丰富语义模型》[1]和《海事信息交换模型MIEM》[2]建立了一个形式框架用于在异构机构和传感器系统之间共享关于动态实体——船舶、人员、车辆、货物——的信念。航迹模型的形式语义基础在Blais的博士论文[9]中得到进一步发展和扩展该论文考察了共同的语义航迹本体如何能够在指挥控制、建模仿真和机器人自主系统之间实现互操作。其核心洞见是航迹不是数据库记录而是语义断言的文件夹类型化关系表达在给定时间关于某个实体已知、相信或推断的内容。多个机构可以贡献并查询同一航迹而不需要模式级集成只要它们对断言类型共享商定的语义。采用的障碍是实践性的形式本体语言OWL、RDF、SPARQL需要操作分析师不具备的专门知识手动编码的开销使实时使用不可行。该框架在架构上是合理的但在操作上不可访问。两项发展消除了这一障碍。第一大语言模型LLM现在能够以高可靠性将自然语言观察描述翻译为结构化语义表示。第二Palantir和微软GraphRAG系统[3]中本体驱动AI的商业成功验证了核心架构赌注知识图谱上的类型化关系断言能够实现多跳推理和异常检测这是纯向量相似性搜索无法实现的在复杂查询上有文档记录的40%性能提升。Palantir围绕这一原则建立了价值数十亿美元的企业[8]将现实世界实体、关系和动作表示为语义类型化知识图谱然后使用该图谱在政府情报、国防和商业客户中驱动人类和AI辅助决策。一个占主导地位的商业平台已证明该方法在操作环境中可扩展且有利可图这提供了强有力的经验证据表明该方法在实验室之外也有效。本文描述一种架构将这两项发展与航迹模型和MIEM框架结合起来研究两个详细例子展示完整流水线并将该方法作为在先技术发布。2. 架构该流水线有四个阶段。2.1 自然语言输入操作员以任何可用的自然语言贡献观察语音转录、自由文本报告、翻译的外语信号、手势转文本、结构化数据库导出。不需要形式语言培训。LLM接受所有这些输入。2.2 LLM翻译为SAR第一个LLM遍将每个自然语言输入翻译为一个或多个语义断言记录SAR。SAR是命名案例框架一组命名槽:值对分组在标识所断言事件、状态或关系种类的框架名称下。底层表示起源于作者1974年博士论文[10]并在后续期刊文章《结构化模式的统一表示及偶然响应规则归纳算法》Information and Control, 33(2): 87–116, 1977[11]中充分发展该文引入了PSR参数化结构表示作为符号表示和从例子中机器学习的共同基础。现在的名称SAR去掉了“参数化”因为原始表述允许槽填充符是支持模式匹配和泛化的变量在当前应用中每个槽都用确定值填充因此变量机制不必要。命名槽是关键设计选择因为每个槽带有显式名称顺序无关新槽类型只需命名并向LLM提供例子即可引入。这种表示相对于简单二元三元组有重要优势。自然语言关系本质上是n元的“货物X在时间T由代理A在港口Z装载到船舶Y上”同时涉及五个参与者。二元三元组一次只能表达两个迫使同一事件被碎片化为多个断言然后再通过推理重新链接。案例框架将整个事件捕捉为单个命名单元。SAR的一般形式是{ FrameName: frame_type, Slot1: value1, Slot2: value2, ... } // confidence, source, timestamp on the whole frame例如货物装载事件变为{ FrameName: CargoLoading, Cargo: Crate_XYZ447, Vessel: MV_Meridian, Port: Barcelona, Time: 2026-03-14T08:30Z, Agent: DockworkerCrew_B, SealStatus: Intact }这是紧凑的、语义显式的、无序的槽不需要按固定顺序列出并且完整的整个情境是一个断言。时效性只是另一个槽。随着监视能力提高和新数据类型可用新槽类型被添加到现有框架定义中而不需要重构表示。二元三元组总是可以表达为退化的双槽框架因此案例框架模型是严格泛化。第3节中的词汇以框架记法表达每个框架类型枚举其规范槽并注明哪些是必需的、哪些是可选的。SAR结构扎根于语言运作方式。Fillmore的格语法[13]确立动词和事件名词将其参与者组织为命名语义角色——施事、受事、位置、工具、时间——并且这些角色在语法表层形式中保持一致。Lakoff和Johnson[12]将其扩展表明这些角色类别具有原型结构中心范例具有渐变的、模糊的边缘而不是必要充分条件。LLM在人类语言上训练已内化这两项发现。当给定“Ahmad周二在巴塞罗那将板条箱装上船”时LLM无需指示即可识别所有五个参与者及其角色。SAR格式使这种隐式能力显式且可存储。每个槽名指定一个习得的经验维度。在训练语言模型的神经几何中每个命名角色——施事、港口、嫌疑人、目的地——对应一个流形表示空间中被模型训练期间在该角色中遇到的一切所塑造的区域。可接受地占据槽的填充符聚集在该区域中形成模糊吸引子。新实体落在现有聚类足够近时被接纳类别无需显式维护即可扩展。这就是词汇随着世界变化而增长的方式。异常检测直接随之而来。落在其槽吸引子之外的填充符——一个只询问起飞和燃料、从不询问降落的飞行学员声明内容与其标记来源矛盾的货物——是几何离群点。LLM标记它不是因为人类写了规则而是因为鉴于训练中学到的一切该模式对该角色而言不可信。这是第6节所述跨SAR检测背后的机制。关键的是操作员不需要看到或与SAR层交互。他们自然地说或输入LLM处理编码为每个框架分配置信度并记录来源和时间戳。模糊输入生成多个低置信度SAR而不是单个高置信度SAR。这是相对于先前语义航迹系统的关键操作进步。2.3 知识图谱累积SAR存储在轻量类型化知识图谱中Neo4j、AWS Neptune或等效物。每个节点是类型化实体每个框架存储为超边或具体化节点连接其所有参与者保留n元结构而不强制将其变为二元边。与每个框架关联的是其置信度值、来源和时间戳。多个来源贡献关于同一实体的观察通过标准身份解析步骤合并询问LLM给定所有可用识别属性两个实体描述是否可能指同一个人。不确定身份被显式表示为概率合并而不是强制二元决策这是区分该方法与Palantir等假设已知身份对象的商业系统的关键能力。2.4 LLM推理与假设排序第二个LLM遍在累积图上执行推理。给定查询如“该观察最可能的解释是什么”或“我们应首先调查哪些假设”LLM遍历知识图谱识别相关SAR聚类并生成带相关置信度估计和建议下一步观察的排序假设列表。LLM在世界知识上的训练提供了背景推理规则武器前体、攻击模式、走私特征这些规则是形式规则系统需要领域专家手动编码的。异常检测是自动的LLM标记相对于其训练分布统计上不寻常的SAR模式这正是流形理论文献[4]中描述的跨流形干涉匹配。适时有价值信息VIRT[5]支配输出。VIRT是这样一种原则并非所有信息都同样有用重要的是改变你相信什么以及因此下一步该做什么的信息。系统只呈现将分析师当前最佳假设推移超过指定阈值的观察抑制常规确认数据。高价值输出是那些实质改变假设概率分布的输出。3. 核心SAR框架词汇以下词汇定义了国防、执法和海事跟踪用例的规范SAR框架类型。每个框架类型由名称和一组命名槽标识。槽名很重要它们标识每个填充符扮演什么角色因此框架是自描述的且顺序无关。读者或推理系统永远不需要从列表位置推断含义。下面词汇中的每个槽都标记以指示是否必须存在。记法很简单(R)表示槽是必需的——没有该槽的至少一个填充符该框架类型的SAR不完整。(O)表示槽是可选的——当信息不可用或尚未观察到时它可以有零个填充符。当可选槽没有填充符时它根本不出现在存储框架中。当槽有多个填充符时例如TravelHistory框架记录访问多个国家每个填充符单独存储在同一命名槽下。新框架类型和现有框架上的新槽可以随时添加只需命名它们并向LLM提供一两个例子。二元断言主语-关系-宾语三元组是双槽框架与该表示完全兼容。3.1 实体类型Person人员、Vessel船舶、Vehicle车辆、Aircraft航空器、Cargo货物、Location地点、Organization组织、Document文件、Communication通信、Event事件、Capability能力、Vulnerability脆弱性、Financial_Account金融账户3.2 核心框架类型以下条目使用紧凑简写。简单双参与者关系即双槽框架为可读性以传统(Entity, relation, Entity)形式显示。多参与者框架类型以完整槽记法显示。两种形式在知识图谱中都作为命名框架相同存储。简写(x, relation, y)等价于{ FrameName: relation, Subject: x, Object: y }。身份与关联(x, is_alias_of, y)(x, is_member_of, y)(x, is_associated_with, y) // 较弱无向(x, has_document, y) // 护照、签证、舱单位置与移动{ FrameName: Movement, Entity(R): entity_id, From(O): location, To(O): location, DepartTime(O): timestamp, ArriveTime(O): timestamp, Mode(O): foot|vehicle|vessel|air, Source(O): source_id, ObservedBy(O): sensor_or_witness }// n元替代was_at / departed_from / arrived_at 支持 transit-time plausibility checks(x, departed_from, location, time)(x, arrived_at, location, time)(x, is_currently_at, location)(x, is_missing_from, location, time)占有与交易(x, owns, y)(x, purchased, y, location, time)(x, shipped, y, origin, destination){ FrameName: CargoLoading, Cargo(R): cargo_id, Vessel(R): vessel_id, Port(R): location, Time(R): timestamp, Agent(O): person_or_org, SealStatus(O): intact|tampered|missing, Manifest(O): doc_ref }// n元替代(x, loaded_onto, y, location, time)(x, contains, y) // 声称的或验证的(x, seal_status, tampered|intact|missing) // 带时间戳训练与能力(x, trained_in, skill)(x, has_capability, y)(x, sought_training_in, y)威胁评估(x, { FrameName: TargetOfInterest, Entity(R): entity_id, Agency(R): agency_id, Confidence(R): 0.0–1.0, Basis(O): reason_text, DateFlagged(O): timestamp })(x, has_vulnerability, y)(x, could_cause, y) // 能力到伤害的断言(x, { FrameName: FlaggedEntity, Entity(R): entity_id, FlaggedBy(R): source_id, Reason(R): reason_text, Confidence(R): 0.0–1.0, Date(O): timestamp })(x, { FrameName: RiskAssessment, Subject(R): entity_id, RiskLevel(R): low|medium|high|critical, Basis(R): reason_text, Confidence(O): 0.0–1.0, Date(O): timestamp })推理输出(hypothesis_H, probability, p) // 当前证据下对H的置信度可带[lower, upper]边界(observation_O, would_confirm, hypothesis_H) // 确认的期望值(observation_O, would_refute, hypothesis_H)在这些框架中p是假设的置信度值不是频率或硬概率。它表达当前证据体在多大程度上支持一种解释而非竞争替代方案。每个假设都有对手确认一个脆弱预测一个很容易有其他结果的预测的证据提高p而否证证据降低p。因为证据往往不完整或质量不确定p最好理解为具有启发式下界和上界而不是单一精确数字。这些边界随着更多证据累积而收窄并可以通过在过往案例结果上训练而改进。4. 例1攻击前指标检测该例子说明该架构如何从单独看似无害的观察中浮现危险模式。4.1 自然语言输入来自多个来源跨越数月来源AFBI外勤办公室“Mohamed Atta在佛罗里达注册商业飞行培训。他和两名同伙只对起飞和巡航程序感兴趣不对降落感兴趣。”来源BCIA“Atta是汉堡基地组织小组的已知同伙。旅行史包括巴基斯坦和阿富汗。”来源CINS“Atta持旅游签证进入美国。签证状态与长期飞行培训注册不一致。”来源D飞行学校教员“学生特别询问大型商业飞机的载重能力和巡航高度燃料量。”4.2 SAR表示LLM生成(Atta_M, enrolled_in, Commercial_Flight_Training_Florida)(Atta_M, sought_training_in, Takeoff_Cruise_Only)(Atta_M, did_not_seek_training_in, Landing_Procedures) // 异常遗漏(Atta_M, is_associated_with, AlQaeda_Hamburg_Cell)(Atta_M, traveled_to, Pakistan_Afghanistan_2001) // 简写完整形式{ FrameName: TravelHistory, Traveler: Atta_M, Destinations: [Pakistan, Afghanistan], Period: 2000–2001, Purpose: Unknown }(Atta_M, entered_US_on, Tourist_Visa)(Tourist_Visa, is_inconsistent_with, Extended_Commercial_Training)(Atta_M, queried_about, Large_Aircraft_Load_Capacity)(Atta_M, queried_about, Fuel_Quantity_At_Cruise)(Large_Aircraft, has_capability, Mass_Casualty_Weapon_If_Weaponized)(Fuel_At_Cruise, has_capability, Incendiary_Effect_On_Impact)4.3 推理输出LLM假设排序向LLM查询“该SAR聚类最可能的解释是什么哪些观察最会加强或反驳主要假设”LLM回应转述假设H1概率0.72Atta正计划将商业飞机用作武器。一致的SAR部分飞行训练单程任务不需要降落、燃料量兴趣最大化燃烧效果、大型飞机兴趣最大化影响、基地组织关联组织能力、签证异常秘密长期停留。假设H2概率0.15Atta正在为未来不涉及飞行的行动进行侦察。部分训练可能是掩护。假设H3概率0.13良性解释兴趣改变退出训练。最有价值的下一步观察按预期假设偏移进行VIRT排序确认或否认同伙是否有类似的部分训练模式。确认会将H1提高到约0.91。检查Atta或同伙是否购买了机票。大型飞机上的单程票将接近决定性。验证财务支持结构。向美国账户的外国电汇将加强H1。该架构浮现H1不是因为任何单一断言令人警觉而是因为跨SAR模式部分训练燃料兴趣基地组织关联签证异常构成高度不寻常的交集。LLM在世界知识上的训练提供了推理规则这种组合与飞机武器化规划相关。5. 例2海事货物事件该例子展示架构应用于实时多机构海事安全事件。场景一个航运集装箱在巴塞罗那装载并加封运往南卡罗来纳州查尔斯顿船名MV Meridian。当美国海关在船只接近港口时登船他们发现集装箱封条被篡改一个板条箱丢失。在船只接近与发现丢失板条箱之间一名叙利亚船员不知何故离开了船只并到达佛罗里达州杰克逊维尔的一家Home Depot。 incoming情报报告逐片重建这一图景。5.1 自然语言输入数小时内来自多个机构CBP查尔斯顿港“来自MV Meridian的集装箱舱单项cargo-lot 7B原产地巴塞罗那。根据船舶离港记录封条在巴塞罗那装载时完好。CBP登船检查时发现封条被篡改。对照舱单的实际盘点显示一个板条箱丢失。舱单列内容为装饰灯。集装箱此前经过比雷埃夫斯。”海关情报“板条箱XYZ-447来自开罗Luxor Trading。Luxor Trading被国际刑警组织标记为可能的武器采购掩护。”CBP情报“来源ABC报告Luxor Trading可能以装饰品藏匿运输IED组件或小武器。评估低-中置信度。”MV Meridian舱单“MV Meridian是一艘巴拿马旗散货船船员22人。上一港比雷埃夫斯。下一港查尔斯顿ETA 6天。”海岸警卫队“登船时对MV Meridian船员点名显示一名叙利亚船员护照名Tariq Al-Rashid失踪。船只甲板日志表明他在海上时在场但在查尔斯顿锚地时缺席。未出现接受海关处理。离船方式未知。”国际刑警组织“Tariq Al-Rashid有两个已知别名Omar Farouk、Hassan Khalil。所有三个身份都在INTERPOL恐怖主义观察名单上标记。”Chase Bank欺诈警报“以Omar Farouk名义的信用卡20分钟前在佛罗里达州杰克逊维尔Home Depot使用。购买肥料、电线、定时器组件。”Home Depot安保“购买50磅硝酸铵肥料、200英尺电线、数字定时器。付现金信用卡被拒卡被保留。”5.2 SAR表示LLM生成实例化实体MV_MeridianVessel、Crate_XYZ447Cargo、Luxor_Trading_CairoOrganization、Al_Rashid_TPerson、HomeDepot_JacksonvilleLocation、MV_Meridian_Charleston_RouteEvent(Crate_XYZ447, manifest_contents, Decorative_Lamps)(Crate_XYZ447, originated_from, Luxor_Trading_Cairo)(Luxor_Trading_Cairo, flagged_by)// 简写完整形式{ FrameName: FlaggedEntity, Entity: Luxor_Trading_Cairo, FlaggedBy: Interpol, Reason: Weapons_Procurement_Suspicion, Confidence: 0.4, Date: 2024 }(Crate_XYZ447, seal_status)// 简写完整形式{ FrameName: SealInspection, Cargo: Crate_XYZ447, Inspector: CBP_Charleston, Time: 2026-05-15, Status: Tampered }(Crate_XYZ447, inventory_status, Missing_From_Manifest)(Crate_XYZ447, intelligence_assessment)// 简写完整形式{ FrameName: IntelAssessment, Subject: Crate_XYZ447, Assessment: Possible_IED_Components, Source: CBP_Source_ABC, Confidence: 0.35 }(MV_Meridian, is_missing_crewman, Al_Rashid_T)(Al_Rashid_T, has_document, Syrian_Passport_Tariq_Al_Rashid)(Al_Rashid_T, is_alias_of, Omar_Farouk)(Al_Rashid_T, is_alias_of, Hassan_Khalil)(Al_Rashid_T, flagged_by)// 完整形式{ FrameName: FlaggedEntity, Entity: Al_Rashid_T, FlaggedBy: Interpol, Reason: Terrorism_Watch_List, Confidence: 1.0, Date: prior_to_incident }(Omar_Farouk, purchased_at)// 简写完整形式{ FrameName: RetailPurchase, Buyer: Omar_Farouk, Store: HomeDepot_Jacksonville, Time: T−20min, PaymentCard: Declined_Omar_Farouk_Card }(HomeDepot_Jacksonville, purchase_contents)// 简写完整形式{ FrameName: RetailPurchaseItems, Purchase: RetailPurchase_above, Item1: [Ammonium_Nitrate, Qty: 50lb], Item2: [Electrical_Wire, Qty: 200ft], Item3: [Digital_Timers, Qty: unspecified] }(Ammonium_Nitrate, has_capability, IED_Precursor)(Electrical_Wire_And_Timers, has_capability, IED_Detonation_Circuit){ FrameName: VesselRoute, Vessel: MV_Meridian, Destination: Charleston_SC, ETA: T6days, Status: CBP_Hold }(Charleston_SC, has_vulnerability, Major_Port_Infrastructure)5.3 推理输出LLM假设排序查询“最可能的解释是什么应优先采取哪些行动”假设H1概率0.68Al-Rashid在途中比雷埃夫斯或巴塞罗那取走了板条箱板条箱包含IED组件现正由Al-Rashid在杰克逊维尔地区组装。目标查尔斯顿港基础设施或船只。一致的SAR丢失板条箱失踪船员同一船、同一时间IED前体购买板条箱来源和船员两者的国际刑警标记查尔斯顿目的地。假设H2概率0.18板条箱被Al-Rashid或同伙机会主义盗取用于转售IED购买是无关巧合。鉴于两个行为者都有国际刑警标记可能性较低。假设H3概率0.09板条箱移除是船员内部盗窃灯具组件Al-Rashid因无关个人原因擅离。IED购买是巧合。假设H4概率0.05全部良性文书错误、封条故障、误认船员。立即优先行动VIRT排序立即在杰克逊维尔地区地理定位Al-Rashid/Omar Farouk。信用卡尝试已过20分钟他可能仍在该地区。这是最高优先级因为它同时确认H1并实现拦截。检查MV Meridian货舱船只目前在查尔斯顿处于CBP扣留是否有与IED组件一致的残留物。确认痕迹会将H1提高到约0.89。请求比雷埃夫斯港务局CCTV录像查看比雷埃夫斯停靠期间板条箱处理情况。确认Al-Rashid处理过板条箱会大幅提高H1。提醒查尔斯顿港和美国海岸警卫队准备应对船只或港口潜在IED威胁。ETA 6天提供行动窗口。识别并询问在比雷埃夫斯和巴塞罗那停靠期间值班的另外三名船员。SAR表示的价值在于这些推理是显式的LLM可以引用支持每个假设的具体SAR链以及最会改变概率分布的具体观察。这不是关键词搜索。这是语义类型化图上的多跳关系推理。6. 理论基础该架构具有有原则的理论基础将其与神经流形理论[4]和信息价值理论[5]联系起来。早期语义航迹系统使用符号表示手工制作的规则和逻辑语句需要专家编码。这里的方法不同。神经网络包括本流水线核心的LLM不以显式规则存储知识。相反它们将世界的统计结构学习为高维空间中的几何区域流形。语义相似的两个输入在该空间中最终彼此接近很少共现的模式作为离群点突出。SAR图使这些隐式几何关系显式且可查询。在此框架中航迹是跨流形交集吸引子。这里使用的流形是信息空间的结构化区域特定数据源例如旅行记录、金融交易或传感器读数可以合理产生的模式集合。在大量数据上训练的神经网络隐式学习这些区域。稳定的语义结构如感兴趣人员航迹当来自多个独立流传感器数据、情报报告、金融记录、旅行史的一致观察同时收敛于所有这些区域中的同一模式时出现。LLM通过训练学习了这些区域的统计结构通过识别SAR图中的这些收敛结构来识别航迹模式。异常检测由同一框架解释。不寻常的SAR组合部分飞行训练基地组织关联燃料量查询落在正常行为的习得吸引盆之外被标记为假设偏移这在VIRT意义上是高信息价值。系统呈现它正是因为它不符合预期模式而预期模式在LLM权重中编码为SAR框架空间上的流形几何。推荐下一步观察的VIRT排序直接随之而来如果观察通过将当前航迹表示移过吸引子边界而实质改变假设概率分布则该观察具有高价值。落在现有吸引子内的常规确认观察价值低并被抑制。7. 在先技术与实现路径本文为以下组合建立在先技术(1)由LLM将自然语言输入翻译为SAR案例框架(2)使用命名n元案例框架而非二元三元组作为主要断言单元从而能够以时效性和来源作为原生槽紧凑表示复杂事件(3)在类型化知识图谱中累积SAR(4)在图上进行LLM推理和假设排序(5)对不确定身份实体进行概率实体身份解析(6)基于VIRT的推荐下一步观察排序。每个组件单独已知新颖性在于集成及其应用于航迹/MIEM框架。关于该架构出现两个效率问题它能否匹配Palantir级系统的操作性能以及引入n元SAR相对于二元关系是否增加图搜索开销简短答案是能而且几乎不增加。二元关系没有开销。双槽SAR与二元边存储相同对其查询具有相同遍历成本。经典图引擎中的n元SAR产生适度开销。标准存储模式是具体化框架成为命名节点带有一条标记边指向每个填充的槽-值对。任何穿过框架节点的路径花费两跳而不是一跳因此k跳推理链需要2k遍历步骤。与此成本相对的是分组好处分散的二元边承载相同边数但不共享锚节点。框架类型查询一步检索整个事件。生产图数据库中标准的框架类型索引进一步降低常数成本。对于基于LLM的推理n元SAR是有利的。LLM将序列化图摘录与其训练权重进行模式匹配它不算法式遍历边。多槽框架序列化为一个连贯的标记块。等效二元边序列化为多个不连接的行模型必须共同引用并重新整合。框架更紧凑、更立即可解释并保持事件边界显式。与Palantir级系统更广泛的性能对等基于一个结构点。类型化关系系统的效率优势来自命名关系约束多跳搜索空间而不是专有算法。同一SAR图上的LLM具有这些结构约束并添加了编译到其权重中的世界知识这些知识作为即时模式识别而非规则评估触发。例1中的威胁模式推理不需要显式规则跨SAR聚类在一次LLM调用中被识别。代价是概率性而非形式可验证的推理。回报是对分析师未预料到的威胁模式的泛化。[技术说明具体化框架节点处的分支因子等于该激活实例中填充的槽-值对总数而不是模式中槽定义的数量。没有填充符的可选槽不贡献边有多个填充符的槽每个填充符贡献一条边。稀疏框架便宜丰富框架成比例地更贵——与将等效事实存储为二元边相同但增加了分组节点的好处。2k跳开销是唯一结构性代价。]最小演示需要LLM APIGPT-4级或等效图数据库Neo4j或更简单受控SAR框架词汇第3节以及用于翻译和推理步骤的少样本提示集。本文两个例子作为少样本模板。一个熟悉LLM API集成和图数据库的小团队可以在数周内构建工作原型。作者鼓励此类实现并将本文所有材料发布到公共领域。航迹模型和MIEM语义标准记录在[1]和[2]中。第3节中的受控SAR框架词汇无限制发布。本文描述的词汇和流水线架构均不受作者任何专利主张约束。8. 结论语义航迹共享的障碍从来不是概念性的。它是操作性的。不能期望操作员用OWL或SPARQL编码观察。LLM消除了这一障碍它们将自然语言翻译为类型化语义断言将其累积在知识图谱中并对结果执行多跳推理。航迹模型和MIEM提供了使断言有意义、使推理可辩护的语义框架。VIRT提供了使输出可操作而非压倒性的过滤原则。本文两个例子在现实场景中展示了完整流水线。该方法今天可用当前技术实现并作为在先技术发布。在一个充满恶意行为者的世界中我们现在有了共享情报的手段。
阅读完成 · 觉得有帮助?
咨询建站