TOPIC TIMELINE
タイムライン検索
特定トピックに関する記事を時系列で並べて「いつ・何が起きたか」を俯瞰します。
2025年12月11日
エージェントワークフローを用いた生物学実験のプロトコルエラー検出本記事は、2025年夏季インターンシッププログラムで勤務された秋葉凌羽さんによる寄稿です。 はじめに 東京科学大学生命理工学院学士課程3年の秋葉凌羽と申します。PFN の2025年夏インターンシッププログラムに参加し、実 […] 投稿 エージェントワークフローを用いた生物学実験のプロトコルエラー検出 は Preferred Networks Tech Blog に最初に表示されました。
Preferred Networks
2026年5月29日
認知圏論トランスフォーマー:言語モデリングのための圏論的帰納的バイアス認知圏論トランスフォーマー(CCT)は3億600万パラメータのアーキテクチャで、事前学習されたGPT-2 Smallバックボーンを圏論から導出された認知的に根拠のあるコンポーネント、および認知科学からのいくつかのインスピレーションで拡張しています。マッチドステップ・プロトコル下(215,000最適化ステップ)で...
arXiv cs.AI
2026年5月29日
ディベートは弱い審査官がより強いモデルに報酬を与えるのに役立ちます理論的な約束にもかかわらず、スケーラブルな監視プロトコルとしてのディベートは混合した実証結果をもたらしています。いくつかの設定では利益を得ていますが、特に審査官が隠された情報を持たない場合は、他の設定では効果がありません。より強いディベーター・より弱い審査官の設定で提案者批評家ディベートを研究しました。
arXiv cs.CL
2026年5月29日
FormInv: 数学推論ベンチマークにおけるセマンティック不変性の測定プロトコルMathCheck(ICLR 2025)のパラフレーズ品質監査により、129グループ中4つのセマンティック的に不正確なパラフレーズ(3.1%)が検出されました。これらを削除するとGPT-4oはランク2からランク4に低下し、Claude HaikuとDeepSeek V3がそれを上回ります。これらのランク変動は単一モデル評価では見えません。
arXiv cs.LG
2026年6月1日
WHO、コンゴ民主共和国のエボラ出血熱流行を抑制するため地域社会の協力を呼びかけテドロス・アダノム・ゲブレイェスス事務局長がイトゥリ州での遺体処理プロトコルに対する抗議後に訴えかけ。エボラ出血熱の流行を抑制するため、地域社会の協力が求められている。
The Guardian World
2026年6月1日
TraceGraph: エージェント軌跡の診断と改善のための共有決定ランドスケープエージェントベンチマークはますます豊富なインタラクション軌跡を記録していますが、評価では各ロールアウトを合格率または報酬スコアに還元することが多いです。TraceGraphは、リリースされたマルチモデルエージェント軌跡を共有決定ランドスケープに変換するグラフベースのフレームワークを紹介します。
arXiv cs.AI
2026年6月1日
RAG対応のクロスモデル多数決ワークフローを使用したバイオメディカル関連性生成・検証におけるChatGPTの評価プロトコルarXiv:2605.30400v1 ChatGPTが疾患中心のバイオメディカル関連性を生成する能力を評価するためのプロトコルを提示する。バイオメディカルオントロジーを使用して関連性を生成し、生物学的エンティティを検証し、文献を使用して関連性を検証する方法を概説する。プロトコルには自己一貫性戦略が含まれる。
arXiv cs.CL
2026年6月2日
コンゴ民主共和国の医療従事者がエボラ出血熱の治療と安全対策を実施コンゴ民主共和国の医療従事者がエボラ出血熱の患者治療に当たっており、感染防止に向けた安全対策を強化している。同国ではエボラ出血熱の感染事例が確認されており、医療現場での対応が急務となっている。医療従事者は個人防護具の装着や感染管理プロトコルの徹底により、患者の治療と自身の安全確保に取り組んでいるとのこと。国際社会からの支援も受けながら、感染拡大防止に努めている。
BBC News
2026年6月2日
マルチモデルAIシステムにおける創発的協調的熟慮:認識論的統合のためのBFT派生プロトコルビザンチン障害耐性由来のアーキテクチャである「Consilium Protocol」を提示します。このプロトコルは構造化されたマルチモデルAI熟慮を実現し、モデル間の不一致を誤りではなく認識論的信号として扱います。言語モデルに設計された認知的ペルソナを割り当てることで、モデルが何であるかを分離します。
arXiv cs.AI
2026年6月2日
思慮深い選別:マルチエージェント知識ベースのためのプロトコルAIエージェントが孤立したツールから共有知識エコシステムの協力的参加者へと移行する中、集団的知識の選別ガバナンスが重要な課題となっています。人間のプラットフォームガバナンスメカニズムは直接適用できません。エージェントの無ステート性は抑止力ベースの制裁を損なうため。
arXiv cs.AI
2026年6月4日
ウェブサーバーを数秒以内にダウンさせる「HTTP/2 Bomb」攻撃がOpenAIのCodexを使って発見されるセキュリティ研究者がOpenAIの大規模言語モデル「Codex」を活用して、ウェブサーバーを数秒以内にダウンさせることができる「HTTP/2 Bomb」と呼ばれる新型攻撃手法を発見した。この攻撃は、HTTP/2プロトコルの仕様の脆弱性を悪用し、少量のデータで大規模な負荷を生成することが特徴とのこと。AI技術が攻撃検出に貢献する一方で、サイバー攻撃の開発にも利用される可能性が示唆されており、セキュリティ対策の重要性がより高まっている。
はてなブックマーク IT
2026年6月5日
アーサー・ヘイズ氏、HYPEとNEARを売却──AI企業のIPOラッシュを警戒(NADA NEWS)暗号資産(仮想通貨)取引所BitMEX(ビットメックス)の共同創設者であるArthur Hayes(アーサー・ヘイズ)氏は6月4日、ハイパーリキッド(HYPE)とニアプロトコル(NEAR)のトークン保
Yahoo!ニュース IT
2026年6月6日
家庭用PCでも数秒でサーバを“落とせる”、HTTP/2の脆弱性をCodexが発見 さくらインターネットも対策(ITmedia NEWS)セキュリティ企業Codexが、HTTP/2プロトコルに新たな脆弱性を発見しました。この脆弱性を悪用すると、家庭用パソコンからわずか数秒でサーバーをダウンさせることが可能だとのこと。さくらインターネットを含む国内企業も既に対策を講じ始めています。HTTP/2は広く使われているプロトコルであるため、この脆弱性は多くのウェブサービスに影響を及ぼす可能性があり、業界全体での迅速な対応が求められています。
Yahoo!ニュース IT
2026年6月8日
エージェントAI制御評価における攻撃選択は安全性を大幅に低下させるAI制御は、能力の高い信頼できないAIエージェントを、より弱い信頼できるモニターと限定的な人間監査予算の下で展開するための安全性フレームワークである。制御評価は、レッドチーム攻撃ポリシーをブルーチームモニターと対立させることでこれらのプロトコルをストレステストするが、現在の評価は通常、攻撃のタイミングを戦略的に選択しない攻撃者を想定している。本研究は、攻撃決定を攻撃開始時期を決定する開始ポリシーと進行中の攻撃を中止するかどうかを決定する停止ポリシーに分解することで、エージェント設定における攻撃選択能力を研究した。BashArenaとLinuxArenaの2つのエージェント設定において、両ポリシーは基礎となる攻撃能力を変えることなく、測定された経験的安全性を大幅に低下させた。監査予算1%の場合、開始ポリシーはBashArenaとLinuxArenaの両方で安全性を20ポイント削減し、停止ポリシーはBashArenaで20ポイント、LinuxArenaで28ポイント削減した。これらの削減は、攻撃選択の効果の上限として解釈されるべきである。
arXiv cs.AI
2026年6月9日
「NTLM」の廃止、「Kerberos」への移行は第2フェイズへ ~Microsoftが発表(窓の杜)マイクロソフトが古い認証プロトコル「NTLM」の廃止計画を発表し、より安全な「Kerberos」への移行を段階的に進めることを明らかにしました。第2フェイズでは、Windowsシステムにおける認証方式の大規模な転換が予定されています。この移行により、セキュリティ上の脆弱性が減少し、企業のシステムセキュリティが強化されると期待されています。同社は企業ユーザーに対し、段階的な準備を進めるよう推奨しています。
Yahoo!ニュース IT
2026年6月10日
「OpenSSL」に18件のセキュリティ欠陥、修正版が一斉リリース/最大深刻度は「High」、任意コード実行につながる恐れもSSL/TLSプロトコルを実装したオープンソースライブラリ「OpenSSL」の開発チームは6月9日(日本時間)、「OpenSSL」のセキュリティアップデートを実施した。以下のバージョンが利用可能。
窓の杜
2026年6月11日
GitHub Copilot CLIに言語サーバーで真のコードインテリジェンスをGitHub Copilot CLIに言語サーバープロトコル(LSP)サーバーを導入し、設定することで、コード記述の効率とインテリジェンスが大幅に向上するとGitHub Blogで報じられました。 これにより、開発者は従来行っていた「力任せのgrep」や「逆コンパイル」といった、手作業による煩雑なコード解析プロセスから解放されることが期待されます。LSPサーバーは、コードの構造や意味を理解し、リアルタイムで補完、エラー検出、定義へのジャンプといった高度な機能を提供します。 Copilot CLIとLSPサーバーの連携により、開発環境はよりスマートになり、コードの品質向上と開発時間の短縮に貢献する見込みです。この進化は、開発者がより本質的な問題解決に集中できる環境を整えるものとして注目されています。 引用元: GitHub Blog (AI)
GitHub Blog (AI)
2026年6月11日
「OpenSSL」に18件のセキュリティ欠陥、修正版が一斉リリース(窓の杜)SSL/TLSプロトコルを実装したオープンソースライブラリ「OpenSSL」の開発チームは6月9日(日本時間)、「OpenSSL」のセキュリティアップデートを実施した。以下のバージョンが利用可能。
Yahoo!ニュース IT
2026年6月11日
BioDivergence: 医療抄録における隠れた文脈的矛盾のためのベンチマークと評価フレームワークarXiv:2606.11208v1 新規発表 要旨: 医療分野の研究結果は、しばしば研究間で矛盾しているように見えますが、これらの違いの多くは真の矛盾というよりは文脈に依存しています。コホート、地域、アッセイプロトコル、疾患サブタイプ、臨床設定のバリエーションにより、両方の主張が局所的に有効になる可能性があります。既存のNLI(自然言語推論)および科学的言明検証ベンチマークは、このようなケースを包含、矛盾、または中立に還元しており、分岐の背後にある文脈構造を捉えることができていません。これに対処するため、6クラスの矛盾分類、13軸の分岐オントロジー、および各言明ペアに対する4つの構造化出力(矛盾タイプ、分岐軸、主要な交絡因子、および和解説明)を備えた評価フレームワークであるBioDivergenceを導入します。5つの医療分野にわたる11,865の言明ペアの、記事非重複シルバーベンチマークであるBioDivergence-Silver-v1.0を、比較のためのレガシー重複排除バリアントとともにリリースします。
arXiv cs.CL
2026年6月17日
Microsoft、長時間かかるタスクを委任できる「Copilot Cowork」を一般提供。マルチモデル対応やコスト管理を追加Microsoftは2026年6月16日、Microsoft 365 Copilot向けのエージェント機能「Copilot Cowork」を一般提供すると発表した。
gihyo.jp
2026年6月18日
「ナチュン」の都留泰作が描く海洋SF「プロトコル・リュウグウ」月刊ヤンマガで都留泰作の新連載「プロトコル・リュウグウ」が、本日6月18日発売の月刊ヤングマガジン7号(講談社)でスタートした。
コミックナタリー
2026年6月19日
MosaicLeaks: あなたの研究エージェントは秘密を守れるか?「MosaicLeaks」がこの度、AI研究エージェントが機密情報をどれだけ適切に保持できるかについて分析を発表しました。この分析では、データ漏洩の潜在的なリスクと、それに対する効果的な防止策が主要な議題となっています。 今日のデジタル化された世界において、研究活動ではしばしば極めて機密性の高い情報が扱われます。このような背景の中、AIエージェントが情報を処理する際に、意図せずともデータが外部に流出する可能性が指摘されています。MosaicLeaksは、このリスクを最小限に抑えるための技術的および運用上の対策の重要性を強調しており、強固なセキュリティプロトコルの確立が不可欠であると結論付けています。 この分析は、機密情報を扱うあらゆる組織にとって、AI技術の導入を検討する上で重要な指針となるでしょう。セキュリティ対策の徹底が、情報漏洩を防ぎ、信頼性を維持するための鍵となります。 引用元: Hugging Face
Hugging Face
2026年6月19日
拡散言語モデル:実験的分析大規模言語モデル(LLM)は、自己回帰的生成によって言語モデリングに革命をもたらし、幅広いタスクで高いパフォーマンスを実現しました。最近、拡散言語モデル(DLM)は、次トークン予測ではなく反復的なノイズ除去を通じてテキストを生成する代替パラダイムとして登場し、シーケンス全体の並列的な洗練を可能にしました。多数の拡散ベースのアーキテクチャが提案されていますが、評価プロトコル、データセット、推論予算、生成ハイパーパラメータの違いにより、それらの能力を比較し、提供されるトレードオフを理解することが困難になっています。本研究では、最新のDLMの体系的な実験的分析を提示します。具体的には、推論、コーディング、翻訳、知識、構造化問題解決を網羅する8つのベンチマークで8つの最先端DLMを評価し、生成品質と計算効率の両方を明確に考慮します。下流タスクの評価を超えて、ノイズ除去ステップ、コンテキスト長、ブロックサイズ、並列アンマスキング戦略を含む、推論時間における主要因子の影響を分析し、大規模な実験を、同一条件下でトレーニングされた小規模モデルの制御された比較によって補完します。
arXiv cs.AI
2026年6月22日
AWS、CloudFrontとWAFにCoinbaseのx402を統合──AIエージェントへのコンテンツ課金が「ブロック」から「課金」へ【MCB FinTechカタログ通信】(NADA NEWS)2026年6月15日、Amazon Web Services(AWS)が、コンテンツ配信サービスのCloudFrontとセキュリティ機能のAWS WAFに、Coinbaseが開発する決済プロトコル「x
Yahoo!ニュース IT
2026年6月23日
Sakana、新Fuguマルチモデルで最先端性能を達成、Claude Fable 5不要AIスタートアップSakanaは、AIエージェント連携システム「Fugu」の最新版を発表しました。この新モデルは、単一のAPIを通じて、これまで複数の最先端AIモデルを組み合わせなければ到達できなかったレベルの性能を実現するとされています。Sakanaは、Fuguが複雑なタスクを効率的に実行し、AI開発における新たな基準を打ち立てる可能性を秘めていると説明しています。従来のシステムではClaude Fable 5のような特定の高性能モデルに依存する必要がありましたが、Fuguはこれを不要にし、より汎用性の高いソリューションを提供することを目指しています。この技術革新は、AIアプリケーションの開発と展開に大きな影響を与えることが期待されます。 VentureBeat AI
VentureBeat AI
2026年6月23日
AI-SDLCプロセス仕様:人間とエージェントの境界のためのプロトコル言語AIエージェントは現在、ソフトウェア開発ライフサイクル全体でファーストクラスのチームメンバーとして参加していますが、このコラボレーションに必要な人間とエージェントの責任境界、承認ゲート、ガバナンス制約を表現するための仕様言語は存在しません。既存のアプローチは、プロンプト(ドリフトの影響を受ける)にプロセスをエンコードしたり、隣接ドメイン(ワークフロー管理、ビジネスプロセス)を対象としたり、断片(アクセス制御、承認ゲート)のみを扱ったりしています。本稿では、AI-SDLCプロセスをプロトコルとして指定するためのドメイン固有言語を提案します。これには、正式な構文、整形式条件、操作セマンティクス、および強制不変量が含まれます。この言語は、ポリシー(宣言された意図)とメカニズム(構造的強制)を区別し、実装が検証トークンや機能境界などのプリミティブを通じてプロセスの非決定性を制限できるようにします。3つの結果が得られます。
arXiv cs.AI
2026年6月23日
PEAR: 順列等変適応ルーティングマルチエージェントディベートマルチエージェントディベートは、反復的なピアレビューを通じて大規模言語モデル(LLM)の信頼性を向上させます。しかし、固定トポロジーはしばしば永続的な位置バイアスを導入し、信頼性の低いエージェントを増幅させ、役割割り当てへの高い感度を引き起こします。本稿では、推論時に通信役割とスパーストポロジーを連続的なディベートラウンド間で動的に再構成する推論時間プロトコル、Permutation-Equivariant Adaptive Routing Multi-Agent Debate (PEAR) を紹介します。進化するエージェントの状態に基づいて戦略的にエージェントから役割への割り当てを切り替えることで、PEARはエージェントが特権的なネットワーク位置を永続的に占めることを防ぎ、またはディベート全体にわたって影響力をより均等に分散させます。PEARを同変スパースルーターとして理論的に特徴付けます。これは、エージェントの再ラベリング下での精度を維持しつつ、ルーティング複雑性を低減し、汎化性能を向上させます。
arXiv cs.AI
2026年6月24日
統一基準:テュービンゲンにおける二変量因果方向性の同一手法による再評価、パラメータフリー圧縮ベースライン付きテュービンゲン因果ペアのヘッドライン精度は、各手法が著者独自のプロトコル(異なるペアサブセット、重み付け、モデル選択、決定率)で測定されているにもかかわらず、論文間で日常的に比較されています。我々はこれが誤った比較であると主張し、正しい比較を実行します。すなわち、あらゆる手法を我々が同一の102ペアで実行し、厳密な1つのルール(チューニングなし、全ペアでの決定強制)を適用した同一手法による再評価です。明確な基準点として、我々は意図的に最小限のベースライン「ソート条件付き圧縮」を導入します。これは、量子化されソートされた差分データを汎用圧縮器(bz2)に入力し、調整可能なパラメータはゼロです。統一基準の下では、ランキングは文献とは大きく異なります。我々のベースラインは74.7%の加重精度(p = 3.7e-7)に達し、SLOPEが評価されるのと同じ100ペアでは76.0%を記録しました。これは著者自身の強制決定SLOPE(77.2%)より1.2ポイント低く、ノイズの範囲内です(McNemar p = 0.39)。
arXiv cs.LG
2026年6月24日
フランス、コンゴ民主共和国からの帰還医者で初のエボラ出血熱症例を確認患者は隔離され、フランスでの感染拡大リスクを防ぐため、厳格なバイオセーフティプロトコルに従っている。
Al Jazeera English
2026年6月26日
再構築ではなく改修を:レガシーエンタープライズサービスを変革するエージェントティックオーバーレイAWSと著者による技術的協力のもと、実用的なソリューションであるエージェントティックオーバーレイを発表します。エージェントティックオーバーレイは、従来のRESTベースのサービスを、A2A(アプリケーション間連携)に参加できるエージェントに変革する薄いラッパー層です。また、REST APIをモデルコンテキストプロトコル(MCP)と互換性のあるツールとして公開します。
AWS Machine Learning Blog